whisper语音转文字及其视频配置中英文字幕应用

发布时间:2026/7/30 10:52:05

whisper语音转文字及其视频配置中英文字幕应用 Whisper语音转文字及其视频配置中英文字幕应用一、Whisper模型原理深度剖析OpenAI 的 Whisper 是一个基于深度学习的通用语音识别系统它采用Encoder-Decoder Transformer 架构在 68 万小时多语言、多任务监督数据上训练而成。其核心创新在于-多任务统一框架同一模型支持语音识别ASR、语言识别、语音翻译如英语转其他语言和时间戳预测-多语言预训练覆盖 96 种语言跨语言迁移能力强-鲁棒性设计通过大量噪声数据训练在嘈杂环境下表现优异Whisper 的架构分为两个阶段1.Encoder将 80 维 log-Mel 频谱特征编码为 1500 维的隐层表示2.Decoder使用因果自注意力机制基于编码器输出和之前预测的 token 生成文本关键参数解释-language指定输入语言如zh或en可自动检测-task“transcribe”转写或translate翻译-temperature控制生成多样性0 为贪心搜索-compression_ratio_threshold控制输出压缩比防止重复## 二、环境搭建与基础语音转文字### 2.1 环境准备bash# 创建虚拟环境python -m venv whisper_envsource whisper_env/bin/activate # Linux/Mac# 或 whisper_env\Scripts\activate # Windows# 安装依赖pip install openai-whisper ffmpeg-python### 2.2 基础语音转文字示例pythonimport whisper# 加载模型可选tiny, base, small, medium, large-v3# 模型越大精度越高但速度越慢model whisper.load_model(base) # 约 1.4GB# 转写音频文件def transcribe_audio(audio_path: str, language: str zh) - dict: 将音频文件转写为文字 Args: audio_path: 音频文件路径支持 mp3, wav, m4a 等格式 language: 指定语言None 为自动检测 Returns: 包含文本、分段、语言等信息的字典 result model.transcribe( audioaudio_path, languagelanguage, # 指定语言如 zh, en tasktranscribe, # transcribe 或 translate verboseFalse, # 是否显示详细进度 temperature0.0, # 贪心搜索生成确定性结果 compression_ratio_threshold2.4, # 防止重复输出 condition_on_previous_textFalse # 不依赖前文减少幻觉 ) return result# 使用示例if __name__ __main__: # 假设有一个中文语音文件 result transcribe_audio(meeting_audio.mp3, languagezh) print(f检测语言: {result[language]}) print(f完整文本: {result[text]}) # 输出带时间戳的段落 for segment in result[segments]: start segment[start] end segment[end] text segment[text] print(f[{start:.2f}s - {end:.2f}s] {text})## 三、视频字幕生成与中英双语配置### 3.1 从视频提取音频并生成字幕pythonimport whisperimport ffmpegimport osfrom datetime import timedeltadef extract_audio_from_video(video_path: str, audio_path: str temp_audio.wav): 使用 ffmpeg 从视频中提取音频 Args: video_path: 输入视频路径 audio_path: 输出音频路径 ( ffmpeg .input(video_path) .output(audio_path, acodecpcm_s16le, ac1, ar16000) .overwrite_output() .run(quietTrue) ) return audio_pathdef generate_srt(video_path: str, output_srt: str, language: str zh): 为视频生成 SRT 格式字幕文件 Args: video_path: 输入视频路径 output_srt: 输出 SRT 文件路径 language: 字幕语言代码 # 提取音频 audio_path extract_audio_from_video(video_path) # 加载模型 model whisper.load_model(small) # 速度和精度平衡 # 转写 result model.transcribe(audio_path, languagelanguage, tasktranscribe) # 生成 SRT 内容 srt_content [] for i, segment in enumerate(result[segments], 1): start segment[start] end segment[end] text segment[text].strip() # 格式化时间戳为 SRT 格式 (HH:MM:SS,mmm) start_time str(timedelta(secondsstart))[:-3].replace(., ,) end_time str(timedelta(secondsend))[:-3].replace(., ,) srt_content.append(f{i}) srt_content.append(f{start_time} -- {end_time}) srt_content.append(text) srt_content.append() # 写入 SRT 文件 with open(output_srt, w, encodingutf-8) as f: f.write(\n.join(srt_content)) # 清理临时音频文件 if os.path.exists(audio_path): os.remove(audio_path) return output_srt# 使用示例if __name__ __main__: # 为中文视频生成中文字幕 srt_file generate_srt(lecture_video.mp4, chinese_subtitles.srt, languagezh) print(f字幕已生成: {srt_file})### 3.2 中英双语字幕生成pythondef generate_bilingual_srt(video_path: str, output_srt: str): 生成中英双语字幕上方中文下方英文 Args: video_path: 输入视频路径 output_srt: 输出 SRT 文件路径 # 提取音频 audio_path extract_audio_from_video(video_path) # 加载大型模型以获得更好质量 model whisper.load_model(medium) # 中文转写 zh_result model.transcribe( audio_path, languagezh, tasktranscribe, temperature0.0, condition_on_previous_textFalse ) # 英文翻译从中文翻译为英文 en_result model.transcribe( audio_path, languagezh, tasktranslate, # 自动翻译为英语 temperature0.0, condition_on_previous_textFalse ) # 合并为双语字幕 srt_content [] for i, (zh_seg, en_seg) in enumerate(zip(zh_result[segments], en_result[segments]), 1): start zh_seg[start] end zh_seg[end] zh_text zh_seg[text].strip() en_text en_seg[text].strip() # 时间戳格式化 start_time str(timedelta(secondsstart))[:-3].replace(., ,) end_time str(timedelta(secondsend))[:-3].replace(., ,) # 双行字幕第一行中文第二行英文 srt_content.append(f{i}) srt_content.append(f{start_time} -- {end_time}) srt_content.append(f{zh_text}) srt_content.append(f{en_text}) srt_content.append() with open(output_srt, w, encodingutf-8) as f: f.write(\n.join(srt_content)) # 清理临时文件 if os.path.exists(audio_path): os.remove(audio_path) return output_srt# 高级配置使用 FFmpeg 嵌入字幕到视频def burn_subtitles_to_video(video_path: str, srt_path: str, output_path: str): 将字幕硬编码到视频中永久嵌入 Args: video_path: 源视频路径 srt_path: SRT 字幕文件路径 output_path: 输出视频路径 ( ffmpeg .input(video_path) .output( output_path, vffsubtitles{srt_path}:force_styleFontNameSimHei,FontSize16,PrimaryColourH00FFFFFF,OutlineColourH00000000,BorderStyle3,Outline1,Shadow1, acodeccopy # 保持音频不变 ) .overwrite_output() .run(quietTrue) ) return output_path# 使用示例if __name__ __main__: # 生成双语字幕 bilingual_srt generate_bilingual_srt(english_lecture.mp4, bilingual_subtitles.srt) print(f双语字幕已生成: {bilingual_srt}) # 可选嵌入到视频 # burned_video burn_subtitles_to_video( # english_lecture.mp4, # bilingual_srt, # english_lecture_with_subs.mp4 # )## 四、性能优化与常见问题### 4.1 加速推理技巧1.使用 GPU 加速安装torch的 CUDA 版本使用model.to(cuda)2.批量处理对长音频分段处理避免内存溢出3.模型选择tiny模型适合实时场景large-v3适合高精度需求python# GPU 加速示例import torchdevice cuda if torch.cuda.is_available() else cpumodel whisper.load_model(large-v3).to(device)### 4.2 常见问题解决-中文识别不准确确保输入音频采样率为 16kHz单声道-时间戳偏移使用word_timestampsTrue参数获取词级时间戳-内存不足分割长音频为 30 秒片段处理## 总结Whisper 作为开源语音识别领域的里程碑式模型凭借其多语言、多任务统一架构和强大的抗噪能力在语音转文字和字幕生成领域展现出卓越性能。本文从模型原理出发详细介绍了环境搭建、基础转写、视频字幕生成以及中英双语字幕的完整实现方案。通过结合 FFmpeg 工具我们可以将生成的 SRT 字幕直接嵌入视频实现一站式视频本地化处理。在实际应用中建议根据场景平衡模型大小和速度对实时性要求高的场景使用tiny或base模型而对精度要求高的离线处理则选择large-v3。随着社区不断优化和模型持续迭代Whisper 在语音处理的效率和质量上仍有巨大提升空间值得开发者在视频翻译、会议记录、无障碍服务等场景中深入探索与实践。

相关新闻