尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

5 分钟跑通 Faster Whisper:比原版 Whisper 快 4 倍的语音转写引擎

5 分钟跑通 Faster Whisper:比原版 Whisper 快 4 倍的语音转写引擎 5 分钟跑通 Faster Whisper比原版 Whisper 快 4 倍的语音转写引擎【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperFaster Whisper 是基于 CTranslate2 推理引擎实现的 Whisper 语音模型在同等准确率下把音频转文字的速度提升了最多 4 倍配合 int8 量化还能明显省下内存。这篇指南先带你 5 分钟跑通一次完整转写再讲后面用得上模型怎么选、参数怎么调。安装 Faster Whisper一条命令不用装 FFmpeg环境要求 Python 3.9 及以上直接从 PyPI 安装即可pip install faster-whisper有个容易踩的点跟 openai/whisper 不同Faster Whisper 不需要你在系统里单独装 FFmpeg。音频解码由 PyAV 库负责FFmpeg 组件已经随它打包好了。第一次转写最小可运行示例安装完就能写代码了。加载一个模型、传入音频文件返回带时间戳的转写片段from faster_whisper import WhisperModel model WhisperModel(base, deviceauto, compute_typeint8) segments, info model.transcribe(audio.mp3) print(f检测到语言: {info.language} (概率: {info.language_probability:.2f})) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})不指定language时模型会根据前 30 秒音频自动判断语种如果你已经知道语言直接传languagezh之类的语言码可以省掉检测这一步。模型怎么选速度 vs 准确率模型从 tiny 到 large 共五档tiny 最快large 最准计算类型compute_type同样决定速度和内存⚡ CPU 上用int8内存占用大幅降低精度基本不变GPU 上可以用float16拿更高精度但 large fp16 需要 NVIDIA 显卡并自行装好 cuBLAS 和 cuDNNCUDA 12# CPU 低内存场景 model WhisperModel(small, devicecpu, compute_typeint8, cpu_threads8) # GPU 高精度场景 model WhisperModel(large, devicecuda, compute_typefloat16)实用建议先用 base 或 small 加 int8 起步确认小模型精度不够再升级到 large没必要一开始就拉满配置。三个最实用的转写参数跑通之后日常最常调的是这几个开关完整签名可以看 faster_whisper/transcribe.pyvad_filter语音活动检测自动跳过静音片段默认就是开启的一般不用动word_timestamps设为True后每个词都有独立的起止时间做逐字对齐的字幕时非常有用initial_prompt喂一段背景描述作为提示能提升专业术语的识别率比如中英混说的技术讲座可以先给模型一点上下文另外长音频可以靠batch_size和chunk_length控制批处理大小与切分长度。到底能快多少官方基准数据官方基准用一段 13 分钟的音频在 NVIDIA RTX 3070 Ti 8GBCUDA 12.4上测 large-v2 模型实现精度耗时显存openai/whisperfp162m23s4708MBfaster-whisperint859s2926MBfaster-whisperbatch_size8int816s4500MBCPU 侧Intel Core i7-12700K8 线程small 模型原版实现耗时 6m58sFaster Whisper 开 int8 后降到 1m42s再开batch_size8可以压到 51s。你的机器配置接近的话可以直接跑 benchmark/ 目录下的脚本实测。Faster Whisper 适合把批量音频转文字这件事的成本压到最低装好之后先用 base int8 验证效果再按硬件情况决定是否上 GPU 和 fp16。想自己写测试或看用例参考tests/ 里有现成的音频样本和断言可以照着写。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表