尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Faster-Whisper 语音转录实战:快 4 倍,内存还砍半

Faster-Whisper 语音转录实战:快 4 倍,内存还砍半 Faster-Whisper 语音转录实战快 4 倍内存还砍半【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper跑语音转文字最头疼的就是音频排队转不完。faster-whisper 是 OpenAI Whisper 语音识别的一个重实现版本专门解决慢和吃内存这两个问题——它把推理引擎换成 CTranslate2准确率不变的前提下速度最高翻 4 倍显存占用还能再降一截。 为什么它更快Whisper 本质是个 Transformer 模型原版用 PyTorch 跑推理开销不小。faster-whisper 用为 Transformer 专门优化的 CTranslate2 推理引擎重写并且 CPU、GPU 都支持 8-bitINT8量化——内存和速度一次优化到位精度几乎不打折。⏱️ 速度到底快多少13 分钟音频实测官方基准统一用同一段 13 分钟的音频方便直接对比GPU 上large-v2fp16原版要 2 分 23 秒faster-whisper 只要 1 分 03 秒再开批量推理batch_size8直接 17 秒交卷。换 INT8 量化是 59 秒显存从 4525MB 降到 2926MBCPU 上small 模型原版 6 分 58 秒fp32faster-whisper INT8 只要 1 分 42 秒批量推理 51 秒distil-large-v3transformers 跑 46 分 12 秒faster-whisper 只要 25 分 50 秒词错误率WER反而更低13.527 对比 14.801更快之外还更准这是它最有说服力的一点。 跑通第一次转录5 行代码from faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})几个容易踩的坑segments是生成器真正开始转录要等你开始遍历它想让它立刻跑完就list(segments)模型从 tiny 到 large-v1/v2/v3以及 distil-whisper 蒸馏系列都能直接换名字加载对应的 CTranslate2 权重会自动从 Hub 下载完整参数热词提示、指定语言、initial_prompt等都在 WhisperModel 源码 里 实用特性VAD、词级时间戳、批量推理VAD 过滤vad_filterTrue会用内置的 Silero VAD 先把没语音的片段裁掉模型只算有声音的部分。默认只裁超过 2 秒的静音可通过vad_parameters传参微调默认值写在 faster_whisper/vad.py词级时间戳word_timestampsTrue直接拿到每个单词的起止时间批量推理BatchedInferencePipeline是WhisperModel.transcribe的无缝替代默认开启 VAD长音频收益最大distil-large-v3 建议搭配languageen和condition_on_previous_textFalse使用⚙️ 安装与硬件避坑pip install faster-whisper需要 Python 3.9不用单独装 FFmpeg音频解码由内置 FFmpeg 库的 PyAV 完成GPU 推理要装 cuBLAS for CUDA 12 和 cuDNN 9。用 CUDA 11 的话把 ctranslate2 降到 3.24.0CUDA 12 配 cuDNN 8 则降到 4.4.0Linux 上可以直接pip install nvidia-cublas-cublas nvidia-cudnn-cu12注意先设置LD_LIBRARY_PATH仓库里的 docker/Dockerfile 也提供了现成容器方案 微调过的模型转一下就能用自带ct2-transformers-converter工具一条命令把原版 Whisper 或你自己微调的模型转成 CTranslate2 格式还能顺手指定 float16 量化。转完之后从本地目录加载或者传到 Hub 按名字加载代码零改动。它的生态也挺热闹WhisperX 做说话人分离Open-Lyrics 把转录结果翻成 .lrc 歌词Whisper-Streaming 跑近实时转录——按场景挑一个接上就行。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表