尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

如何快速离线语音转文字:whisper.cpp完整指南

如何快速离线语音转文字:whisper.cpp完整指南 如何快速离线语音转文字whisper.cpp完整指南【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cppwhisper.cpp 是 OpenAI Whisper 语音识别模型的 C/C 移植版核心价值只有一个把音频直接在你自己的设备上转成文字全程不需要联网音频文件不会离开你的电脑或手机。如果你是做播客、访谈需要出文稿的内容创作者是要把会议录音变纪要的职场人或是转写课件录音的学生又不想把录音交给第三方在线服务这个工具就是为此准备的。为什么选它做本地语音转文字两个最实在的理由完全离线识别由本地推理完成音频不上传任何服务器私人谈话、内部会议录音都可以直接转不用担心隐私被平台留存。不依赖 Python 环境核心是纯 C/C 实现编译后就是一个独立的命令行程序Mac、Windows、Linux 都能跑没有 GPU 的普通笔记本也没问题。和在线转写服务差在哪在线服务通常需要上传音频、按用量计费隐私取决于对方平台。whisper.cpp 则是下载一次模型、无限次本地转写录音量大或内容敏感的场景下更划算也更稳妥。三步跑通第一次语音识别第一步获取代码并编译克隆仓库并编译机器上只需有 CMake 和 C 编译器多数开发环境自带whisper.cpp 编译完成后可执行程序会放在 build/bin 目录git clone https://gitcode.com/GitHub_Trending/wh/whisper.cpp cd whisper.cpp cmake -B build -DCMAKE_BUILD_TYPERelease cmake --build build -j --config Release第二步下载识别模型下载 base.en 模型仅支持英语142 MiB推荐新手第一个跑sh models/download-ggml-model.sh base.enmodel 下载脚本还支持其他规格把最后一个参数换成 tiny、small、medium 即可。第三步转写一段真实音频运行仓库自带的命令行程序 whisper-cli指向 samples 目录里的示例音频 jfk.wav./build/bin/whisper-cli -m models/ggml-base.en.bin -f samples/jfk.wav跑完后终端会按片段打印带时间戳的转写结果这条音频输出的是肯尼迪那段著名演讲And so my fellow Americans: ask not what your country can do for you—ask what you can do for your country. 看到这段文字说明整条链路已经通了。模型大小怎么选不踩坑五个规格的数据对比下表是 whisper.cpp 官方给出的数据下载大小 磁盘占用内存 识别时实际占用模型下载大小内存占用适用场景tiny75 MiB~273 MB快速验证、资源受限设备base142 MiB~388 MB日常转写速度精度均衡small466 MiB~852 MB专业转录准确率明显更好medium1.5 GiB~2.1 GB高精度需求内存要留够large2.9 GiB~3.9 GB最高准确率高端机器选法很简单先用 base 跑通觉得准确率不够再升 small内存只有 8 GB 的机器别硬上 large留点空间给系统和音频缓冲。内存紧张就换量化模型量化能把模型的内存和磁盘占用再压一档同时保持可用精度./build/bin/quantize models/ggml-base.en.bin models/ggml-base.en-q5_0.bin q5_0之后用-m指定量化后的文件运行即可效果与原始模型接近。常见卡点排查四个高频问题现象运行后提示文件不支持或没有输出。原因whisper.cpp 的命令行程序只接受 16-bit WAV 文件mp3、m4a 直接给它会失败。解决先用 ffmpeg 转格式再跑ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav现象中文录音转出来全是英文或中英混杂。原因用了仅支持英语的.en模型。解决换多语言模型运行sh models/download-ggml-model.sh base。现象程序卡住或系统明显变卡。原因模型内存需求超过可用内存触发了大量磁盘交换。解决换 tiny/base 或量化模型并关掉占内存的大程序。现象编译阶段就报错。原因CMake 版本过旧或缺少 C 编译器。解决升级 CMake、确认编译器已安装删除 build 目录后重新执行编译命令。进阶搬到手机上或接入自己的程序跑在手机里仓库里带了移动端示例Android Java 示例 可以在手机上加载 tiny 模型完全离线地转写音频并把文字显示在界面上iOS 版本看 examples/whisper.objc/。接进自己的程序整套识别能力以 C 风格 API 暴露bindings/ 目录下已有 Go、Java、Ruby、JavaScript 等现成封装可以直接在自己的应用里调用有 NVIDIA 显卡的话编译时加-DGGML_CUDA1还能启用 GPU 加速。whisper.cpp 把音频变文字这件事从云服务搬回了自己的设备免费、离线、隐私可控从笔记本到手机都能跑。下一步建议很具体——下载 base 模型录一段 5 秒自己的声音用 whisper-cli 转写它跑通这第一条音频后再慢慢试量化模型或更大的规格。【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表