
本地语音转文字 5 分钟上手Buzz 离线音频转录完整指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款把 Whisper 模型搬到你电脑上的免费离线音频转录工具录音、会议音频、视频文件丢进去语音转文字全程在本机完成无需联网、不上传任何数据支持 99 种以上语言并可利用显卡加速。对于需要处理敏感录音、长期被订阅费用困扰、或常在弱网环境工作的你这是一套一次装好、终身免费的本地语音转文字方案。为什么把语音转文字放在本地做把音频交给在线服务意味着三份成本数据要过第三方服务器、按分钟或订阅付费、断网即停摆。本地转录把这三项都归零维度云端转录服务Buzz 本地转录录音去向上传至第三方服务器始终留在本机磁盘费用按量或按年订阅一次性安装免费使用网络要求全程依赖网络装好模型后可完全离线速度瓶颈服务器排队与带宽取决于你自己的硬件还有一个常被忽略的好处处理速度只取决于你自己的 CPU 和显卡批量处理 10 小时录音时不必担心队列拥堵。5 分钟安装并跑通第一次转录第一步按平台安装macOS下载.dmg安装包拖入 Applications 即可Windows安装程序未做数字签名安装时若提示“未知发布者”选择“仍要运行”Linuxflatpak install flathub io.github.chidiwilliams.Buzz或通过 Snap 安装习惯 Python 环境的话pip install buzz-captions之后用python -m buzz启动需先装好 ffmpegPython 3.12第二步完成首次转录点击工具栏的导入按钮或按Ctrl/Cmd O选中一个音频或视频文件——MP3、WAV、M4A、FLAC、MP4 都可以直接粘贴视频链接也行语言一栏建议手动选如zh中文、en英文比自动检测更可靠模型先用 Base 或 Small点击运行状态变为“完成”后双击该行转录结果就带时间戳地显示出来了认识主流程导入 → 选模型 → 转录 → 编辑 → 导出整个使用循环就五步主界面右侧的任务表会记录每个文件的进度导入文件或链接进入任务队列可同时排入多个按顺序依次处理选模型按内存和精度需求挑一个 Whisper 型号下一节细讲转录点击运行GPU 可用时自动走 CUDA / Vulkan 加速编辑在转录查看器里逐段试听、改字、调时间轴CtrlF全文搜索Ctrl←/→微调时间戳导出一键输出为 TXT、SRT、VTT 或 JSON导出的 SRT 可直接拖进剪辑软件当字幕用模型选择速查速度、准确率与内存的取舍Whisper 家族里模型越大越准但越吃资源。下面按 Buzz 源码中的实际文件体积整理供你按机器配置对号入座型号文件体积适合场景预期体验Tiny~73 MB快速草稿、低配机器秒级出结果专有名词易错Base~139 MB日常会议、日常听记速度与准确率均衡的默认选择Small~462 MB对准确率有要求的正式文稿明显更稳耗时约为 Base 两倍Medium~1.5 GB出版级转录、嘈杂音频需要 8GB 内存建议配显卡Large~2.9 GB学术与最高精度需求内存占用高纯 CPU 较慢两条实用建议首次运行会自动下载所选模型之后离线也能继续用显存紧张时Whisper.cpp 后端支持量化版本如 q5体积和显存占用都能再降一截三个真实任务演示任务一把 90 分钟会议录音变成可检索的纪要做法导入会议录音选 Base/Small语言设为中文专有名词容易写错的人名、产品名在“高级”里填入 Initial Prompt 提示产出带时间戳的全文 TXT配合查看器的搜索功能三秒钟定位到某句发言任务二给课程视频生成字幕做法导入 MP4勾选 Word-Level Timings词级时间戳以提高断句精度转录后用字幕调整工具按“最大长度 标点分割”重新分行产出可直接导入剪辑软件的 SRT/VTT 文件任务三把外文资料转成双语对照做法导入外语音频任务选 Translate 直接译成目标语言或先 Transcribe 保留原文再翻译产出原文与译文可切换查看分别导出成两份文本方便对照学习让输出更专业的三组设置自定义导出文件名。首选项里可配置文件名模板例如{{ input_file_name }} ({{ task }}d on {{ date_time }})可用变量还有language、model_size等——批量导出的文件自动按“名称任务日期”归档不必手动重命名。字幕参数调优。生成字幕时打开 Word-Level Timings转录后可用调整工具指定单行最大字符数、是否按标点断行还能给每条字幕统一加停留时长开启后 Buzz 会分析原音频的静音段来校准断句位置。文件夹监控。设置一个“收件箱”目录后往里丢文件即自动开始转录适合长期归档采访录音或批量处理遗留音频。模型库管理。首选项中的模型管理页可以集中下载、删除各尺寸模型Whisper.cpp 还支持贴入自定义模型链接例如其他语言的量化模型。遇到问题先看这里现象常见原因处理办法启动即闪退/报错缺少 ffmpeg 或运行库单独安装 ffmpegWindows 补装 VC 运行库模型迟迟下不完网络波动稍后重试也可手动下载.bin模型放到模型目录转录明显变慢模型过大或内存吃紧换小一号模型或改用 Whisper.cpp 量化版识别错误多音频嘈杂或语言选错打开“提取语音”降噪选项语言改手动指定有显卡却没用上驱动或后端不匹配确认 CUDA/Vulkan 驱动正常仍异常可设置BUZZ_FORCE_CPU排查更多细节可查阅 官方文档 与 使用指南。进阶命令行与插件想把它接进自动化流程add子命令就够了例如用 Whisper.cpp 的 Small 模型转录一个 MP4 并同时输出 SRT 和 VTTbuzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 课程录屏.mp4完整参数见 CLI 文档。不想改代码也能扩展功能插件目录 内置了几个开箱即用的能力AI 摘要长文本自动总结、Transcript Resizer自动重排字幕、Docx 导出、说话人场景下的跳过头部已转录片段等在插件对话框里勾选启用即可。数据始终掌握在你手里走到这里其实可以回望最初的动力从录音文件、中间产物到最终文稿所有字节都没有离开过你的电脑。没有账号、没有上传、没有按分钟计费断网的工作室、不稳定的差旅途中的设备装一次模型就能长期工作。你决定数据存在哪、保留多久、何时删除——这点对处理客户访谈或内部会议录音的人尤其重要。下一步想从源码运行最新版本git clone https://gitcode.com/GitHub_Trending/buz/buzz然后参考 贡献指南 搭建环境日常使用建议按顺序读 文件导入 → 编辑与调整 → 首选项 三篇文档找到好用的字幕参数或插件配置后欢迎回到仓库提一个 Issue帮助下一位新手少踩坑【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考