尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Buzz 离线语音识别完整指南:4 步安装上手,让 Whisper 在本地转出高质量字幕

Buzz 离线语音识别完整指南:4 步安装上手,让 Whisper 在本地转出高质量字幕 Buzz 离线语音识别完整指南4 步安装上手让 Whisper 在本地转出高质量字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的离线语音识别桌面应用把录音、视频和网页链接在本地直接转成文字或翻译成英文音频全程不上传。适合需要处理会议录音、访谈资料、视频字幕又希望数据留在自己电脑上的用户。四步装好 Buzz桌面版到命令行版 不同系统对应四种安装方式装完后双击图标即可打开主界面。macOS下载官方发布的.dmg拖入应用程序文件夹即可Apple Silicon 芯片可直接使用无需转译。Windows下载官方安装包。应用未做数字签名安装时系统会弹出提示选择更多信息→仍要运行继续即可。Linux推荐走包管理器一条命令完成。# Flatpak flatpak install flathub io.github.chidiwilliams.Buzz # 或 Snap sudo snap install buzzPyPI适合开发者需要 Python 3.12 环境和系统已安装 ffmpeg 这类依赖然后执行pip install buzz-captions python -m buzz装好后先用Ctrl/Cmd ,打开偏好设置在模型页下载一个模型——首次转录前必须有一个本地模型可用。第一次转录一个文件从导入到拿到字幕 完成一次完整转录只需要五步导入 → 选任务 → 选语言 → 选模型 → 运行之后即可编辑导出。通过文件菜单的导入媒体文件或工具栏按钮、Ctrl/Cmd O选择音频或视频文件也支持直接粘贴链接导入网页视频。选择任务Transcribe转写原语言或Translate翻译成英文。选择语言。官方建议只要知道语言就不要用自动检测手动指定能明显减少识别偏差。设置引擎与模型大小勾选导出格式TXT / SRT / VTT。点击 Run。状态变为 Completed 后双击任务行打开转录查看器逐段校对、编辑、导出。几个影响后续体验的选项值得注意Word-Level Timings词级时间戳开启后每个词都有独立时间轴是之后用 Resize 工具合并出规范字幕的前提。Initial prompt初始提示在高级里填入人名、术语可减少专有名词的拼写错误。Extract speech先把人声从噪音背景中分离出来再转录适合环境嘈杂的录音。转录完成后的查看器支持搜索CtrlF、0.5x–2.0x 变速播放、跟随滚动和段内循环详见 转录查看器文档。引擎和模型该怎么选先按硬件对号入座 ⚙️结论先说N 卡选 Faster Whisper其他情况尤其 Mac 和核显选 Whisper.cpp模型大小按速度换准确率的梯度来定。Buzz 内置四种 Whisper 后端定位各不相同后端特点适合谁Whisper.cppC 实现速度快、内存占用低支持任意品牌 GPU含核显与纯 CPU甚至能在集显笔记本上跑实时转录Mac 用户、无 N 卡用户默认首选Faster Whisper优化的 Python 实现比原版快一个量级吃 GPU拥有 6GB 以上显存的 Nvidia 用户Whisper原版OpenAI 初始实现准但慢、吃内存有耐心、追求基线效果的用户Hugging FaceTransformers 实现支持大量社区定制模型、MMS 家族1000 语言及 PEFT 微调版需要特定语言增强模型的用户模型大小的取舍很直白tiny / base最快适合实时转录和低配置设备准确率够用但不精细small / medium日常工作的平衡点large-v2 / large-v3准确率最高但 v3 偶尔会脑补音频里没有的词关键内容建议人工复核turbo在速度与准确率之间取中。在偏好设置的模型页可以下载、删除模型Whisper.cpp 还支持Custom项填入.bin模型下载地址以及q5这类量化版本来进一步省显存。官方 FAQ 给出的最终建议是用你的语言各测一遍结果最说话。关键配置一次调好导出命名、语言与实时模式 ️把下面几项配置好之后Buzz 的日常使用基本不用再来回折腾设置。导出文件名模板支持变量拼路径命名例如{{ input_file_name }} ({{ task }}d on {{ date_time }})可用变量还有language、model_type、model_size。批量导出时靠它保证文件不重名、可追溯。实时转录三种模式Append below新句追加在底部、Append above新句置顶、Append and correct追加并回头修正上一句最吃性能。配合实时导出开关可以边录边把文字写到 TXT供 OBS 等软件读取。高级选项走环境变量如BUZZ_WHISPERCPP_N_THREADS调整线程数16 线程笔记本上设为 8 可提速约 15%、BUZZ_FORCE_CPUtrue强制 CPU、BUZZ_DISABLE_TELEMETRY关闭统计上报等完整清单见 偏好设置文档。进阶玩法文件夹监听、实时字幕与插件 这些功能可以把 Buzz 从手动工具升级为自动化流水线。文件夹监听在偏好设置里开启后指定输入与输出文件夹新文件落盘即自动转录还能选择处理完删除源文件。适合把录音笔、会议软件的导出目录直接对接给 Buzz实现无人值守批量处理。实时录音选好麦克风、语言和任务后点 Record 即可开始。官方提醒默认 Whisper 引擎实时转录负载较高建议换用 Whisper.cpp 并选小模型。录音过程中可打开演示窗口把实时字幕投屏到副屏适合发布会和演讲场景。说话人识别转录完成后点Identify speakersBuzz 会自动给每句话打上说话人标签可试听 10 秒片段并改名成真人姓名还能把同一人的连续发言合并成段Intel Mac 暂不支持。插件系统Help → Plugins中启用、排序和配置也可以按 URL 加载社区插件。内置插件包括AI Summary调用 OpenAI 兼容接口如 Ollama生成摘要存到备注或独立文件DeepFilterNet 降噪转录前自动去除背景噪音Export to DOCX带时间戳导出 Word 文稿Resize Transcript转录后自动把词级时间戳重组为字幕长度Skip Already Transcribed重复导入同一批文件时自动跳过已有结果。实现原理可以参考 buzz/plugins/ 目录下的源码写自己的插件有现成模板可抄。命令行Buzz 自带 CLI方便写脚本和接入自动化。典型用法# 转录一个 MP4 并直接导出 SRT 和 VTT buzz add --task transcribe --model-type whispercpp --model-size small \ --srt --vtt /path/to/video.mp4 # 批量把两个法语 MP3 翻译成英文 buzz add --task translate --language fr --model-type openaiapi 1.mp3 2.mp3完整参数见 CLI 文档支持--txt/--srt/--vtt输出、-w词级时间戳、-e人声提取、--hide-gui无界面模式等。常见问题快速排查 遇到卡点先对照这张表多数情况几分钟内能解决模型存在哪Linux 在~/.cache/BuzzmacOS 在~/Library/Caches/BuzzWindows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache也可以在 偏好设置 → 模型 里点Show file location直接打开。完全离线的机器能用吗可以。在有网电脑下载好模型后把模型文件夹原样复制到离线机器的相同位置即可仓库里还附了 scripts/download-models.py 可预先准备离线模型包。转录太慢换 Whisper.cpp、降一档模型N 卡 6GB 显存以上改用 Faster Whisper。启动或转录时崩溃大概率是模型下载不完整删除后重新下载另外注意 CPU 需要支持 AVX2过老的机器跑不起来。麦克风报错 PaErrorCode-9999检查系统隐私设置里是否允许 Buzz 访问麦克风。字幕长度不合用前提是转录时开了词级时间戳然后用查看器里的 Resize按静音间隙合并、按标点切分、限制单条字幕最大长度还可统一延长每条字幕的显示时长。工具界面长这样更多问题可查 官方 FAQ。下一步行动清单 ✅按顺序完成下面 5 件事Buzz 就能进入日常使用状态下载对应系统的安装包或pip install buzz-captions打开主界面。在偏好设置里下载一个模型Mac 或无 N 卡选 Whisper.cpp 的 baseN 卡 6GB 显存以上选 Faster Whisper 的 small/medium。导入第一个文件手动指定语言勾选导出格式跑通一次完整转录。打开文件夹监听把固定来源目录接进自动化流程。需要字幕的重跑一次并勾选词级时间戳用 Resize 合并出规范 SRT再导出到剪辑软件。遇到行为细节拿不准时翻一翻 docs/docs/ 下的使用手册即可每篇都按功能拆得比较细。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表