尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Buzz:零成本本地语音识别,离线音频转录从安装到出稿的完整指南

Buzz:零成本本地语音识别,离线音频转录从安装到出稿的完整指南 Buzz零成本本地语音识别离线音频转录从安装到出稿的完整指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz手头有一段两小时的会议录音涉及客户报价和人事讨论不敢交给任何云服务。我把它拖进了 Buzz拿到了一份带时间戳、可逐段编辑的文字稿。Buzz 是一款基于 OpenAI Whisper一个开源的语音转文字模型的免费离线音频转录桌面工具全程在你自己的电脑上完成不联网、不按分钟计费。这篇文章按从安装到调优的完整动线写顺带把常见坑一次说清。从下载到第一段文字稿双击 Windows 或 macOS 安装包即可装好Windows 首次运行若弹出未签名提示点更多信息再选仍要运行就能继续。Linux 用户走 Flatpak 或 Snap 商店一条命令装完升级也顺手。命令行党则可以直接pip install buzz-captions再用python -m buzz启动效果一致。程序打开后是一张任务列表每个转录任务的文件名、所用模型、任务类型和状态排成一行。别急着拖文件先用快捷键Ctrl/Cmd ,打开偏好设置设一个默认导出路径让结果自动落到你常用的文件夹顺手调一下界面字体大小。如果你以后打算用云端模型或 AI 翻译把 API 密钥填上即可纯离线用户这步跳过。然后点左上角的或者直接把音频、视频文件拖进去MP3、WAV、MP4、AVI 都认。选任务类型转录转成原文或翻译转成英文指定语言和模型点 Run。等状态变成 Completed双击这一行转录查看器就打开了——每段文字带起止时间戳底部有播放条可以逐段试听、修改。有一个细节值得多说一句语言请手动指定。自动检测偶尔会猜错中文被误判成别的语种再转回来整段文字基本报废手动选对语言后准确率立刻不一样。模型与引擎按你的硬件选Buzz 背后是 Whisper 的五个模型档位体积、速度、精度各不相同模型体积速度精度适合谁Tiny约 75 MB最快基础预览、老电脑Base约 142 MB快良好日常随手记Small约 466 MB中等优秀正式会议、视频字幕Medium约 1.5 GB较慢很好学术资料、高精度需求Large约 2.9 GB最慢最佳专业级转录、多语种试了两周的结论很明确日常用 Base重要内容用 Small。Medium 和 Large 的精度提升有限耗时却是成倍的普通材料不划算。模型选完还要选引擎条件句式记一下如果你有 NVIDIA 显卡且显存不小于 6 GB选 Faster Whisper它走 CUDA英伟达的 GPU 并行计算平台加速提升最明显否则选 Whisper.cpp它是 C 重写版速度快、占内存少还支持 Vulkan一种跨平台的图形计算接口核显也能参与运算笔记本上接近实时转录这也是 Whisper 本地部署最省心的路线需要加载社区定制模型、或使用 Meta MMS 系列上千种语言时选 HuggingFace 版。偏好设置里的模型页能看到每个模型的下载状态支持删除和重新下载显示文件位置按钮可以一键打开模型存放目录。把转录质量拉满的几个开关初始提示Initial Prompt。专有名词、人名、公司名经常被转错。在任务的高级设置里把这些词写进初始提示——它是先给模型看的一段提示文本等于提前交了一份术语表。实测医学讲座里把药品名列进去之后拼写错误明显减少。字幕后处理。这里有两个开关值得一起打开。词级时间戳Word-Level Timings给每个词打上时间点是字幕精修的基础建议默认勾选。字幕重排则解决分段糟糕的问题一段话被拆得稀碎时可以按静音间隙合并、按标点分割、限制每条字幕的字符上限。跑下来几秒钟导进剪辑软件就是一副整整齐齐的字幕。文件夹自动转录。每次手动点 Run 太繁琐。在偏好设置的文件夹监控页勾选启用、指定一个目录之后把音频丢进去就自动开始转录处理一堆讲座录音时相当于半自动流水线。插件系统。Buzz 从 1.4.5 版起支持插件在帮助 → 插件里管理。两个值得开的AI 摘要转录完成后自动把要点总结写进笔记降噪用深度滤波模型在转录前去掉背景噪声嘈杂录音的识别率能上一个台阶。速度排查按这个顺序来转录慢多半是模型或加速的问题按顺序检查降一档模型Small 换 Base速度提升最直观多数材料的精度损失可以接受开 GPU 加速NVIDIA 显卡走 CUDAWindows 安装版默认支持Mac 的 Apple Silicon 有原生优化Whisper.cpp 还支持 Vulkan核显也能算。开启后一小时音频的转录时间可以从 40 分钟缩到 10 分钟以内减线程数Whisper.cpp 的线程数设为 CPU 核心数的一半往往比拉满更快——线程太多时结果合并环节反而拖后腿。可用环境变量BUZZ_WHISPERCPP_N_THREADS设置。完全离线的机器也能用 Buzz先在有网电脑上把模型下好再按界面显示文件位置找到的路径把整个模型文件夹拷到离线机的相同位置即可。卡住了三个高频问题速查现象转录特别慢→ 可能原因模型档位过高、后台程序抢占资源、GPU 加速没真正生效 → 解法降一档模型关掉无关程序到设置里看有没有报错确认 GPU 确实被用上了。现象专有名词总认错→ 可能原因语言靠自动检测、模型没得到术语提示 → 解法手动指定语言把术语、人名写进初始提示。现象导出的文件用不了→ 可能原因格式和用途没对上 → 解法TXT 当纯文本笔记SRT 给剪辑软件通用标准字幕VTT 给网页视频JSON 给程序处理。写在最后Buzz 把专业级语音转文字要花钱、要联网、要担心数据去向这件事变成了免费的本地默认选项完全开源、无需联网、录音全程不出你的设备。会议记录、视频字幕、讲座整理、外语句子翻译它都接得住。今晚装一个拖一段 3 分钟的录音进去看看离线音频转录的速度和效果。官方文档docs/转录核心源码buzz/transcriber/设置模块buzz/settings/【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表