尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Buzz 本地语音转文字:免费离线把音频转成 SRT 字幕的完整教程

Buzz 本地语音转文字:免费离线把音频转成 SRT 字幕的完整教程 Buzz 本地语音转文字免费离线把音频转成 SRT 字幕的完整教程【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz是一款免费开源的本地语音转文字工具由 OpenAI 的Whisper模型驱动。装进你自己的电脑后它能在完全断网的状态下把音频、视频乃至在线视频链接转成带时间轴的文字稿并支持翻译与字幕导出。 场景与成本一段两小时采访录音的代价你录完一段两小时采访逐句听写一遍大约要搭上四五个小时。这是人工整理音频最常见的成本。换成云端转写服务按分钟计费几小时的内容花掉几十块。更大的问题在内容本身客户访谈、会议录音都带敏感信息上传到别人的服务器存在被留存的风险。本地方案的价值正在这两点上。Buzz 把转写全流程跑在你自己的设备里音频文件不经过任何第三方。模型只需下载一次之后所有转写不花一分钱也不需要联网。 按系统装 Buzz四种方式一次装好参考安装文档按你的系统各选一种Windows从发布页下载安装程序双击安装。程序未签名弹出系统警告时点「更多信息」→「仍要运行」。macOS执行brew install --cask buzz或下载 DMG 拖入「应用程序」。Linuxsudo snap install buzz再执行sudo snap connect buzz:password-manager-service也可以用flatpak install flathub io.github.chidiwilliams.Buzz。Python 环境pip install buzz-captions之后用python -m buzz启动界面。首次启动会提示下载模型体积从约 40MBtiny到约 3GBlarge。这是一次性投入完成后所有转写都不再联网。 选对 Whisper 模型五档规格一张表看明白Whisper 模型家族的规格决定速度与准确率的平衡模型下载体积约速度准确率适用场景tiny40MB最快一般快速试听、实时转写base75MB快尚可日常笔记、语音备忘small250MB中等良好会议纪要初稿medium770MB较慢很高重要内容精转large3GB最慢最高交付级字幕结论直接给只要梗概base 就够要交付字幕一步到位上 large。有 NVIDIA 显卡的话把后端切到 faster-whisper 并启用 CUDAlarge 的转写速度能快数倍。下载和切换都在「偏好设置 → Models」页完成已装的和可下载的都列在那里。该页还支持粘贴第三方优化模型的.bin直链方便你换用其他变体。 第一次本地语音转文字从文件到文稿四步完成导入素材点菜单栏「File → Import Media File」快捷键CtrlO选择 MP3、WAV、MP4 文件也可直接粘贴在线视频链接。配置任务类型选 Transcribe转写或 Translate翻译指定语言可选自动检测建议手动指定更稳再选模型。启动任务点「Run」。任务列表实时刷新状态和进度百分比关掉窗口任务仍会在后台继续。打开结果双击状态为「Completed」的行或点该行右侧的「⤢」图标进入转录详情页。导出文件点导出按钮选 SRT、VTT 或 TXT。做字幕导 SRT 丢进剪辑软件做笔记导 TXT。主界面就是一个任务队列每行显示文件、模型、任务类型与实时进度一次拖进几十个文件也没问题。✂️ 转完之后的字幕编辑与长度调整详情页本身是一个迷你字幕编辑器。每段文字都带精确的起止时间点任意片段就跳到对应音频位置。播放的同时直接改文字改动自动保存不用找保存按钮。顶部工具栏集中了视图切换、翻译、字幕调整、导出等入口功能都在明面上。字幕调整Resize解决的是 Whisper 切句长短不齐的问题。点工具栏「Resize」按钮设定字幕最大字数过长的句子自动拆开。勾选按标点断句拆分位置符合阅读习惯。任务勾选过字级时间戳的话工具会分析音频里的静音间隙合并过短的碎片片段。可再加「段尾延长」秒数让每条字幕在屏幕上停留更久。对整个文件一键生效不用逐条手动调。这一步省掉的是做字幕最费时的排版工作详见编辑与调整文档。 进阶玩法四则实时转写、AI 翻译与自动批处理实时录音转写。在 Live recording 区选好麦克风点「Record」边说边出字长时间会议可开演示窗口实时展示文字。实时场景建议选 whisper.cpp 后端和小模型。适合会议现场、课堂记录、同传。AI 翻译。详情页点「Translate」按钮接入 OpenAI 兼容 API也支持指向 Ollama 等本地模型把文稿翻成任意目标语言约一小时音频花费 1 美元左右。适合外语播客、双语字幕学习材料。文件夹监控自动转写。在偏好设置的 Folder Watch 里指定一个目录新音频放进去就自动开始转写可配合「跳过已转写文件」插件。适合团队协作同事往共享目录丢录音文字稿自己出来。说话人识别。转完点「Identify speakers」工具按说话人自动分段可以试听片段核对并改名为真实姓名。适合采访、多人访谈与会议。❓ 常见问题新手容易碰到的六个现象转写明显慢先换小一档模型再换后端。非 N 卡选 whisper.cppN 卡且显存 6GB 以上选 faster-whisper。同时别开多个大任务抢资源。准确率不理想先确认录音本身清晰、噪音少。音频没问题的话用 large-v3 重跑通常有明显改观。容易拼错的人名、术语可以写进「Advanced → Initial prompt」里减少错字。任务长时间排队多半是模型还没下载完。去偏好设置的 Models 页确认模型就位再重新添加任务。下载模型后崩溃或起不来文件可能不完整或损坏。到 Models 页删除该模型重新下载。电脑完全断网能不能用可以。在有网机器上下载好模型把模型目录Linux 为~/.cache/Buzz/modelsmacOS 为~/Library/Caches/Buzz拷到目标机器相同位置即可。麦克风不可用PaErrorCode-9999检查系统麦克风隐私权限。Windows 到「设置 → 隐私 → 麦克风」里确认已授权。 开始你的本地语音转文字一个可执行的第一步Buzz 同时占住免费、离线、开源三个词音频不出你的设备模型只花钱下载一次之后零成本转写。第一步就这么做按上面的方式装好或pip install buzz-captions拖入第一段音频选 base 模型点「Run」。几分钟内你就有一份可编辑、可导出字幕的文字稿。命令行用法见CLI 参考。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表