尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Buzz 离线音频转录完整指南:5 步跑通本地语音转文字

Buzz 离线音频转录完整指南:5 步跑通本地语音转文字 Buzz 离线音频转录完整指南5 步跑通本地语音转文字【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz晚上十一点采访录音在手明早九点前必须交文字稿。Buzz 能救这个场它是一款跑在自己电脑上的离线音频转录工具基于 OpenAI 的 Whisper 模型把语音逐句转成带时间戳的文字全程不出本地。这篇带你从零装好软件、跑通第一条转录再到导出第一份字幕十分钟以内。项目概览它是什么开源桌面应用把音频、视频甚至 YouTube 链接里的语音转成文字模型全在本机跑不注册、不上传、不收费。解决什么问题采访、会议、网课、播客凡是听三遍还记不全的活儿交给它出文字稿还能顺手把外语内容译成你的语言。适合谁要引用原话的记者和研究员、做字幕的视频创作者、记课堂笔记的学生。硬件门槛低NVIDIA 显卡、Apple Silicon 有加速没有独显也能靠 CPU、集显干完。能扩展插件系统自带 AI 摘要、字幕重切分不够还能自己加。从零到跑通安装与首次运行两条命令装好 BuzzWindows 和 macOS 直接装官方安装包最省事Windows 首次弹窗选更多信息 → 仍要运行即可Linux 用 flatpak 或 snap 一行命令也能装上。习惯 Python 的话路径最干净pip install buzz-captions python -m buzz执行python -m buzz→ 主窗口弹出中间是任务列表右上是红色录音按钮。想读源码就先git clone https://gitcode.com/GitHub_Trending/buz/buzz再照着安装文档配置开发环境。第一次打开跑通第一条转录菜单 File → Import Media File或 CtrlO选一个 mp3Buzz 会建一条转录任务默认 tiny 模型首次运行自动下载等进度条走完点 Run状态变 Completed 后双击那行 → 转录查看器打开文字、时间戳、播放器都齐了。确认这几个关键默认项偏好设置Help → Preferences里导出格式默认 TXT做字幕就改 SRTModels 标签页能提前下载更大的模型还能看到模型缓存目录在哪完全离线的电脑先在联网机器上用 scripts/download-models.py 备好模型缓存再拷过去Watch Folder 打开后文件丢进监听目录就自动排队。核心能力拆解导入文件与链接任务自动排队不用守在电脑前等结果丢进队列就走。本地音频、视频CtrlO 或工具栏的号导入一次可选多个线上视频粘贴 YouTube 链接Buzz 自动抓取音轨排进队列多个任务并行排队互不阻塞每个独立显示语言、模型和进度。选对模型速度和准确率换着来模型选错要么等太久要么错太多这一步值得花一分钟。tiny 快先听个大概small、medium 均衡large 最准但吃硬件后端按硬件挑N 卡显存 6GB 以上选 Faster WhisperMac 和集显选 Whisper.cpp偏好设置的 Models 页可以提前下好候选模型转的时候不用等下载不想本地硬算可以填 OpenAI API key 走云端——但那就告别离线了。逐句校对文字直接改字幕识别错几个词不用重跑打开查看器边听边改。播放器支持倍速和跳段点哪句播哪句每段文字可以直接编辑改完时间戳还在导出 TXT、SRT、VTT字幕文件拖进剪辑软件就能用勾选 Word-Level Timings 拿词级时间戳再用字幕重切分把长句拆顺外语内容还能直接在查看器里翻译成中文。开会做讲座实时出字幕说话的同时文字就在屏幕上往外蹦不用先录完再转。点红色录音按钮、选麦克风实时转写即时滚动演讲模式开一个大字窗口投影出来给现场看多人场合可开说话人识别把不同人的话分开标注环境吵就开 Extract Speech先做人声分离再转写准确率更高。实战场景与进阶技巧采访整理40 分钟录音配 medium 模型Advanced 里的 Initial Prompt 把人名、地名写进去专名不再写成同音字改稿时间省一半。课程笔记网课 MP4 拖进去勾上 Word-Level Timings 跑完用字幕重切分把断句切顺SRT 直接配到视频上。会议速记开着实时转写进会场散会时 TXT 文字稿已在手边补几个专名即可归档。两个锦上添花的技巧偏好设置里 Shortcuts 页能自定义开始录音导入文件的按键日常少点几下鼠标想批量自动化终端里执行buzz add加参数就能指定模型、语言和导出格式一次处理一批文件。避坑与排错转得太慢现象是 tiny 模型都要十几分钟多半是纯 CPU 在算、或模型选大了把后端换成 Whisper.cpp或模型降一档N 卡装好 CUDA 12 再试。录音报错 PaErrorCode-9999现象是点了录音没反应只弹错误基本是系统隐私设置挡了麦克风到系统设置里给 Buzz 麦克风权限Windows 在 设置 → 隐私 → 麦克风。下完模型就崩溃现象是模型下载完一启动或一转写就闪退多半是模型文件没下完或损坏在 偏好设置 → Models 里删掉重新下载。收尾音频自始至终不出你的电脑文字稿和字幕一次齐活还不花一分钱。现在打开终端两条命令装好 Buzz导入第一段音频五分钟后你手里就有第一份能边听边改的文字稿。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表