尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Buzz 本地语音转录上手指南:离线安装、模型调优与排障全解

Buzz 本地语音转录上手指南:离线安装、模型调优与排障全解 Buzz 本地语音转录上手指南离线安装、模型调优与排障全解【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz会议录音、访谈音频要上传到云服务器才能转录时隐私与费用总是绕不开的问题。Buzz 是一个基于 OpenAI Whisper 的本地语音转录工具录音、推理、导出全流程都在你自己的电脑上离线完成音频文件不会离开设备。从安装验证到模型选择、故障排查本文带你 10 分钟跑通全流程。它解决了什么问题语音转录的主要使用者是会议组织、访谈、授课和字幕制作等高频处理音视频的人。传统云端转录服务要求先上传文件存在隐私顾虑、网络依赖和按量计费的问题。Buzz 把整条链路搬回本地模型下载一次后转录与翻译可在完全无网络的环境完成同时提供 Whisper、Faster Whisper、Whisper.cpp、HuggingFace 等多种推理后端支持 CUDA 与 Vulkan 加速还能对多人对话做说话人识别。5分钟跑起来Linux 用 Flatpak 或 Snap 一键安装flatpak install flathub io.github.chidiwilliams.Buzzsudo snap install buzzPython 方式安装需先装好 ffmpeg 并准备 Python 3.12 环境pip install buzz-captions python -m buzzWindows 与 macOS 安装包官方 .exe / .dmg 安装包可从项目发布页 SourceForge 下载。Windows 安装包未签名安装出现警告时选择“更多信息”再“仍要运行”即可。从源码构建开发版git clone https://gitcode.com/GitHub_Trending/buz/buzz用 CLI 验证首次转录应用启动后也可以用内置命令行直接验证环境。下面这条命令用 Whisper.cpp 的 tiny 模型转录一段中文音频并直接输出 SRT 字幕buzz add --model-type whispercpp --model-size tiny --language zh --srt /path/to/audio.mp3图形界面下的验证方式首次启动会打开主窗口按 Ctrl/Cmd O 导入一段短音频点击 Run任务状态变为 Completed 后双击该行能打开转录结果即代表安装成功。核心流程一图看懂Buzz 的处理链路是一条单向流水线各类输入先统一转成模型可读的音频推理产出生成带时间戳的文本段落落库后可继续编辑、精修或导出。核心模块与职责模块职责buzz/transcriber/封装 Whisper、Faster Whisper、Whisper.cpp、HuggingFace、OpenAI API 等多后端推理buzz/whisper_audio.py音频解码与预处理转成模型可读取的数据buzz/widgets/界面导入任务列表、录音控制、转录查看器、首选项buzz/db/本地数据库存储转录任务与段落级文本buzz/model_loader.py模型自动下载与缓存管理buzz/plugins/插件系统AI 摘要、DOCX 导出、降噪等三个真实场景实战场景一本地音视频文件批量转录按 Ctrl/Cmd O 或点工具栏“”导入一个或多个音频、视频文件也支持粘贴 URL任务行选择 transcribe 或 translate to English语言建议手动指定比自动检测更稳点 Advanced 可配置 Initial prompt初始提示词、Word-Level Timings词级时间戳、Extract speech语音分离点 Run状态变为 Completed 后双击该行打开转录查看器查看器里可搜索、编辑段落文本并导出 TXT / SRT / VTT场景二会议与演讲实时转写打开 Live recording 选项卡选好任务、语言与麦克风配置有限时改用 Whisper.cpp 后端加小模型实时性能更好详见 实时录音文档点 Record 开始录音说话的同时文字持续生成对外演示可点 Presentation window 打开大字版展示窗口高级设置里可调整 Silence threshold、行分隔符与 Transcription stepAppend and correct 模式更准但占用更高需要转写电脑内部播放的声音时先装一个虚拟声卡macOS 的 BlackHole、Windows 的 VB-CABLE 均可把声音路由过去再在 Buzz 里选它作为麦克风。场景三字幕精修、批量与自动化双击任务行打开转录对词级时间戳的转录点 Resize把逐词结果合并成字幕可设最大长度、按标点拆分细节见 编辑与重排文档多人群聊用 Identify speakers 自动标注说话人可试听片段并改成真实姓名批量处理用 CLIbuzz add 支持任务、后端、模型大小、语言、初始提示、输出格式等参数详见 CLI 文档首选项里开启 Watch folder 后监控目录新增的音频会自动进入转录队列配合内置插件做后处理AI 摘要、导出 DOCX、Resize Transcript 自动字幕合并、DeepFilterNet 降噪见 插件文档参数与性能速查模型大小是性能与质量的主要开关Whisper 后端提供以下档位模型大小速度效果资源占用适用场景tiny最快基础低快速草稿、低配机器base快良好低速度与质量平衡small中等良好中等日常转录常用选择medium较慢很好高专业内容转录large最慢最佳很高关键内容、低质量音频large 还有细分版本Large-V3 精度最高但偶尔会“脑补”音频里没有的词Turbo 在速度与精度之间取平衡选型逻辑见 FAQ: 该用哪个模型。调优建议后端选择没有 Nvidia 显卡就选 Whisper.cpp可用 Vulkan 加速集显、CPU 都能跑显存 6GB 以上优先 Faster Whisper比原生 Whisper 快一个量级依据见 FAQ内存吃紧时在模型首选项里下量化版模型如 q5或用 BUZZ_REDUCE_GPU_MEMORY 环境变量开启 8bit 量化变量说明在 首选项文档线程数环境变量 BUZZ_WHISPERCPP_N_THREADS 默认是 CPU 核心数的一半16 线程机器设为 8 比盲目加线程更快同样见 首选项文档专业领域人名、术语易错时把常见词写进 Initial prompt 可显著减少拼写错误方法见 文件导入文档排障手册转录太慢换更小的模型或改用 Whisper.cpp 后端显存 6GB 以上的机器可换 Faster Whisper速度会快一个量级识别错误偏多手动指定语言代替自动检测补充 Initial prompt 给上下文仍不理想就换大一号的模型录音报 PaErrorCode-9999检查系统隐私设置是否授予 Buzz 麦克风权限Windows 在 设置 → 隐私 → 麦克风并尝试临时关闭杀毒软件断网环境能否使用可以联网机器下载好模型后把模型缓存目录Linux 为 ~/.cache/Buzz整体拷贝到离线机的相同位置GPU 加速不生效Linux 需 CUDA 12 及 cuBLAS、cuDNNWindows 安装包已内置 GPU 支持老显卡兼容有问题时可设 BUZZ_FORCE_CPUtrue 强制走 CPU老电脑无法运行Buzz 要求 CPU 支持 AVX2 指令集非常老的机型不在支持范围内崩溃排查与日志位置见 FAQ结语Buzz 把音频转录整条流程收进你的电脑离线优先、后端可选从单文件转录、实时演讲字幕到批量自动化都能覆盖插件机制让后处理也能按自己的需求扩展。想参与改进看 CONTRIBUTING.md 即可上手遇到问题也欢迎到项目 issue 区反馈。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表