尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

faster-whisper-GUI 完整使用指南:免费离线语音转文字,把十小时录音压成一个下午

faster-whisper-GUI 完整使用指南:免费离线语音转文字,把十小时录音压成一个下午 faster-whisper-GUI 完整使用指南免费离线语音转文字把十小时录音压成一个下午【免费下载链接】faster-whisper-GUIfaster_whisper GUI with PySide6项目地址: https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI会议纪要、课程回放、采访素材是不是在你电脑里越堆越多想用工具转成文字稿却被云服务的分钟数限制、水印还有敏感内容不敢上传的顾虑劝退。faster-whisper-GUI 就是冲着这个痛点来的一个免费、全程离线运行的语音转文字工具基于 faster-whisper 引擎用 CTranslate2 重写的 Whisper速度比原版快数倍把音视频一键转成 SRT、LRC、TXT 等带时间戳的文本数据自始至终不出本机。五分钟跑起来faster-whisper-GUI 安装命令与启动它本质上是一个 Python 桌面程序界面用 PySide6 搭的 Fluent 风格。三步装完git clone https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI cd faster-whisper-GUI pip install -r requirements.txt再启动python FasterWhisperGUI.py第一次打开左侧导航有五页模型参数、VAD 及 WhisperX、转写参数、执行转写、后处理及输出。别急着点开始——先去模型参数页花两分钟把大脑喂好这一步基本决定后面一半的速度和准确率。转写参数推荐设置语言、温度与 VAD 过滤怎么调转写参数页选项不少真正影响结果的其实就四处language语言中文录音直接指定 zh。选 Auto 会让软件先听前 30 秒猜语言省不了多少时间还可能猜岔。temperature温度控制幻听的旋钮越低越保守。我整理正式纪要时压在 0.0~0.2调到 0.4 往上试出来的稿子开始冒出重复的无意义句子。vad_filter语音活动检测过滤开启后先由 Silero VAD 模型专门判断这一段有没有人说话的小模型筛出有人声的片段引擎跳过其余部分既省时又避免静音段输出幽灵字。默认 threshold 0.5 对多数录音有效底噪大、漏字多时降到 0.4 试试。word_timestamps单词级时间戳让每个字都带上起止时间后面做卡拉 OK 歌词就靠它。VAD 在独立页面还有更细的旋钮min_silence_duration 默认 2000ms连续静音 2 秒判为断句speech_pad 默认 400ms语音段两端各补 400ms 防止咬掉字头字尾。嫌断句太长或太碎优先动这两个值。模型参数怎么选大小、设备与计算精度模型参数页有四个要一起拍板的选项模型大小从 tiny 到 large-v3越大越准也越吃算力。我的实测组合small 跑日常会议快且够用medium 处理底噪较大的录音large-v3 留给要交付的终稿。device计算设备有 NVIDIA 显卡选 cuda没有就 cpu。medium 以下模型 8 核 CPU 跑得动只是比 GPU 慢。compute_type计算精度float16 最快仅 GPUint8 最省内存float32 最稳。显存紧张时int8 large-v3 是性价比最高的组合。cpu_threadsCPU 线程数默认 48 核机器直接调到 8CPU 转写速度大概翻一倍。模型支持从 Hugging Face 在线拉取也可以填本地模型路径并勾选本地缓存软件还能帮你把 Whisper 模型转换成 CTranslate2 格式保存。大模型首次下载比较磨人提前下好放本地最稳。批量音频转写与 SRT 字幕结果编辑参数配好到执行转写页把一整个录音文件夹拖进去——文件列表会自动过滤只认音视频其余文件忽略。点 Start十几个文件排队跑控制台区域能看到每个文件的实时进度中途想删掉某个文件或清空重来都行。结果落在后处理及输出页的表格里起止时间、文本、words单词级时间戳逐行展示转错的字直接双击就地改。改完导出格式覆盖 ASS、JSON、LRC、SMI、SRT、TXT、VTT 七种字幕制作到纯文本存档全都有。WhisperX 说话人识别给纪要标清谁说的整理会议录音最烦的问题永远是这句话是谁讲的。WhisperX 是内置的后处理引擎在 VAD 及 WhisperX 页开启在转写结果之上多做两件事单词级时间戳对齐让字幕卡点更准以及说话人分离按音色把句子归到不同人头上。开启后结果页多出说话人信息min/max speaker 可以限定识别出的说话人数量区间。我拿三人对谈的采访设了 3聚类基本准确后面整理纪要就是复制粘贴的活。Demucs 人声分离先把人声拆出来再转写如果录音背景音很重、人声发虚直接转会漏字。我的做法是先走 Demucs 页——它内置 Demucs 模型Meta 开源的音源分离算法把声音按人声、鼓、贝斯等轨道拆开。文件拖进列表输出音轨选只要人声或选 All Stems 把各轨道一起分离采样重叠度 0.10、分段长度 10 秒都是默认值直接用即可。分离完把人声轨丢回转写识别率能明显上一个台阶处理采访和含 BGM 的素材时尤其好用。单词级时间戳顺手做出逐字滚动的卡拉 OK 歌词前面开了 word_timestamps 的话导出的 LRC/VTT/SMI 文件里每个字都带时间。丢进带歌词插件的播放器作者实测组合是 foobar2000 ESLyric就能得到逐字高亮滚动的卡拉 OK 效果——把课程录音直接变成听力训练素材属于白捡的功能。避坑清单离线转写常见问题与解法pip 装依赖报错在 torch 上requirements.txt 锁了 torch1.13.1cu117CUDA 11.7 版本。显卡环境对不上这个版本时先手动装好匹配环境的 torch再装其余依赖。模型下载慢到怀疑人生首次加载 large-v3 很考验网络。解法是提前下好模型放本地目录界面填模型路径并勾选本地缓存。转写出一堆重复乱码八成是参数没调。先把 temperature 降到 0.0~0.2、开启 VAD 过滤还压不住就换大一档的模型。转写慢得离谱先查设备有 GPU 却还在 cpu 上跑就是配错了纯 CPU 机器就调高 cpu_threads或把模型降到 small。写在最后一句话总结选对硬件匹配的模型、开上 VAD、丢进文件、导出 SRTfaster-whisper-GUI 已经把听十小时录音压缩成等一个下午。今天就可以挑一段短录音按启动 → 配模型 → 调参数 → 批量跑 → 编辑导出走一遍一次就能上手 【免费下载链接】faster-whisper-GUIfaster_whisper GUI with PySide6项目地址: https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表