尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

用 faster-whisper-GUI 把录音变成字幕,全程不联网

用 faster-whisper-GUI 把录音变成字幕,全程不联网 用 faster-whisper-GUI 把录音变成字幕全程不联网【免费下载链接】faster-whisper-GUIfaster_whisper GUI with PySide6项目地址: https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI周五下午六点剪辑师老周对着三个小时的采访录音发愁明天节目上线嘉宾语速快、口音重手动听写根本不现实。在线转写倒是快可嘉宾的隐私内容要传上别人的服务器直接被否了。他最后找到的解法是一款完全本地的音频转字幕工具——faster-whisper-GUI基于 PySide6 开发把 Whisper 识别、WhisperX 后处理、Demucs 人声分离全部收进一个窗口全程离线运行。下面我按老周那晚的真实操作顺序带你从头到尾走一遍。你会发现真正花时间的不是操作而是等你泡好第一杯咖啡。怎样在 10 分钟内把 faster-whisper-GUI 跑起来安装出奇地简单。电脑里有 Python 环境的话依次执行三条命令即可git clone https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI cd faster-whisper-GUI pip install -r requirements.txt踩坑提醒如果你的显卡是 NVIDIA 且想用 GPU 加速装完依赖后补一句pip install nvidia-cublas-cu11或对应 cu12 版本否则程序会报找不到 cuBLAS 的错。没有独显也没关系CPU 模式照样能跑只是慢一些。最后运行python FasterWhisperGUI.py看到启动画面就说明成功了。第一次打开界面先决定用哪个模型启动后是典型的左侧导航加右侧内容区布局。新手最容易忽略的一点是模型选择决定了你后面所有操作的上限。打开模型参数页可以选择加载本地模型也可以在线下载并自动转换格式。模型参数页本地加载或在线下载模型还能一键转换格式模型不是越大越好先对照你的硬件再选你的使用场景推荐模型内存大致需求只想快速验证流程、试玩一下tiny 或 base1-2GB日常会议记录、普通口音small4GB 左右中文或多语言内容多、要求准确medium8GB 左右播客、采访、学术等追求最高识别率large-v316GB老周最终选了 medium这是准确率和速度的平衡点。设备栏选 cpu 还是 cuda取决于你有没有 NVIDIA 显卡精度选 float16快或 float32稳都行。踩坑提醒在线下载模型慢的话去模型参数页点转换模型它会帮你把原版模型转成 CTranslate2 格式转好的文件留在本地以后不用重复下载。拖入文件后这三个转写参数最值得调模型加载完毕切到执行转写页把音频或视频文件拖进列表。这里有个很贴心的设计拖进去的字幕文件会自动被忽略没有音频流的文件会被忽略重复添加的也只保留一份。批量处理几十个文件时这个过滤功能能省掉大量手动筛选时间。接下来去转写参数页新手只需要盯住三处转写参数页语言、翻译、静音阈值等都在这一页语言默认 Auto 自动检测。单语种内容建议手动指定识别更稳。VAD 过滤保持开启跳过没说话的静音段落既省时间又减少幻听。温度默认值就好。只有发现结果里大量重复文字时才把它降到 0.2 左右试试。踩坑提醒中文、日文这类没有空格分隔的语言如果勾选了单词级时间戳导出的 lrc 歌词会碎到每个字一个时间点。只想做普通字幕的话这个选项保持关闭。点下开始键怎么读懂实时识别结果设置完参数点击开始界面会实时滚动识别进度。老周那 3 小时的录音用 medium 模型在 CPU 上跑了大约 40 分钟换 GPU 能压到十几分钟。这个速度主要取决于音频长度、模型大小和硬件属于正常范围不用焦虑。WhisperX 让时间戳对齐和说话人识别一步到位转写完成先别急着导出。如果你的场景需要精确时间轴或多人对话whisperx 才是主角WhisperX 页时间戳对齐和说话人识别都在这个选项卡里两个选项的区别一句话讲透时间戳对齐把每个词和音频里真实的发音时刻对齐误差可压到 0.1 秒内做视频字幕强烈建议开。说话人识别自动区分不同发言人并打标签。设置 min speaker / max speaker 能帮它猜得更准——比如你确定是两个人对话就都填 2。踩坑提醒说话人识别依赖一个额外的 diarization 模型首次运行会自动下载。完全离线且没提前下载的话这一步会卡住跳过即可不影响主流程。导出字幕前分清 srt、vtt、lrc 该选谁识别结果以表格形式展示每一行的文字和时间戳都能直接修改结果页逐行编辑文字和起止时间改完再导出导出时按用途选格式srt剪映、Premiere 等剪辑软件通用的标准字幕vtt网页播放器最常认的格式lrc歌词格式卡拉 OK 和音乐播放器专用txt只要纯文字比如写会议纪要smi给某些老式播放器兼容用。老周导出了 srt 和 txt 两份一份交给剪辑一份留作文字稿存档。遇到带背景音乐的素材先用 Demucs 拆人声综艺片段、带 BGM 的采访识别率会被音乐拖累。这时候别急着转写先去 Demucs 页面Demucs 页把混音拆成人声和伴奏等独立音轨它能拆出人声、鼓、贝斯、其他伴奏等轨道。操作只有四步拖文件进列表、设分段长度、输出音轨选人声、点提取。拆出来的干净人声再丢回转写流程准确率会有肉眼可见的提升。现在就动手给你一份 5 条行动清单如果录音转文字也在折磨你今天就能按这份清单走一遍克隆仓库、装依赖、启动10 分钟之内搞定按内存选模型8GB 以下先别碰 large-v3拖入一段 5 分钟内的短音频试跑熟悉 VAD 和语言选项用 WhisperX 开一次时间戳对齐体验词词到位遇到带音乐的素材先去 Demucs 拆人声再回来转写。最后留个问题给你如果你的会议录音里同时有三四个人发言min speaker 和 max speaker 各填多少才合适答案在 whisperx 页的参数说明里亲手试一次你就懂了。相关资源核心界面源码软件所有页面与业务逻辑的所在地想改功能从这里入手。参数说明文档每个转写参数、VAD 参数、模型参数是什么、怎么调、推荐值多少一页讲清。【免费下载链接】faster-whisper-GUIfaster_whisper GUI with PySide6项目地址: https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表