
TMSpeech 免费离线语音转文字完整指南从装模型到实时字幕【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeechTMSpeech 是一款 Windows 上的免费开源离线语音转文字工具。它抓取电脑正在播放的声音在本机实时转成字幕——全程不联网不需要注册账号声音数据也从不离开你的电脑。普通笔记本上 CPU 占用通常不到 5%解压、装模型、点一下开始三步就能让屏幕上的视频长出字幕。下面按我自己第一次上手的顺序走一遍每一步该去哪、碰到问题怎么办都写在对应位置。第一次打开 TMSpeech解压、装模型、点开始拿到 Release 里的压缩包后解压双击运行 TMSpeech.exe。首次启动它会自动创建配置文件和日志目录桌面拖一个快捷方式以后点开就能用。习惯动手的同学也可以拉源码自己构建git clone https://gitcode.com/gh_mirrors/tm/TMSpeech先别急着点开始识别。识别引擎只是骨架真正干活的是语言模型没装模型时它是转不出字的。打开设置切到资源标签页这里列着社区仓库提供的模型目前是中文、英文和中英双语三个选项都是 Zipformer-transducer 系列的流式模型流式指边说话边出字不用等整段说完。以中文模型为例体积在 300MB 级别点安装后等进度条走完条目变成已安装就完事了。装完回到主界面点开始识别。你听到的声音会即时变成字幕之后这一节就不用再管了。顺便说一句它内部发生了什么音频用 WASAPI 低延迟采集WASAPI 是 Windows 自带的音频接口先过一圈环形缓冲区防止丢数据再交给流式引擎边采边识别最后补上标点才上屏——整条链路都在本地跑这就是它既快又不传数据的原因。配置本身存在%AppData%/TMSpeech/config.json改完即热生效不用重启程序。下一步确认主界面上已经有字在滚动再看下一节把音频源调对。音频源怎么选系统内录、麦克风、单进程决定录什么的是设置里音频源一栏的三个选项系统音频内录抓取电脑正在播放的全部声音靠的是 WASAPI 的 Loopback 捕获。适合会议软件、网课、视频播放。它有个很实用的特性——即使你把系统音量拉到 0识别照样进行因为它是从系统内部直接取音频流的不经过喇叭。麦克风录你自己的声音适合口述草稿、语音笔记。进程音频只盯住某一个应用的声音比如只录某个播放器其他程序一概无视。对多数人来说第一选择就是系统音频覆盖面最广只有明确想录麦克风或单个程序时才换另外两种。下一步音频源选好后把字幕窗口摆到你顺手的位置。字幕窗口怎么用拖动、改样式、翻历史字幕显示在一个无边框小窗口里随便拖、随便拉伸。右键可以调字体、字号、颜色、透明度、阴影把它压在视频画面下方或会议窗口旁边基本不挡内容。与此同时识别结果在按日期自动写进我的文档下的 TMSpeechLogs 文件夹。一堂网课听完打开当天的文件稍作整理笔记就有了。历史记录窗口里选中内容右键或 Ctrl-C 就能复制方便把关键段落摘出去。下一步如果字幕质量不满意先别怪它去换引擎——下一节讲怎么选。三种识别引擎对比默认 Sherpa-Onnx 够用吗设置里语音识别一栏的下拉框里有三档Sherpa-Onnx 离线识别器默认项基于 CPU 优化装好模型即用。作者实测在 AMD 5800U 笔记本上占用不到 5%大多数人选它最省心。Sherpa-Ncnn 离线识别器追求速度时可以试能调用 GPU 加速Vulkan 计算对资源调度的玩法更激进。命令行识别器面向进阶玩家的开放接口可以自己接任意外部识别程序下面单独讲。如果你只是想把功能用起来保持默认不动它。下一步想折腾外部识别程序的朋友往下看。命令行识别器把任何识别程序接进来以及它背后的插件架构命令行识别器的工作方式很直接TMSpeech 启动一个你指定的外部子进程子进程的标准输出按约定格式吐识别文本标准错误输出则写进日志文件双方统一 UTF-8 编码。输出以单换行结尾表示更新当前句子以多换行结尾表示当前句子结束。这个设计留了个巧思单换行的临时结果允许被后续输出修正只有完整句子才落进历史记录——模型可以一边出字一边改错最终留下的是一条稳定结果。代价是子进程要自己采集音频所以这种模式下设置里的音频源切换不生效。另外两个小细节参数用空格分隔含空格的路径要加双引号如果跑的是 bat 脚本开头用 隐藏回显、结尾别加 pause。仓库的 external_recognizer/ 目录里放了几份可直接参考的 Python 脚本照着改就能起一个原型。顺带把项目的骨架也说一下因为命令行识别器正是它最直观的例子TMSpeech 是核心框架 功能插件的结构核心层src/TMSpeech.Core/负责插件管理、任务调度、配置和资源下载具体能力全放在 src/Plugins/ 下的独立插件里——每个插件带一份描述文件实现音频源、识别器、翻译器之一的接口启动时自动被扫描加载。所以想加新的音频来源或识别引擎写个新插件丢进去就行核心代码一行不用碰。下一步日常使用中遇到的坑最后一节集中处理。常见问题快速排查识别不准、录不到声音、找不到历史识别准确率不理想。先排查环境背景音是否太吵、是不是多人同时说话、音量设置是否合理再确认音频源选对了。这些都正常多半是模型与你的场景或口音不匹配——换个模型试试也可以在设置里把模型路径指向其他开源流式模型。录不到系统声音。这通常不是 TMSpeech 的问题而是 Windows 自己的设备设置打开声音控制面板的录制标签页启用立体声混音看不到就右键空白处勾选显示禁用的设备再拿它当音频源。找不到历史记录。确认我的文档/TMSpeechLogs文件夹存在且有写入权限权限异常时用管理员身份运行程序一般能解决。CPU 占用偏高。优先用默认的 Sherpa-Onnx 引擎换更轻量的模型或者关掉实时标点这类附加处理都能省出一部分开销。配置改乱了。没关系Release 包里附带一个重置配置的脚本跑一下现有配置就被清掉程序回到默认状态新手可以放心调。最后多说一句项目是开源的代码主体在 src/ 目录入口清晰好找下手机会。哪里用得不顺手、想要什么功能直接提 Issue 或发起讨论发现了效果更好的开源识别模型也欢迎推荐给社区。去 Release 页面拿最新压缩包解压、装模型、点开始识别——从电脑出声到屏幕出字整个过程几分钟就够。【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考