尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

TMSpeech 完整指南:免费开源的离线语音转文字实时字幕工具

TMSpeech 完整指南:免费开源的离线语音转文字实时字幕工具 TMSpeech 完整指南免费开源的离线语音转文字实时字幕工具【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech下午三点的周会屏幕里轮流汇报我盯着便签纸越写越潦草。突然被点到名我支吾着说我再补充一下其实根本没听清刚才讲到哪里。散会后对着半页龙飞凤舞的笔记又花半小时补录音才把纪要凑齐。这样的场景重复几次后我开始找一款离线语音转文字工具——不花钱、不上传云端、字幕还得跟得上语速。试了一圈最后留下的是 TMSpeech。一句话说清它把电脑声音实时变成字幕TMSpeech 是一款 Windows 下的免费开源工具干的事很单纯捕获电脑里正在播放的声音会议软件、网课、视频都可以实时转成文字以歌词字幕的形式显示在屏幕上每说完一句就自动存进日志。整个过程在本地完成语音数据不离开你的电脑 。更有意思的是作者最初做它只是为了开会走神后能迅速找回上下文——项目名里的 TM 就来自腾讯会议。就这么个不正经的起点如今成了不少人的会议标配。开会、上网课、做后期这三类人最先受益频繁开会的职场人线上会议动辄一两个小时手动记笔记永远跟不上散会还要重听录音补纪要。挂上它字幕实时滚动散会后打开日志就是一份草稿。网课与外语学习者录播课、外文视频语速快暂停逐句看太累。它把声音变成可回看、可复制的文字听不清的地方瞄一眼字幕就行。内容创作者与后期采访录音、口播素材想快速找重点让电脑把声音播放一遍文字自动落进日志检索、引用都省事。第一次上手五分钟从下载到出第一行字幕整个流程走一遍大概五分钟全程不需要装任何运行环境。拿到软件。在项目的 Release 页面下载最新压缩包解压后双击TMSpeech.exe就能跑它会自动生成配置和日志目录。想自己动手构建也行仓库地址在这里git clone https://gitcode.com/gh_mirrors/tm/TMSpeech选音频源。主界面顶部是红色录制按钮旁边分别是历史记录和设置入口。第一次用先进设置在音频源里三选一系统音频抓整台电脑的声音开会首选麦克风只录你自己进程音频只抓某个指定软件的声音。配识别引擎。在语音识别页选识别器普通电脑用 Sherpa-Onnx纯 CPU 运行最稳妥有独立显卡可以换 Sherpa-Ncnn 用 GPU 加速高手还能选命令行识别器接自己的识别程序。装语言模型。识别引擎是耳朵语言模型才是字典。切到资源页中文、英文、中英双语三个模型随意装点安装等下载完成即可中文模型约 300MB装完状态会变成已安装。开始识别。回到主界面点红色按钮然后正常打开会议软件或播放器。字幕出现在一个无边框小窗口里可任意拖动、拉伸右键还能调字号、颜色、透明度和位置。说完一整句文字自动存入我的文档/TMSpeechLogs按日期归档。进阶玩法把工具用出花样的三个技巧只录一个软件进程音频的正确用法系统音频会把所有声音混在一起——网课配乐、游戏音效全塞给识别器结果自然一塌糊涂。切成进程音频指定只抓某一个软件的音频流其它声音一概忽略识别干净很多。想用更强的模型试试命令行识别器内置模型的准确率基本够用但如果你手头有 SenseVoice 这类效果更好的模型不用等官方集成——切到命令行识别器让它启动你自己的识别脚本脚本往标准输出写什么字幕就显示什么。项目里带着现成的 Python 示例脚本改改模型路径就能跑。散会即纪要历史记录的隐藏用法字幕窗口里的字只能看不能存不每说完一句它就已经自动写进按日期命名的日志文件了。开完会直接打开当天的文本把重复的临时结果删一删一份会议纪要草稿就到手。历史记录窗口里右键单条句子还能直接复制。踩坑自救四个最常见问题与最短解决路径Q点了开始屏幕上没有字幕A先确认音频源。戴耳机说话却选了系统音频自然没动静开着会却选了麦克风也只录到你自己的声音。其次确认播放设备里真有声音在走。如果选了进程音频仍没反应试着以管理员身份运行 TMSpeech。Q识别总是断句、错字多A多半是模型和场景不匹配中文内容就装中文模型中英混讲才用双语模型。再尽量避开背景音乐和多人同时说话这两点比任何参数都管用。Q历史记录找不到A默认保存在我的文档/TMSpeechLogs按日期分目录。如果主界面的历史窗口正常但文件缺失检查一下系统用户文件夹路径和写入权限。Q字幕窗口挡住视频了A右键字幕窗口调低透明度、缩小字号或者直接拖到屏幕角落。它是无边框自由窗口摆在哪都不影响识别。一张表看懂它和付费服务差在哪对比项TMSpeech商业云识别服务其它开源方案隐私 完全本地音频上传云端多数本地费用免费开源按时长计费免费CPU 占用实测约 5% 以内本地只负责传数据5%–30% 不等实时性流式识别边说边出字受网络延迟影响多为分段识别语言中/英文及双语多语言通常单一上手难度装模型即可用注册API 接入常需自己配依赖表格里最扎眼的是隐私那一栏音频全程不离开电脑这是云服务给不了的。TMSpeech 的短板也诚实语言目前以中英文为主多语言场景不如云服务首次配置要自己下模型比打开即用多花几分钟。但换来的是彻底免费和彻底本地。原理不复杂一条从收音到字幕的流水线把它想成一条流水线音频源负责收音——用 WASAPI 环回机制抓取系统正在播放的声音识别器负责听写把声波逐段翻译成文字字幕窗口负责展示日志负责归档。四个环节各自独立靠插件系统拼在一起想换哪一块就换哪一块这也是它扩展性强的根本原因。想深入看这里有开发文档和核心源码开发文档、核心源码。有问题、想贡献去哪里说遇到问题去仓库提 Issue 就好描述清楚系统版本、硬件配置、复现步骤和日志作者和社区都会回。懂 C#/.NET 的话可以直接提 Pull Request给插件体系加新音频源、新识别器发现好用的开源模型也欢迎推荐进来。项目不大回复可能不快但每个问题都会被认真对待。把耳朵解放出来回到那场让我手忙脚乱的周会——如果当时挂着 TMSpeech被点名时瞄一眼字幕就能接上话散会后还能直接拿到一份干净的纪要草稿。这大概就是本地语音转文字最朴素的价值把耳朵解放出来把笔记还给你。下一次开会不妨先让它替你听着。【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表