尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

如何在本地快速跑通 MiMo-V2.5-ASR 开源语音识别

如何在本地快速跑通 MiMo-V2.5-ASR 开源语音识别 如何在本地快速跑通 MiMo-V2.5-ASR 开源语音识别【免费下载链接】MiMo-V2.5-ASR项目地址: https://ai.gitcode.com/XiaomiMiMo/MiMo-V2.5-ASR会议刚结束一小时的录音就躺在网盘里没人愿意整理上课、采访、播客靠人工转写真的会把人拖垮。小米 MiMo 团队开源的MiMo-V2.5-ASR做的就是语音识别这件事把音频丢给它吐出来的就是文字中英文夹杂、方言、嘈杂环境都能接住。整个过程可以在你自己的机器上离线完成录音不用传到别处。下面讲清楚怎么把它跑起来、以及几个用顺手之后才知道的技巧。为什么值得试4 个拿得出手的能力 中英混合识别不用手动标语言对话里中文英文来回跳也能转出来。方言覆盖吴语、粤语、闽南语、四川话等中国方言直接可用。歌词转录中英文歌曲即使混着伴奏也能把歌词扒出来。噪声与多人环境吵、收音远、几个人同时说话准确率仍然可用。官方测试数字基准对比提升普通话识别 95.2%2.1%英语识别 93.8%3.5%方言混合 91.5%4.2%嘈杂环境 89.7%5.8%另外标点是从语音的韵律和语义里直接生成的转写结果拿来就能用不用再做后处理。三步完成安装第一步准备环境。Python 3.12 或更高版本CUDA 12.0有 GPU 的话强烈建议上至少 8GB 可用内存。第二步克隆仓库装依赖。git clone https://gitcode.com/XiaomiMiMo/MiMo-V2.5-ASR cd MiMo-V2.5-ASR pip install -r requirements.txt pip install flash-attn2.7.4.post1前两行拿代码第三行装基础依赖第四行装注意力加速库如果它编译太慢可以改下预编译的 wheel 直接装。第三步下载模型。一共两个主模型和音频分词器统一放到 models/ 目录下。pip install huggingface-hub hf download XiaomiMiMo/MiMo-Audio-Tokenizer --local-dir ./models/MiMo-Audio-Tokenizer hf download XiaomiMiMo/MiMo-V2.5-ASR --local-dir ./models/MiMo-V2.5-ASR跑通之后你会看到什么一行命令启动python run_mimo_asr.py如果不想每次进界面填路径也可以在命令行直接把模型和分词器指过去python run_mimo_asr.py --model-path ./models/MiMo-V2.5-ASR \ --tokenizer-path ./models/MiMo-Audio-Tokenizer启动后是一个本地 Gradio 页面。在Speech Recognition页签里你点上传丢进一个音频文件、或者直接用麦克风录音选好语言标签后点 Transcribe右侧就会流出识别结果Model Configuration页签则用来填本地模型路径。用好它的几个小技巧 语言标签怎么选用chinese强制按中文识别、english按英文识别中英混合的音频交给 Auto最省事也最稳。音频格式WAV、MP3、FLAC、OGG 都能吃采样率 16kHz 及以上效果最好。显存与速度基础运行约 4GB 显存就够完整功能建议 8GB 以上一次批量丢多个文件比逐条跑快不少。有卡就上卡CUDA 12.0 以上的 GPU 环境速度提升明显。这些场景都用得上遇到问题怎么办常见用法挑几个会议、访谈录音自动出文字课堂笔记、课程字幕播客内容整理、歌曲歌词提取智能家居、车载的语音输入高频问题支持哪些音频格式WAV、MP3、FLAC、OGG 等主流格式都可以自动检测处理。能实时流式识别吗当前版本主要面向文件转写流式识别还在路上。flash-attn 编译翻车按官方文档下载对应的预编译 wheel手动 pip 安装即可。延伸阅读完整功能说明和模型下载方式看仓库里的官方 README.md想抠模型架构参数和文本生成策略从 config.json 和 generation_config.json 入手MiMo-V2.5-ASR 适合经常跟中英文混合、方言音频打交道又想把转写留在本地跑的人。找一台能跑 CUDA 的 Linux 机器几分钟就能见到第一份转写结果。【免费下载链接】MiMo-V2.5-ASR项目地址: https://ai.gitcode.com/XiaomiMiMo/MiMo-V2.5-ASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表