granite-4.0-1b-speech

发布时间:2026/7/27 14:12:37

granite-4.0-1b-speech 我已经介绍过几款ASR模型包括Parakeet、VibeVoice-ASR和Voxtral Mini 4B Realtime。最近IBM发布了新的granite-4.0-1b-speech模型该模型不仅支持多语言自动语音识别还支持双向自动语音翻译。这个模型在ASR场景中表现良好参数相对较少。英语ASR词错误率Granite-4.0-1b-speech特性新增配置关键词列表的功能以增强名称和首字母缩写词的识别。支持包括英语、法语、德语、西班牙语、葡萄牙语和日语在内的语言。与granite-speech-3.3-2b和granite-speech-3.3-8b模型相比编码器和解码器经过优化实现了更准确的转录质量和更快的推理速度。1、本地部署官方granite-4.0-1b-speech文档已经描述了如何使用transformers和vLLM部署granite-4.0-1b-speech。本文将介绍如何使用mlx-audio在本地部署granite-4.0-1b-speech。1.1 配置虚拟环境uv venv .venv source .venv/bin/activate1.2 安装mlx-audiouv pip install githttps://github.com/Blaizzy/mlx-audio.git --prereleaseallow1.3 下载模型你可以根据计算机配置和实际需要下载相应的量化模型。mlx granite-4.0-1b-speechhf download mlx-community/granite-4.0-1b-speech-8bit --local-dir ./models/granite-4.0-1b-speech-8bit # 或者 hf download mlx-community/granite-4.0-1b-speech-bf16 --local-dir ./models/granite-4.0-1b-speech-bf161.4 运行Granite-4.0-1b-speech模型ASR转录为了测试Granite-4.0-1b-speech模型的ASR能力我使用Vidpai内置的Kokoro引擎生成了对话音频。s0: Hello, how are you today? s1: Im doing great, thanks for asking! How about you? s0: Im fine too. What are your plans for today? s1: Im planning to work on some exciting projects.生成音频后将其重命名为audio.wav。当然你也可以选择任何包含支持语言的音频文件。from mlx_audio.stt import load model load(models/granite-4.0-1b-speech-8bit) result model.generate(audio.wav) print(result.text)成功运行上述代码后控制台将输出以下结果hello how are you today im doing great thanks for asking how about you im fine too what are your plans for today im planning to work on some exciting projects与原始文本相比ASR识别结果正确。对于长音频识别场景我们可以设置stream参数来启用流式推理from mlx_audio.stt import load model load(models/granite-4.0-1b-speech-8bit) for text in model.generate(audio.wav, streamTrue): print(text, end, flushTrue)值得注意的是该模型不支持同时包含多种语言的混合音频否则会在推理过程中抛出解码异常错误消息。2、AST语音翻译language参数启用语音翻译。可用值为英语、法语、德语、西班牙语、葡萄牙语和日语。还支持每种语言的语言编码。LANGUAGE_CODES { en: English, fr: French, de: German, es: Spanish, pt: Portuguese, ja: Japanese, }以下代码将英语音频文件audio.wav直接翻译成法语from mlx_audio.stt import load model load(models/granite-4.0-1b-speech-8bit) # Translate speech to French (using language code) result model.generate(audio.wav, languagefr) print(result.text)运行上述代码后将输出以下结果bonjour, comment allez-vous aujourdhui ? je vais bien, merci pour men demander. et vous ? je vais bien, aussi. que pensez-vous de vos projets ?将上述法语翻译成英语显示内容不完整Hello, how are you today? Im fine, thank you for asking. And you? Im fine too. What do you think of your plans?由于我们的产品目前没有这个要求我没有继续测试。如果你感兴趣可以尝试granite-4.0-1b-speech-bf16模型或测试更多新的音频样本。3、结束语granite-4.0-1b-speech模型的创新之处在于其语音翻译功能这比先进行转录然后再翻译要方便得多。然而翻译的准确性仍然需要改进。如果你有多语言语音识别需求建议你比较Nvidia Parakeet和OpenAI Whisper模型。原文链接granite-4.0-1b-speech - 汇智网

相关新闻