尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Xiaomi MiMo-V2-TTS 发布:为 Agent 注入灵魂,从此刻开始发声

Xiaomi MiMo-V2-TTS 发布:为 Agent 注入灵魂,从此刻开始发声 Agent 时代已然来临——智能体们能看、能听、能行动甚至能调用工具解决问题。但一个真正的智能伙伴不该只有“执行力”更应有“表达力”。今天我们发布 Xiaomi MiMo-V2-TTS 语音合成大模型专为 Agent 时代的全模态交互而生让智能体不仅能理解世界更能用有温度、有情感、有灵魂的声音与人对话。引言Xiaomi MiMo-V2-TTS 是小米自主研发的语音合成大模型。它基于自研 Audio Tokenizer 和多码本语音-文本联合建模架构经过上亿小时语音数据的大规模预训练与多维度强化学习实现了高度可控的多粒度语音风格控制。MiMo-V2-TTS 支持从整体风格定调到局部情绪表达的精准调节能在同一句话内完成语气转折和情感递变真实还原人类说话的自然韵律在唱歌时也能准确表达音高和节奏自然且富有表现力。在训练过程中MiMo-V2-TTS 首先通过超大规模语音-文本混合预训练在海量数据中习得了强大的跨模态对齐与理解生成的统一能力在此基础上通过少量高质量监督数据的微调模型获得了可泛化的多粒度与多风格指令控制能力。为进一步激发模型在大规模预训练中积累的高表现力语音生成潜力我们引入了多维度强化学习兼顾了稳定性与表现力。具体而言MiMo-V2-TTS 在强化学习阶段围绕更自然的韵律、更稳定的音质、更准确的字词表达、更高质量的音色克隆以及不同场景下恰当的语气和表达方式等多个维度持续优化。得益于多层码本建模架构模型在高保真的离散 token 空间中对语音进行建模充分保留了原始语音中的丰富信息使强化学习阶段能够直接利用语音相关奖励信号对模型进行优化从而让多维奖励信号更有效地作用于生成过程。模型概览模型名称: MiMo-V2-TTS音频 Tokenizer: 自研 MiMo Audio Tokenizer核心技术:自研多码本语音建模架构— 创新建模范式实现更精细的语音特征捕捉与还原超大规模预训练— 语音数据量突破上亿小时覆盖丰富的说话风格与场景赋予模型强大的泛化能力多维度强化学习后训练— 系统性优化表现力与稳定性让生成语音既生动又可靠可泛化的语音风格指令控制MiMo-V2-TTS 支持从整体到局部的多层次语音风格控制。用户可通过自然语言指令设定整体语音基调同时对句内局部片段进行细粒度的情绪调节实现同一语句中语气转折与情感递变的自然过渡——从全局定调到局部雕刻一句话内见起伏。Achoo! Ahem. I—I really [cough] think I am coming down with a terrible [cough] terrible cold.这会……打了个哈欠呵啊——这会到底还得开多久啊啧压低声音我都快听睡着了。那个那个……咱们等会儿中午吃啥紧张深呼吸呼……冷静冷静。不就是一个面试吗……语速加快碎碎念自我介绍已经背了五十遍了应该没问题的。加油你可以的……小声哎呀领带歪没歪大舌头口齿不清我没醉谁说我醉了再来……再来一杯我跟你说我、我心里苦啊……你懂什么呀你强大的文本理解能力模型在预训练阶段通过大量文本-语音对齐数据习得了书面语与口语表达之间的映射关系能够智能识别文本中的各类格式信号——如标点符号、语气词、强调标记等——并将其自动转化为恰当、自然的语音表达全程无需用户额外标注或手动干预。Ugh... pffft... oh, pleeeease! You actually think I care? I am SO. TOTALLY. OVER. THIS. ENTIRE. THING.Wait, w-what do you mean? The final exam is scheduled for TODAY?You are UN-BE-LIEVABLE! I am sooooo done with your constant lies. GET. OUT!超越语音方言·角色·歌声MiMo-V2-TTS 不止于标准语音生成还具备丰富的多元表达能力支持多种方言的自然发音可进行角色扮演式的风格化演绎更能实现高质量的歌声合成——让同一个模型既能说、能演、也能唱。方言支持东北话、四川话、河南话、粤语、台湾腔……角色扮演师父莫怕俺老孙刚才翻到那山头看过了前面树林子里透着股妖气。你们先在这石头上歇着且容俺去打个头阵探探什么来路示例歌曲我怎么变这样变得这样倔强每一步的地方每一站都不会忘。舞台上远远的光落在我的肩膀想起第一次那个模样。我怎么变这样变得这样疯狂用这灿烂时光绽放不一样的光。就算黑夜太漫长风景全被遮挡抬头就有一片星光。下一步MiMo-V2-TTS 是我们语音技术路线图上的重要里程碑但绝非终点。在我们的规划中中英文之外更多语种的覆盖以及与 MiMo-V2-Omni 多模态理解能力的深度融合——让 Agent 不仅能看懂世界、理解世界更能以富有表现力的人类声音去讲述这个世界。语音 Agent 时代需要的不只是听得清的声音而是有生命力的声音。我们正在打造它们。END
返回列表