尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

蚂蚁集团打造“全能选手“:一个模型同时看懂图片又能画图

蚂蚁集团打造“全能选手“:一个模型同时看懂图片又能画图 这项由蚂蚁集团旗下Inclusion AI的AGI研究中心主导完成的研究于2026年4月22日以预印本形式公开发布论文编号为arXiv:2604.20796有兴趣深入钻研技术细节的读者可通过该编号在arXiv平台检索完整论文。说到人工智能大多数人脑海中浮现的可能是两类形象一类是能看图说话、回答问题的聪明助手另一类是能根据文字描述创作精美插图的数字画师。长期以来这两种能力几乎总是由两套完全不同的系统分别承担就好比一家餐厅里前厅服务员和后厨大厨是两拨人各司其职。然而蚂蚁集团的研究团队提出了一个大胆的问题能不能培养一个全能型员工既能端茶倒水又能颠勺炒菜这个全能员工就是本文的主角——LLaDA2.0-Uni。**一、为什么我们需要一个全能模型**要理解这项研究的意义先得弄清楚过去的模型是怎么工作的。在此之前人工智能领域存在两条泾渭分明的赛道一条是理解赛道代表选手是Qwen-VL、InternVL这类模型它们擅长看图理解、回答问题就像一位博学多识的评论家能把一幅画的内容讲得头头是道另一条是生成赛道代表选手是Flux、Z-Image这类模型它们的本领是根据你的文字描述凭空画出图来像一位才华横溢的插画师。问题在于现实世界里的任务往往同时需要这两种能力。当你希望AI帮你改一张照片——先看懂原图再按照你的意图修改——单纯的理解者做不到这件事单纯的生成者又看不懂你的要求。于是人们开始尝试把两套系统拼在一起但这就像把两辆自行车绑在一起假装是一辆摩托车效率低、协调难维护成本也高。更关键的是一个真正融合的系统有潜力让两种能力相互促进。就像一个人既懂绘画理论又有创作实践他的审美判断力和创作水平会彼此滋养远超只懂其中一样的人。这种相互增益是分开的两套系统永远无法获得的。过去也有人尝试做统一模型但效果差强人意。问题出在哪里研究团队把症结归结为三点第一以往统一模型处理图片所用的词典即视觉分词器只懂像素级别的重建缺乏真正的语义理解导致模型在看图理解任务上表现平平第二图片被压缩得太厉害细节丢失画出来的图质量不高第三模型内部的信息流动方式过于民主——所有内容都平等地相互参考这对文字生成反而是一种干扰。正是带着对这些问题的深刻理解研究团队设计出了LLaDA2.0-Uni这套全新的架构。**二、这套系统的核心思路给图片和文字找到共同语言**LLaDA2.0-Uni的整体架构可以用一个通俗的比喻来理解把它想象成一家专业翻译机构专门负责在图像世界和语言世界之间做双向翻译。这家翻译机构由三个核心部门组成分工明确、协作紧密。第一个部门是前台接待负责把输入的图片转换成系统能够统一处理的词汇这个部门使用的工具叫做SigLIP-VQ分词器。普通人可以把它理解成一位非常资深的图片翻译官——当一张图片递到它面前时它不会只盯着每个像素的颜色值看那是只关注表面的低级翻译而是先理解图片里有什么、有什么含义然后再把这种语义理解转换成一套标准化的词汇编号共有16384个词汇可以选用。这种翻译方式的独特之处在于它的训练目标从一开始就是理解而不是重建。传统的图片分词器就像一个靠机械记忆工作的翻译它的评判标准是把图片复原后像不像原来那张只要外表像管它理没理解内容。SigLIP-VQ则不同它直接用图片理解任务来训练自己就像一位靠阅读理解考试来练习的翻译天然地更懂图片里的语义内容。第二个部门是核心处理大脑叫做扩散大语言模型dLLM基于蚂蚁集团之前开发的LLaDA2.0构建拥有160亿个参数规模。这个大脑的特别之处在于两点一是它采用了一种叫做混合专家的结构MoE可以理解成这个大脑里有很多不同领域的专家每当一个问题进来系统会自动决定让哪些专家来处理而不是让所有专家都强制参与每一件事效率大大提高二是它处理信息的方式是扩散而非逐字生成——传统的语言模型像一位一个字一个字往下写的作家而扩散模型更像一位先勾勒出整体草稿再逐步细化的画家能够同时处理多个位置速度更快还能前后照应。这个大脑接收的是经过第一个部门处理后的统一词汇序列——无论是文字还是图片都已经被转换成了同一种语言大脑不需要区分它们的来源只需要在这个统一的空间里做思考和推理。第三个部门是图像渲染工厂叫做扩散解码器。当大脑完成了思考决定了要生成什么样的图片以词汇序列的形式这个部门负责把这些抽象的词汇序列转换回看得见摸得着的高质量图像。它基于另一个预训练的文图生成模型构建专门负责图像的精细还原工作还能在原始分辨率的基础上进行两倍超分辨率处理让图像细节更加清晰。这三个部门的协作方式非常优雅前台接待把图片翻译成词汇大脑在词汇空间里完成所有思考渲染工厂把词汇还原成图片。整个流程用同一种表示方式贯穿始终避免了信息在不同格式之间反复转换时的损耗。**三、分块处理让大脑既能快速推理又不失精准**这里有一个值得深入解释的技术选择因为它关系到整个系统能否正常工作。传统的语言模型处理文字时是从左到右一个词一个词地生成的每生成一个词都会看前面所有已生成的词但不会偷看后面还没生成的词。扩散模型的理想状态则相反——它希望每个词都能看到所有其他词这样才能前后一致地生成高质量内容。但研究发现对于文字内容完全的互看反而会降低质量因为文字的语义有天然的时序依赖关系。而对于从SigLIP-VQ转换来的图片词汇情况又有所不同——这些词汇是按照图像语义训练出来的天然带有一定的顺序感。研究团队的解决方案是分块注意力机制可以用一个生动的比喻来理解把整个输出序列切分成若干个段落段落内部的词可以互相自由参考像扩散模型但段落之间的参考是单向的——后面的段落可以看前面的前面的不知道后面有什么像传统语言模型。这样既保留了并行处理带来的速度优势又维护了前后文一致性的基本规则。同时为了让模型能处理任意尺寸的图片研究团队放弃了复杂的二维位置编码而是采用了一个简单但有效的方法在每张图片的词汇序列前面加上两个特殊的尺寸标记——一个标记高度一个标记宽度。就好比收快递时包裹上写的尺寸标签模型看到这两个数字就知道这张图的规格从而正确地理解图片内容。**四、推理加速不牺牲质量的情况下让系统跑得更快**一个功能再强大的系统如果慢得让人难以忍受也没有实际价值。研究团队为此专门设计了一套名为SPRINT的加速框架这个名字代表稀疏前缀保留与非均匀解掩码。SPRINT从两个维度同时发力。第一个维度处理的是一个随着生成内容增长而愈发严重的问题每次去噪可以理解为每次让模糊草稿变清晰的步骤时系统都要回头看所有已经生成的内容而随着生成内容越来越长这个回头看的开销也越来越大。SPRINT的解决方案是不再强制每次都回头看全部内容而是智能地选出最重要的部分保留其余的暂时忽略。评判重要性的标准由两个因素共同决定一是这个位置的内容在注意力计算中被参考的频率越常被参考说明越重要二是模型对这个位置预测结果的把握度越不确定的地方越需要保留参考。两个因素各占一半权重。另外系统对文字内容和图片内容采用不同的保留比例——图片内容由于在空间上存在大量相似的冗余可以更激进地压缩文字内容尤其是指令和推理链则几乎不压缩。第二个维度处理的是去噪步数的问题。传统做法是不管内容难不难每一步都固定解开相同数量的遮盖。SPRINT则改为自适应策略对于模型特别有把握的位置一次就解开对于拿不准的位置慢慢来、多留几步。这样把解题预算集中用在真正需要的地方总的步数就可以减少。两个维度叠加后SPRINT在几乎不影响生成质量的前提下把系统处理速度提升了约1.6倍。对于文档问答这类长输出任务速度提升甚至能达到3.5倍。**五、图像生成加速从50步到8步质量几乎不打折**渲染工厂部分也面临着速度问题。标准的扩散图像生成需要50次迭代才能生成高质量图片在单张GPU上生成一张1024×1024的图片要花费约33秒这对实际应用来说太慢了。研究团队通过蒸馏技术来解决这个问题——可以把这个过程理解为让一个经验丰富的老师50步模型把自己的知识压缩传授给一个学生8步模型。蒸馏后的学生模型只需要8步就能完成原来50步才能完成的任务速度提升了11.4倍生成时间从33秒压缩到不足3秒而图像质量在各项基准测试上几乎没有明显下降。**六、数据是核心海量且精心筛选的多模态训练素材**再精妙的架构也需要海量、高质量的数据来喂养。研究团队在数据准备上投入了大量工作。在理解类数据方面团队开发了一套从粗到细的OCR数据生产流程先用自动化的OCR工具生成初步标注再用更强大的视觉语言模型进行核查和修正最终在不需要大量人工标注的情况下生产出数以百万计的高质量文档理解训练数据。此外通过目标检测数据集结合模型自动验证构建了空间关系和计数推理数据。整个SFT有监督微调数据集规模约达6000万条样本其中多模态数据与纯文本数据的比例为5:1覆盖了从单轮对话到多轮对话、从单图理解到多图推理的各种场景。在生成类数据方面团队从网络上收集了超过2亿张图片经过三轮筛选——元数据过滤去掉分辨率太低的、美观度过滤去掉视觉质量差的、画质过滤去掉技术质量不达标的——最终留下1.4亿张高质量图片并用最强的视觉语言模型重新生成了更准确、更丰富的图片描述。在图像编辑数据方面团队整合了多个公开的编辑数据集还通过自动化流程生成了新的编辑数据对并用强大的模型对编辑指令进行了质量控制剔除掉那些没有产生可见变化或产生了明显瑕疵的样本对指令不准确的样本则根据实际视觉变化重写指令。在交错生成数据方面团队从一个大型视频数据集出发通过严格筛选时长、美观度、画面清晰度、运动幅度提炼出600万个高质量视频片段每隔5秒采样一帧形成包含2到6张图片的交错图文序列并用模型生成对应的动作描述和场景变化描述。为了让模型具备边推理边生成图像的能力团队还专门构建了约800万条推理增强数据支持先想后画和边想边画两种模式。**七、三阶段训练循序渐进地培养全能能力**有了数据还需要合理的训练计划。研究团队把训练划分为三个递进的阶段就像培养一个全能运动员要先打基础、再专项训练、最后上场比赛。第一阶段是视觉-语言对齐目标是让模型学会看图识意。这个阶段主要用图片描述数据和纯文本数据让模型在保持原有语言能力的同时逐步建立对图片内容的理解。为了应对图片词汇序列可能很长的问题一张512×512的图片会产生约1024个词汇训练过程采用了渐进式分辨率策略生成任务从256×256的小图开始逐步过渡到512×512理解任务则统一用800像素边长的任意分辨率图片。整个阶段处理了约1000亿个词元。第二阶段是多任务预训练目标是拓展模型的能力边界处理更复杂的任务。这个阶段引入了OCR、视觉计数、空间定位、图片编辑、参考图像驱动的生成、风格迁移、多视角生成等多种任务。这是让模型从能看图说话升级到能处理各种复杂视觉任务的关键阶段共处理约2100亿个词元。第三阶段是有监督微调目标是让模型真正能够按照用户指令做事。训练分两步走先在8K上下文长度下训练指令理解和遵循能力再扩展到16K上下文来处理需要长链推理的复杂任务以及长序列的交错生成。这个阶段还引入了一个专门的损失重加权机制来解决训练样本长短不一的问题——长样本和短样本的梯度贡献各自按照序列长度的平方根进行归一化避免长样本主导训练方向也避免短样本被忽视共处理约800亿个词元。**八、实验结果在多条赛道上的表现成绩**LLaDA2.0-Uni在覆盖21个多模态理解基准的评测中表现出了显著超越同类扩散架构统一模型的能力。与此前的扩散统一模型Lumina-DiMOO相比它在MMStar综合视觉理解上的得分为64.1对比61.0在MMMU跨学科视觉推理上得分为50.1对比44.9在数学视觉推理任务MathVista上得分高达68.1而Lumina-DiMOO在这个任务上仅有10.3分。更值得关注的是LLaDA2.0-Uni与专门为视觉理解任务设计、优化的Qwen2.5-VL-7B之间的差距已经非常微小在部分指标上甚至反超——MMStar得分64.1对比63.9计数理解基准CountBench得分86.0对比84.9。对于一个同时要承担生成任务的统一模型来说能做到与专用理解模型几乎平齐是相当可观的成就。在图像生成方面LLaDA2.0-Uni在GenEval基于物体合成的生成评估上取得了0.89的综合分在所有评测模型中位置排在最高分之列特别是在空间位置这一细项上以0.90的得分超越了所有对比模型包括专门做图像生成的模型。在DPG-Bench文本描述对齐生成上它以87.76的总分在统一模型类别中名列第一超过了LLaDA-o87.04和Hunyuan Image 3.086.10等强劲对手。在UniGenBench综合生成能力上它取得了79.63的得分不仅在统一模型中名列前茅在逻辑理解63.99和布局生成90.30两个维度上甚至超越了部分专用生成模型。在图像编辑方面ImgEdit基准测试的总分为3.92在所有统一模型中排名第一显著超越OmniGen23.44和InternVL-U3.67。在需要同时参考多张图片进行编辑合成的MICo-Bench上LLaDA2.0-Uni以47.1的综合得分创下新纪录超越Qwen-Image-Edit35.9和OmniGen233.8。同样是扩散架构的Lumina-DiMOO在这个任务上只有23.3分两者的巨大差距印证了LLaDA2.0-Uni在架构和数据设计上的实质性改进。在推理信息图像生成任务WISE-Bench上LLaDA2.0-Uni以0.68的综合分在所有统一模型中排名第一与生成专用模型LongCat-Image0.65持平甚至略超。更有趣的是当模型切换到先思考后生成的推理模式时得分进一步提升到0.78提升幅度约10%说明理解能力与生成能力的融合确实带来了可量化的增益。**九、交错生成与推理真正让理解和生成协同工作**在各项能力之上研究团队着重探索了LLaDA2.0-Uni最具前瞻性的一项能力交错生成与推理。所谓交错生成就是模型能够在同一个输出中把文字和图片穿插着输出就像讲一道菜的做法时既给出文字说明又配上对应步骤的图片。研究团队为此专门构建了一套新的评测基准InterGen包含150个样本涵盖故事创作、事件预测、过程说明等多种实际场景用Gemini和Qwen3-VL两个强模型作为评判从文字连贯性、文字与图片的对齐程度、前后图片的一致性三个维度打分。对比另一个支持交错生成的模型Emu3.5LLaDA2.0-Uni在故事讲述和时序预测类任务上整体表现更好说明融合训练带来的语义一致性在复杂的多图序列任务中有明显体现。交错推理则更进一步——模型不只是输出文字和图片的交错序列而是在思考过程中同时产生文字推理步骤和对应的说明图示类似于一个解题的学生既写出推理过程又画出示意图。研究团队展示了两个令人印象深刻的案例一是国际象棋残局分析模型逐步考虑每个候选走法并为每一步的棋盘状态生成可视化示意图二是阿特伍德机一种经典的物理力学装置的受力分析模型用文字写出牛顿第二定律的推导过程同时画出对应的受力分析图。这种能力目前还处于早期探索阶段但已经展示出统一架构在复杂推理任务上的独特潜力。**十、还有哪些地方值得继续改进**研究团队在论文中直接指出了当前系统的三个主要局限。SigLIP-VQ分词器在语义理解方面表现出色但在保留图片细节方面存在先天的局限——毕竟它是为理解而非重建设计的。这种局限在图像编辑任务中表现最为明显当需要精确保留原图的局部细节时语义词汇的表示粒度不够细容易出现细节失真。未来需要探索更好的重建技术来弥补这一不足。交错生成与推理的能力目前规模还比较有限主要受制于训练数据的数量和多样性。完全释放这种能力需要更大规模的训练数据以及相应地扩大模型参数量。强化学习方面团队已经开始尝试将强化学习引入统一扩散模型的训练但如何有效地优化这类模型的表现仍是一个难题。未来计划在解决这个问题后向公开社区发布相关方法和模型。说到底LLaDA2.0-Uni最大的意义不只是刷新了几项基准分数。它证明了一件更重要的事在同一套统一框架下让图片理解和图片生成协同工作是完全可行的而且这种统一不需要在两种能力之间做太大的妥协。当模型能够边理解边生成、边推理边画图的时候人工智能才算是开始真正接近人类的认知方式——人类在思考和表达时从来就不是文字与图像截然分开的。这项研究的模型和代码已经在GitHub和HuggingFace平台上公开感兴趣的读者可以通过arXiv编号2604.20796查阅完整论文进一步了解技术细节。QAQ1LLaDA2.0-Uni的SigLIP-VQ分词器和传统VQ-VAE有什么本质区别A传统VQ-VAE的训练目标是把图片压缩再还原还原越像越好所以学到的是像素级特征缺乏语义理解。SigLIP-VQ直接用图片理解任务来训练学到的是语义特征能理解图片里有什么、意味着什么因此在视觉问答等理解任务上表现远超传统方案。代价是无法直接从这些词汇还原图片需要额外的扩散解码器来完成图像重建。Q2SPRINT加速框架对图像生成质量影响大吗A总体影响很小。实验数据显示开启SPRINT后九个测试基准的平均分从76.3降到75.7下降不足1分但处理速度提升了1.6倍。在DocVQA这类长输出任务上速度甚至提升了3.5倍。部分基准如MMMU反而因为自适应解掩码策略把更多计算集中在不确定位置而略有提升。对字符级精度要求极高的OCRBench下降相对明显约2.3分。Q3LLaDA2.0-Uni的交错推理能力现在能用在什么实际场景里A目前处于早期阶段已经能完成需要逐步推理同时配图说明的任务比如物理力学分析、棋类策略分析等需要文字推理图示说明配合的场景。但由于训练数据规模有限这种能力在复杂度和稳定性上还有提升空间。研究团队表示后续会扩大相关训练数据和模型规模并计划将强化学习引入进一步提升推理质量。
返回列表