当视觉AI把“超载“信息塞进像素时,Yandex研究院找到了减负神器

发布时间:2026/7/27 20:03:20

当视觉AI把“超载“信息塞进像素时,Yandex研究院找到了减负神器 这项由Yandex Research俄罗斯知名科技企业旗下研究机构主导完成的研究论文编号为arXiv:2605.16147v2于2026年7月6日公开发布。感兴趣的读者可以通过该编号在arXiv平台检索到完整原文。每个人都有过这样的经历当你把一个房间的所有杂物全塞进一个壁橱时那个壁橱会变得一团糟你需要的东西永远找不到不需要的东西又总是掉出来。AI图像生成模型也面临着类似的困境——当它需要同时处理大量信息时某些储物格会严重超载导致生成的图片质量下降。而这项研究发现了一种优雅的解决方案给那个拥挤的房间额外增加几个专用储物柜。这些额外的储物柜在学术上被称为寄存器令牌Register Tokens它们能够吸收多余的杂乱信息让整个系统运转得更流畅、更高效。研究团队深入分析了当前最流行的图像扩散模型一种AI生成图片的技术框架发现了一个令人出乎意料的现象即使这些模型并不像之前的视觉AI那样存在明显的信息超载症状增加这些专用储物柜仍然能带来显著的质量提升。更重要的是研究团队还发明了一种叫做寄存器引导Register Guidance的全新技巧能够进一步利用这些储物柜来优化AI生成图片的细节和结构。一、房间里的壁橱困境视觉AI的旧问题在深入了解新发现之前有必要先理解这个领域的一段历史。现代视觉AI通常基于一种叫做视觉变换器Vision Transformer简称ViT的架构。这种架构把图片切成很多小方块就像把一幅画切成拼图碎片然后用一种叫做自注意力机制的方法让这些碎片互相交谈逐渐理解图片的整体内容。研究人员早就发现ViT在处理图片时会出现一个奇怪的问题某些拼图碎片会变得异常沉重它们的数值远超其他碎片。而这些超重的碎片往往对应图片中背景、天空这类无聊的区域不包含什么有用信息。这就好比你的壁橱里明明应该放重要东西的位置却被一堆废纸盒子占满了。这导致AI的注意力地图一种可视化AI看哪里的工具出现混乱影响了模型在图像分割、目标检测等任务上的表现。2023年来自Meta的研究人员提出了一个聪明的解决方案专门增加几个寄存器令牌作为专用储物柜。这些令牌不对应图片中的任何区域它们的唯一任务就是充当垃圾桶把那些本来会塞进拼图碎片的多余信息吸收走。实验证明这个方法非常有效视觉AI的注意力地图立刻变得干净清晰。二、扩散模型截然不同的图片生成方式视觉变换器主要用于理解图片而另一类模型则专门用于生成图片。这就是大名鼎鼎的扩散模型Diffusion Model也是Stable Diffusion、DALL-E等AI画图工具背后的核心技术。扩散模型的工作原理可以理解为一个逆向去噪过程。给一张完全随机的噪声图就像老式电视机没有信号时的雪花屏让AI一步步把噪声去掉最终变成一张清晰的图片。这个过程需要经过很多步每一步AI都要判断这些噪声里藏着什么图案然后去掉一部分噪声。近年来扩散模型也开始采用变换器架构这类模型被称为扩散变换器Diffusion Transformer简称DiT。更具体地说有两种训练方式一种是在潜空间中训练先把图片压缩成更紧凑的中间表示在这个压缩空间里做去噪最后再还原成图片另一种是直接在像素空间中训练对原始像素直接进行去噪这种方式更接近我们实际看到的图片。由于扩散变换器在结构上越来越像视觉变换器研究团队自然而然地产生了一个问题扩散模型会不会也遇到同样的壁橱超载问题寄存器令牌对扩散模型有用吗三、出人意料的发现没有病症但药还是有效带着这个问题研究团队展开了系统性的调查结果发现了一个颇为有趣的现象。首先他们检查了扩散变换器是否存在之前在视觉变换器中发现的那种超重拼图碎片问题。答案是几乎不存在。与视觉变换器不同扩散模型的拼图碎片们数值分布非常均匀没有哪几个会突然暴涨。这从注意力地图也能看出来——视觉AI的注意力会莫名其妙地聚集在背景区域那就是超重碎片所在的地方而扩散模型的注意力则老老实实地集中在图片的主体对象上。按照这个逻辑推断既然扩散模型没有旧问题那寄存器令牌应该没有用武之地。然而研究团队实际测试后发现完全相反的结论给扩散模型加上寄存器令牌图片生成质量明显提升了。以衡量图像生成质量的标准指标FID数值越低越好来看以一个中等大小的像素空间扩散模型pDiT-B/16为例训练200个轮次后没有寄存器令牌的版本FID为7.39而加上寄存器令牌后降到了5.30提升非常显著。更大的模型pDiT-L/16同样如此从4.13降到了3.17。这就好比一个房间里没有明显的杂乱但你仍然发现给它加上几个专用储物柜之后整体的居住体验和办事效率提升了——因为这些储物柜承担了一些原本并不明显但实际上存在的隐性负担。四、寄存器里装着什么两种截然不同的角色为了理解这些额外储物柜到底在做什么研究团队深入分析了寄存器令牌的内部状态发现了一个双重身份的现象。给扩散模型加上寄存器令牌之后这些令牌自身会发展出异常高的数值。换句话说虽然原来的拼图碎片没有超载问题但寄存器令牌加进来之后自己成了高数值令牌。这就像原来的房间虽然没有壁橱超载但新加的专用储物柜里很快就堆满了东西。这些堆满东西的储物柜究竟装的是什么研究团队用一种叫做线性探测的技术来分析简单来说就是检查这些令牌里面的信息能不能用来判断图片属于哪个类别比如是猫、狗还是汽车。结果非常有趣不同的寄存器令牌呈现出截然不同的性格。有些令牌数值极高但分类准确率极低接近于零——这些令牌是纯粹的垃圾桶专门吸收那些需要从拼图碎片中卸载的杂乱信息就像一个什么都往里扔的杂物箱。另一些令牌数值适中但分类准确率很高接近90%——这些令牌则像一个精心整理的档案柜存储着关于图片整体内容的有用信息。研究团队还通过可视化这些令牌的注意力分布发现了更细腻的专业化分工某些分类准确率高的令牌专门关注图片的背景比如丛林环境另一些则聚焦于前景物体比如鸟类还有一些专注于特定细节比如树枝、鸟喙。而那些纯粹充当垃圾桶的令牌注意力则没有任何有意义的空间结构。这种分工现象意味着寄存器令牌不只是被动地吸收垃圾而是主动地参与了图片内容的组织和表达。五、高噪音才是关键为什么像素空间更需要储物柜研究还发现了一个重要的规律寄存器令牌对不同类型的扩散模型效果差异悬殊。在像素空间训练的扩散模型从中获益最大在VAE潜空间一种常见的压缩表示空间训练的模型获益中等而在RAE潜空间一种基于DINOv2视觉AI的高质量压缩空间训练的模型加上寄存器令牌后性能甚至略有下降。为什么会有这种差异研究团队通过测量中间层特征的总变差TV一种衡量特征图是否平滑的指标找到了答案。像素空间的扩散模型产生的中间层特征异常嘈杂和不规则而潜空间模型的中间层特征则相对平滑整洁。这一点与两类模型的数值大小也吻合像素空间模型的特征数值远高于潜空间模型。这就解释了差异的根源像素空间训练本质上更困难因为图片像素中包含大量高频细节和噪声AI需要同时处理整体语义这是张猫的图和低级细节每一根猫毛的走向信息混杂在一起导致所有拼图碎片都承受着沉重的信息负担。寄存器令牌在这种情况下提供了一个宝贵的减压阀让拼图碎片能够把全局信息卸载到专用储物柜里专注于处理局部细节。而潜空间模型由于原始信息已经经过了高质量的压缩和整理中间层特征已经足够干净寄存器令牌额外干预的必要性就小得多。RAE潜空间尤其如此因为它使用了专门为图像语义设计的DINOv2编码器特征已经非常有序。六、寄存器引发的时间维度高噪音阶段最关键扩散模型生成图片的过程是一个时间序列——从嘈杂到清晰需要经过几十到几百步。研究团队发现寄存器令牌对不同时间点噪声程度不同时的影响并不均等。通过计算不同时间点和不同层次的特征总变差比值有寄存器令牌除以没有寄存器令牌研究团队制作了一张热力图。这张图清晰显示在噪声最强的早期阶段t接近0时寄存器令牌带来的特征平滑效果最为突出比值远低于1意味着特征明显更平滑而在噪声较少的后期阶段t接近1时这种效果逐渐减弱比值趋近于1。这个发现有着深刻的意义在扩散模型的生成过程中早期高噪音阶段决定了图片的整体结构和主要内容后期低噪音阶段则负责细化细节。寄存器令牌在最关键的整体结构阶段效果最好这正好解释了为什么它们能够让生成图片的整体布局和对象结构更加连贯合理。七、放在哪里、放多少寄存器的使用细节与视觉变换器相比扩散模型对寄存器令牌的使用方式有两个显著不同点这些细节非常重要。第一个不同是放置位置。在视觉变换器中寄存器令牌从第一层就开始加入贯穿整个网络。但在扩散模型中这样做反而会拖累性能效果跟完全不用寄存器差不多。最有效的做法是从第4层开始加入总共12层一直到第11层但最后一两层的贡献也不大4到9层的配置也表现良好。研究团队的解释是在早期层次模型还没有形成有意义的语义结构这时候加入的寄存器令牌只能捕获低级、无意义的信号反而给后续层次传递了错误的引导。通过对比线性探测的结果可以发现从第0层就开始的寄存器令牌很多都处于一种两不像的状态——数值不高不像垃圾桶分类精度也低不像档案柜——纯粹是浪费位置。第二个不同是数量。视觉变换器通常用4个寄存器令牌就够了但中等大小的扩散模型B级别需要32个才能达到最佳效果。这说明扩散模型中积累的需要卸载的信息量远比视觉变换器多需要更多的专用储物柜来分担。八、隐形的寄存器现有模型早就在这样做了研究中最精彩的一个发现是现有的一些高性能扩散模型在完全没有意识到寄存器令牌这个概念的情况下已经自发地演化出了类似的机制。近期有一种叫做上下文类别条件In-Context Class Conditioning简称IC的技术在像素空间扩散模型中非常流行代表性工作是JiT模型。这种技术的核心思路是把类别标签比如这是一张猫的图对应的特征向量复制多份作为额外的令牌一起输入网络让模型在生成过程中始终记住要生成什么类别的图片。研究团队对JiT模型的这些额外类别令牌进行了同样的分析发现了与寄存器令牌几乎完全相同的行为模式部分令牌成为高数值的垃圾桶另一部分令牌存储了远超类别信息的丰富全局语义。更关键的是从FID数字来看IC模型的提升与纯寄存器模型的提升相当甚至略好。这说明这些类别令牌的绝大部分贡献来自于它们扮演寄存器的角色而非它们携带的类别信息本身。当然IC略好于纯寄存器这一点也说明类别信息确实有额外的帮助让模型一开始就有了更好的语义出发点。但核心贡献是寄存器机制这解释了为什么在扩散模型领域加入这类额外令牌往往能带来超出直觉预期的性能提升。同样有趣的是在大型文字生成图片的扩散模型如FLUX、SD3.5等中研究团队分析了这些模型中文本令牌的数值分布发现文本序列中也有一些令牌呈现出高数值的垃圾桶特征而图片区域的令牌则保持均匀。这进一步说明了一个普遍规律扩散模型需要这种专用的信息卸载机制当系统里有不参与生成损失计算的额外令牌时这些令牌就会自发承担起这一角色。九、寄存器引导用弱版自己来提升生成质量理解了寄存器令牌的作用后研究团队进一步思考能不能主动利用这种机制让生成效果更上一层楼他们注意到一个有趣的现象对同一个模型有寄存器令牌和没有寄存器令牌的版本生成的图片内容整体一致同一只狗、同一个场景但结构细节差异明显——没有寄存器的版本对象结构更混乱细节更模糊但整体布局类似。这让研究团队联想到了一种已有的技术叫做自动引导AutoGuidance其核心思路是用一个更弱版本的模型来引导更强版本就像让一个经验丰富的厨师按照见习厨师的食谱反向操作——哪里做得不够就往那个方向加强。把这个思路移植过来就得到了寄存器引导Register Guidance简称RG在生成图片的每一步同时运行有寄存器令牌和没有寄存器令牌的两次预测然后沿着两次预测之差的方向放大相当于在原有预测基础上额外增强有寄存器版本比没有寄存器版本多了什么的部分。实现这个方法的代码非常简洁每一步只需要多运行一次网络不带寄存器计算两次预测的速度向量之差然后按照一个控制强度的参数w_rg加权叠加到正常预测上即可。不过当使用两个分开训练的模型时会出现一个问题在高引导强度下生成图片会出现明显的人工痕迹和混乱。这是因为两个独立训练的模型虽然生成了类似的内容但在细节层面存在不对齐差值中包含了无意义的噪音。研究团队的解决方案非常巧妙用一个单一的模型同时支持有寄存器和无寄存器两种模式在训练时随机以一定概率比如5%丢弃所有寄存器令牌。这样同一个模型对同一张图的两种预测在内容上高度对齐差值中就只剩下真正有意义的寄存器带来的提升部分消除了人工痕迹。测试结果证实了这一点使用单一模型的寄存器引导随着引导强度增加图片质量持续改善而没有出现人工痕迹对象结构更连贯视觉细节更清晰。十、与经典引导技术的搭配11大于2现有的AI图片生成系统通常会用一种叫做无分类器引导Classifier-Free Guidance简称CFG的技术来增强条件控制——比如确保生成的图片确实符合一只橙色的猫坐在沙发上这样的文字描述。研究团队发现寄存器引导和CFG解决的是不同层面的问题CFG主要强化生成什么内容、类别的精准控制而寄存器引导则改善生成得好不好结构连贯性、视觉细节。两者互不干扰可以同时使用而且联合使用比单独使用任何一种效果都更好。在实验中对中等大小的模型JiT-B/16单独使用CFG能达到3.71的FID单独使用寄存器引导能达到3.46最优参数下而两者联合使用则进一步降低到3.32。在更大的模型上这种提升同样一致JiT-L/16联合使用后FID达到2.16JiT-H/16达到1.80已经与那些参数量多出许多的大模型相媲美。实施细节上研究团队还发现了另一个改善点不需要在整个去噪过程的每一步都应用引导可以只在特定的时间区间内应用比如寄存器引导只在t0.03到0.9之间应用这与早期的区间引导研究结论一致能够在不增加计算量的情况下进一步优化结果。此外研究团队还探索了让寄存器令牌和拼图碎片使用各自专用参数的双流架构发现在保持自注意力层共享的前提下对归一化层RMSNorm、调制层adaLN和全连接层MLP使用分开的参数能在仅增加约14%参数量的情况下进一步提升性能。这种紧凑双流设计B级别的FID从3.71降到3.41L级别从2.47降到2.32也与表示对齐方法REPA兼容二者结合使用还能进一步改善效果。归根结底这项研究揭示了一个之前被忽视的现象扩散模型其实一直渴望有一些专用的信息卸载空间只是在没有寄存器令牌的情况下这种需求没有适当的出口导致所有的信息压力都落在本来应该专注于局部去噪的拼图碎片上。寄存器令牌的引入相当于给一个长期超负荷工作的员工配备了专职助理工作效率自然大幅提升。这项研究的另一个有趣含义是当我们看到AI文字生成图片系统中的文本令牌或者任何其他不直接参与损失计算的额外令牌都可以用这个框架来理解它们的角色。它们很可能并不只是在传递原本设计的信息类别、文本描述同时还在默默地扮演着寄存器的角色。这为理解当前最强大的图像生成模型提供了一个新的视角。对于普通用户而言这项研究意味着未来基于JiT架构的像素空间扩散模型通过简单地在推理时启用寄存器引导就能在不改变模型架构的情况下免费获得更高质量的生成图片——更清晰的对象边界、更合理的空间布局、更丰富的视觉细节。这种改进与我们已经熟悉的CFG增强是互补的两者叠加使用能获得比任何单一技术更好的效果。感兴趣的读者可以通过arXiv编号2605.16147查阅完整论文了解所有技术细节和实验数据。QAQ1扩散模型加上寄存器令牌之后生成图片的质量提升是怎么体现的A主要体现在FID指标的降低上。以中等大小的像素空间扩散模型为例训练200轮后没有寄存器令牌的FID为7.39加上后降至5.30降幅约28%。从视觉上看生成图片的对象结构更连贯细节更清晰整体布局更合理尤其是在早期高噪音阶段中间层特征会变得更加平滑有序。Q2寄存器引导需要重新训练模型吗A不需要完全从头训练。研究团队提供了一种微调方案在预训练好的JiT模型基础上以较低的学习率微调约50轮同时以30%的概率随机丢弃寄存器令牌让模型同时学会有无寄存器两种工作模式。推理时只需额外运行一次无寄存器版本的网络预测计算两者差值并加权叠加即可实现寄存器引导无需两个独立模型。Q3为什么像素空间扩散模型比潜空间扩散模型更需要寄存器令牌A像素空间模型直接处理原始像素其中包含大量高频细节和噪声所有信息混在一起每个位置的特征都承担着全局语义和局部细节的双重压力导致中间层特征异常嘈杂数值偏高。潜空间模型的输入已经经过了高质量的压缩整理特征本身已经足够干净有序。寄存器令牌的核心价值在于为高度混杂的信息提供专用的卸载空间信息越混杂这种卸载机制的效益越大。

相关新闻