尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

中国科学技术大学揭开多人互动图像生成的致命缺陷

中国科学技术大学揭开多人互动图像生成的致命缺陷 这项由中国科学技术大学与北京麦石科技联合开展的研究以预印本形式发布于2026年7月30日论文编号为arXiv:2607.27616有兴趣深入了解的读者可通过该编号在arXiv平台查阅完整论文。现在的AI绘图工具已经厉害到令人咋舌。你给它几张朋友的照片告诉它让他们俩来个拥抱它真的能画出来。脸对了衣服对了背景对了感觉挺好——直到你仔细一看咦这人怎么长了三只手两个人的腰好像焊在一起了那条腿是从哪儿冒出来的这不是偶发的小bug而是当前几乎所有顶级AI图像编辑模型都面临的系统性失败。更棘手的是现有的评测工具根本看不见这些错误——AI考官给这些毛骨悚然的图像打出了接近满分的高分。这支研究团队决定正面解决这个问题他们搭建了一套全新的测试体系名叫MPIE-Bench与MPIE-Eval专门用来戳穿那些表面光鲜、内里一团糟的AI绘图结果。一、为什么AI画两个人拥抱会翻车要理解这个问题先想象一个简单场景你请一位画师帮你画一张两个人握手的图。画师对每个人单独画像毫无压力但当两只手交汇的那一刻问题就来了——手指应该如何交叠谁的手在上面两只手腕的角度是否合理这些细节在单人肖像里根本不存在一旦两个人的身体发生接触复杂度就呈指数级攀升。AI的困境与此高度相似但问题更加根本。现有的文字转图像模型是通过海量图片学习视觉规律的而在训练数据里两个人紧密接触的图像本来就少身体各部位的归属关系更难被模型准确把握。于是当你要求AI生成父亲扛着孩子或两名摔跤手缠斗这类场景时模型往往会在接触区域生成一些视觉上说得过去但解剖学上完全不可能的东西——多余的肢体、融合的躯干、无处安放的脚。更令这支研究团队感到忧虑的是现有的评测标准对这种错误毫无感知能力。主流的评测方式基本上在问四个问题画面里有几个人、这些人的身份对不对、有没有做出指令要求的动作、画面好不好看。一张两个人拥抱但彼此身体已经像融化的蜡烛一样混在一起的图依然能在这四个问题上全部得满分。研究团队还发现了一个更讽刺的现象当他们让一个智能AI评委也就是业界常用的视觉语言模型来评价这些图时AI评委对那些融合了肢体的怪异图像给出了0.98到0.99分满分是1分。而人类一眼就能看出问题所在。这说明评测工具本身已经出现了严重的饱和问题——它的尺子太短量不出真正重要的东西。二、2500个真实案例组成的考题库研究团队解决这个问题的第一步是建立一个真正有挑战性的测试数据集——MPIE-Bench。数据集的核心思路来自一个精妙的观察视频里天然就包含了同一批人从互不接触到紧密接触的完整过程。于是研究团队从三个来源挖掘视频素材分别是Pexels平台上的免费商业授权视频、Harmony4D数据集以及CHI3D数据集。这些视频覆盖了街头生活到专业运动的广泛场景。具体的挖掘方法相当聪明。对于每一段视频研究团队会自动计算一条接触密度曲线——在视频的每一帧程序会综合考虑画面中两个人的位置重叠程度、姿势接近程度、运动方向相似性以及相互遮挡情况给出一个代表两人身体有多接近的分数然后把这个分数随时间的变化画成一条曲线。这条曲线的低谷部分就是两人站得很远、轮廓清晰的帧——研究团队从这里截取每个人的独立参考照片曲线的峰顶部分就是两人肢体紧密接触的帧——这成为AI需要生成的目标图像。有了参考照片谷底帧和目标场景峰顶帧研究团队再让一个AI语言模型反向写出编辑指令——也就是根据目标图像的内容写出一条描述动作和接触方式的自然语言指令比如让两人紧紧相拥R2的脸颊贴着R1的脸颊。这条指令将是测试时唯一告诉AI该做什么的信息AI看不到目标图像。整个流程自动产生了大约两万个候选样本经过人工审核去除不安全内容和不合格样本后最终保留了2500个高质量的测试样本覆盖405个不同场景、14种交互类型和四个接触密度等级从完全不接触到高强度接触标记为C0到C3。在这2500个样本里约61%属于两个密度较高的等级也就是身体接触明显的场景。大多数样本涉及两个人但有399个样本约16%包含三人甚至更多最多可达九人。这个设计有一个关键优势因为参考照片和目标图像来自同一个真实场景的同一批人所以这不是随机拼凑出来的假测试而是在考验AI能否还原真实世界里真实发生过的人体接触——这个难度比随便找两张人的照片然后说让他们拥抱要高得多。三、让AI照骨子里打分——MPIE-Eval的设计哲学建好了考题下一步是设计评分标准。研究团队提出的MPIE-Eval包含六个维度像六把不同角度的尺子从各个方向量度一张AI生成图的质量。前四把尺子是现有评测体系里比较成熟的人数对不对Count、人的身份认得出来吗Identity、指令里要求做的事情做到了吗Instruction、画面整体好不好看Quality。这四个维度解决的是任务完成了吗这个问题。真正的创新在后两把尺子解剖完整性Anatomy和接触几何合理性Interaction。这两个维度解决的是身体还是正常的身体吗这个问题。研究团队为什么要用解剖学这个词因为他们选择了一种极其直接的检测方式——对AI生成的图像做3D人体网格重建Human Mesh Recovery简称HMR。这项技术的原理是给一张普通的2D照片程序会尝试在三维空间里推算出照片里每个人的完整骨架和身体形状就像医院里的CT扫描从外部图像推算出内部结构一样。研究团队使用了一个叫做Multi-HMR的公开模型作为唯一的重建工具并且把这个工具的版本冻结确保所有被测AI都用同一套标准量。解剖完整性维度的逻辑是这样的对一张正常的双人图像做3D重建应该能找到两套完整的人体网格图像里所有人形的区域都能被这两套网格解释清楚。但如果AI生成了一条多余的手臂或者两人的腰部融合在一起变成了一个奇怪的形状那么3D重建程序就会发现图像里有些人肉形状的区域对应不上任何一套正常的人体网格——这些区域就是剩余质量是解剖错误的直接证据。接触几何合理性维度的逻辑则是研究团队会测量3D重建得到的两套人体网格之间的空间关系。如果指令要求的是拥抱需要接触但两个网格在三维空间里几乎不相交说明AI画的人其实没有真正接触反之如果指令要求的是站在旁边不需要接触但两个网格大量重叠、一个人的身体穿透了另一个人的身体也是明显的错误。值得特别说明的是这六个维度的分数从不合并成一个总分。研究团队坚持把它们分开报告因为他们发现一个模型可能在解剖完整性上表现很好但在接触几何合理性上一塌糊涂把这两个数字平均掉会掩盖真实的差异。就像一个学生数学满分、语文零分如果平均后报成绩一般就完全误导了对他能力的判断。四、解剖完整性用剩余质量抓住多余的肢体解剖完整性Anatomy的具体计算过程可以用一个侦探寻找不明物体的比喻来理解。程序首先会生成一张人形前景遮罩——找出图像里所有看起来像人体亮度和颜色与人皮肤、衣物相符的区域打上标记。这个过程完全基于传统图像处理没有用到任何AI学习器目的是保证客观性。然后程序把3D重建得到的人体网格投影回2D画面生成一张已解释区域遮罩——图像里哪些地方被正常的人体网格覆盖到了。接下来用人形前景区域减去已解释区域剩下的就是剩余质量——那些看起来像人体但没有被正常人体解释的神秘区域。剩余质量越大说明画面里的解剖问题越严重。研究团队把解剖错误分成四个家族来分别评分。第一个家族是额外或融合的肢体——多出来的或者粘在一起的手脚这通过比较前景遮罩和网格覆盖的差异来检测如果剩余分数很高但没有悬浮的碎片就判定为附着型假肢。第二个家族是漂浮的碎片——完全脱离人体的孤立人形斑块这通过统计孤立的剩余碎片数量来检测。第三个家族是身体结构问题——尺度错误、肢体归属混乱或网格自身穿插这直接来自Multi-HMR的内部质量指标。第四个家族是残余质量——以上三类没有覆盖到的其他人形前景。每个家族都有自己的软性评分函数把原始测量值映射到0到1之间的分数0代表严重失败1代表干净通过。四个家族的分数以固定权重0.40、0.20、0.25、0.15混合得到最终的解剖完整性分数。这些权重在任何模型评分开始之前就已经公开锁定不会因测试结果而调整。五、接触几何合理性量出两具身体之间的距离真相接触几何合理性Interaction的计算围绕两个核心测量展开穿透程度和表面距离。穿透程度用一个叫做凸包穿透代理Vp的量来估计。凸包可以理解为把一个立体形状用保鲜膜裹紧后的外壳。研究团队计算的是两个人体网格的凸包互相重叠的程度——通过测量一个网格里有多少顶点身体上的采样点落在另一个网格的凸包内部得到一个对称内部比例rin再乘以较小那个人体凸包的体积就得到穿透代理值。这个值越大说明两个身体在三维空间里互相穿透得越厉害。表面距离ds则更直接在两个人体网格的所有表面点之间找到最近的一对点测量它们之间的距离。这个距离越小说明两人越接近如果这个值大于某个阈值说明两人的身体根本没有接触到。然后研究团队根据编辑指令中描述的接触意图把每个样本分成三类分别采用不同的权重公式来计算最终得分。当指令明确要求接触比如拥抱、手牵手时穿透分数权重0.45、接近分数权重0.35、质量分数权重0.20——这里既惩罚不当穿透也惩罚距离太远当指令明确禁止接触时穿透分数权重0.55、间隙分数权重0.45——主要惩罚不该有的接触当指令对接触未作明确要求时穿透分数权重0.85、质量分数权重0.15——主要确保没有不自然的穿透。如果3D重建检测到的人数少于预期人数Interaction分数会直接减半——毕竟少了一个人接触关系根本无从评价。如果重建完全失败两个分数都归零确保失败不会被当成成功藏起来。这套接触意图的判断来自对编辑指令文本的关键词解析。研究团队在一个一致性测试样本集上验证了这套解析的准确率达到85.3%而且即便将解析结果替换为人工标注的意图全量数据集上的评分结果几乎没有变化说明这个环节足够稳健。六、测了十个AI没有一个能同时答好两道题研究团队用MPIE-Bench对十个主流AI图像编辑模型进行了系统评测其中三个是闭源商业模型七个是开源模型。闭源的三个是GPT-Image-2、Gemini-3-Pro-Image和Seedream-5-Pro开源的七个包括FLUX.1-Kontext、DreamO、OmniGen2、UNO、ACE、BAGEL和FireRed-Image-Edit。评测结果既令人失望又充满信息量。在AI评委打分V-Inter那一列闭源模型的接触几何合理性得分高达0.98到0.99几乎是满分但在3D网格评分M-Inter那一列这些模型的得分只有0.61到0.72。同样的图同样的问题两把尺子量出的结果相差了接近40个百分点。AI评委看见了拥抱但看不见融合的肢体网格评分程序摸到了身体的空间关系无情地揭示了接触的失真。在十个模型里Gemini-3-Pro-Image在解剖完整性上得分最高为0.65Seedream-5-Pro在接触几何合理性上得分最高为0.72——但这两个最高分来自不同的模型没有任何一个模型能同时在这两个维度上领先。这就像一场考试里数学最好的人语文不行语文最好的人数学不行没有全才。开源模型与闭源模型之间的差距在身份识别维度上最为悬殊闭源模型的Identity分数在0.49到0.58之间开源模型则普遍在0.02到0.21之间——闭源模型对参考人物脸部特征的保留能力远远超过开源模型。研究团队还专门测试了是不是因为开源模型把脸藏起来了这个解释发现即便只统计人脸完整可见的样本差距依然存在只是缩小了一些说明身份识别能力本身就有本质差距。研究团队还按接触密度分级做了细化分析。随着接触密度从C2中等接触升高到C3高强度接触Gemini、Seedream和FireRed的解剖完整性得分都有明显下滑说明接触越密集这些模型越容易出解剖错误。而某些开源模型比如DreamO在各密度等级上的得分几乎一样低可以理解为已经低到无处再低了。七、人类用眼睛确认了评分体系的有效性为了验证这套新评分体系确实在量正确的东西研究团队专门招募了五名成年评审员对170个难度较高的样本接触密度C2和C3进行人工打分覆盖10个评价项目包括穿透情况、接触合理性、额外肢体、身体形状等。五个人独立评分最终用平均分作为人类金标准。结果显示五人的评分一致性属于中等可靠水平Krippendorffs α平均值为0.53这个水平是合理的——毕竟判断两人的身体有没有穿透比判断画面里有几个人要主观得多。核心接触类项目的一致性最高0.65到0.68说明人类在这些问题上虽然不是百分百达成共识但整体方向是一致的。然后研究团队比较了三种评分方式与人类金标准的相关程度网格评分M、AI评委评分V以及人类金标准H自身。对于9个评价项目中的9个网格评分与人类判断的相关性都高于AI评委其中在有没有额外的肢体和肢体归属对不对这两个关键项目上统计检验表明差异显著。唯一例外是人数对不对——AI评委在数人数这件事上确实比网格重建更准这也符合直觉因为数人数本来就是AI文字理解的强项。这个验证告诉我们这套基于3D重建的评分体系在衡量人类真正在意的接触时身体完整性问题上确实比现有的AI评委更贴近真实的人类判断。八、评分体系的稳健性换个参数还是这个答案一套好的评测标准必须经得起如果换个参数会不会排名大变的考验。研究团队为此做了大量的敏感性测试。在解剖完整性的权重方面研究团队尝试了多种不同的混合方案——平均权重、偏重某一项、调整阈值——结果发现十个模型的排名斯皮尔曼相关系数衡量排名顺序相似度的指标始终保持在0.98以上前三名FireRed、Gemini、Seedream几乎稳定不变只有在使用完全平均权重时BAGEL才挤进前三。在图像分辨率方面研究团队设计了两条评测轨道Track A使用各模型提交时的原生分辨率Track B则把所有图像统一调整到1024×1024的标准分辨率再评分。Track B的绝对分数普遍比Track A高出0.06到0.14这是因为统一分辨率减少了因图像尺寸差异带来的重建质量波动。但重要的是两条轨道下开源模型的排名相关性达到0.89前三名依然不变说明分辨率选择影响的是绝对分数不影响相对排名。在重建前端方面研究团队还额外用了另一种3D重建工具HMR2对150个样本重新评分。单独用HMR2的结果与Multi-HMR的排名相关性很低但如果把两个工具的评分平均起来排名相关性就回到了0.92。这说明任何单一的重建工具都有局限性将来可以通过多工具集成来进一步提升可靠性。九、那些AI还没学会的接触艺术研究团队在测试中观察到了一些很有规律的失败模式值得单独说说。手部相关的交互握手、高五、拉手是最难的类别之一。在整个数据集的统计里解剖完整性在这些类别上最低说明AI在处理两只手相遇时特别容易出错——毕竟每只手有五根手指两只手交织在一起有多少种不合理的融合方式可以自行想象。拥抱同样是高失败率的场景接触几何合理性分数在拥抱类别里只有0.48是所有类别里较低的一档。有趣的是拉手hand-hold的接触几何合理性反而高达0.72是所有类别里最高的——可能是因为拉手的身体接触更局限、更明确AI反而能处理得更好。竞技对抗类动作格斗、抓摔的解剖完整性和接触几何合理性都处于中等水平并不是最差的这出乎研究团队的预料。面对面交谈的接触几何合理性只有0.43是最低分但这部分是因为面对面交谈本身就常常不涉及身体接触指令里的接触意图是未指定评分更偏向惩罚不自然的穿透而非奖励接触。研究团队还发现了一个潜在的投机取巧漏洞如果一个模型学会了生成两个人的身体高度重叠高穿透分、高接近分但实际上并没有在正确的部位接触理论上可以在接触几何合理性分数上得到虚高的分数。他们用AI评委交叉检验这种情况发现它在要求接触且通过了接触几何合理性标准的样本中只出现了约1.3%属于较低比例对整体排名没有影响。但这个漏洞被诚实地记录在案作为未来改进的方向。说到底这项研究揭示的是一个令人深思的现实我们已经有了能够生成令人信服的人物图像的AI工具但当两个人走到一起、身体发生接触时这些工具就会露出一道清晰的技术裂缝。融合的肢体、穿透的躯干、无中生有的手脚——这些错误之所以长期被忽视是因为我们用来检验AI的考卷设计得太简单了根本没有问到正确的问题。MPIE-Bench和MPIE-Eval的贡献是重新设计了这份考卷。2500个真实人物接触场景、六个维度的独立评分、来自3D骨骼重建的几何检验再加上五人人工评审的验证——这套体系第一次让AI画人时有没有把身体画坏这件事变成了可以客观量化的问题。测试结果清楚地表明当前最好的模型无论开源还是商业在这件事上都还有很大的提升空间解剖完整性最高只达到0.65接触几何合理性最高只到0.72没有任何一个模型能同时在两个维度上领先。这对普通用户意味着什么如果你在用AI工具生成聚会合影、家庭场景或是任何涉及两人以上肢体接触的图像遇到奇怪的解剖错误是正常现象不是你的操作问题而是当前技术的普遍局限。随着像MPIE-Bench这样的评测工具开始推动模型开发方向的调整这个问题有望在未来几年内得到系统性改善。研究团队还在附录里草拟了一个未来的训练方案用FLUX.1 Kontext模型作为基础配合一个辅助的骨骼预测流程来强迫模型在遮挡情况下也保持每个人的骨骼完整再通过按接触密度分级的课程式训练——先从简单的低接触场景学起逐步进入高强度接触场景——来尝试从根本上改善这个问题。不过这个方案目前只是规划尚未有实验结果支撑研究团队诚实地把它标注为未来工作而非现有成果。如果你对这个方向感兴趣不妨思考一下3D重建工具本身是否足够准确当它对一张图像的重建结果本身就不正确时基于它的评分是否还可信研究团队在论文中承认当Multi-HMR的检测置信度较低时评分结果确实会不稳定低置信度样本的得分整体偏低。这是这套体系目前最明显的局限也是未来需要解决的核心工程问题。感兴趣的读者可以通过arXiv:2607.27616查阅完整论文研究团队也在GitHub上公开了评测代码和数据地址是AnnLin0628/mpie-bench。QAQ1MPIE-Bench数据集是怎么收集的AMPIE-Bench通过挖掘视频来构建数据集。研究团队计算每段视频中人物的接触密度曲线在两人分开时截取参考照片在两人紧密接触时截取目标帧再用AI语言模型根据目标帧写出编辑指令。整个流程自动生成约两万个候选样本经人工审核后最终保留2500个覆盖405个场景和14种互动类型。Q2为什么AI评委给融合肢体的图打出高分AAI评委视觉语言模型的判断逻辑主要是语义层面的——它能确认两个人在拥抱但无法精确检测两具身体在三维空间里是否互相穿透、肢体是否合理归属。这种语义层面的判断天然对几何细节不敏感导致即使画面里出现明显的融合肢体AI评委依然会打出0.98到0.99的接近满分产生严重的评分饱和问题。Q3MPIE-Eval的解剖完整性分数是怎么算出来的AMPIE-Eval先用Multi-HMR模型对生成图像做3D人体网格重建再比较图像中人形区域与重建网格覆盖区域之间的差异差异越大说明存在越多无法被正常身体解释的多余形状。这些差异被归入四个错误类型额外肢体、漂浮碎片、结构问题、残余质量分别评分后以固定权重0.40/0.20/0.25/0.15混合得到最终的解剖完整性分数。
返回列表