
这项由新加坡南洋理工大学S-Lab与香港中文大学联合开展的研究以预印本形式于2026年7月17日发布在arXiv平台论文编号为arXiv:2507.16401。有兴趣深入了解的读者可通过该编号检索完整论文。**一道关于苹果落地的问题难倒了当今最先进的AI视频模型**亚里士多德看到苹果从树上掉落会说这是苹果回归大地的天性。听起来很有道理但完全没法用来预测苹果明天、后天或一秒钟后在哪里。牛顿看到同一颗苹果却抽出一张纸写下了 v gt然后用这个短短的公式推算出了月球绕地运行的轨道。两个人都看懂了苹果落地但只有牛顿真正理解了背后的规律。今天的AI视频模型更像谁这正是南洋理工大学研究团队想搞清楚的核心问题。他们创建了一个名为Apple-π读作苹果派的测评体系专门用来检验视频模型究竟是在凭直觉猜物理现象的样子还是真的掌握了物理定律并能用它推演未来的运动。结果令人深思目前最好的视频模型在这套考试里只拿到了0.473分满分1分而有些模型甚至不到0.2分。这项研究不是为了挑剔AI的短板而存在。它的真正目标是给未来的世界模型研究画出一张清晰的路线图——告诉开发者AI在物理理解上具体卡在了哪一步。**一、为什么现有的AI测评方式存在根本性缺陷**在理解Apple-π的设计之前有必要先聊聊一个长期被忽视的问题我们过去评价视频AI的方式其实只检查了答案从来没检查解题过程。假设你让一个学生做一道物理题他交上来的答案确实是正确的于是你给了满分。但你不知道他其实是靠蒙的或者在题目旁边见过类似的图凭感觉写下了答案完全没有理解背后的物理定律。如果下次题目稍微变一变他就彻底不会做了。现有的视频物理能力测评几乎都处在这种只看答案的状态。研究团队梳理了市面上所有主要的相关评测发现无论是面向文本生成视频的VideoPhy-2、PhyGenBench还是面向图像生成视频的Physics-IQ抑或是多领域综合评测的WorldModelBench它们共同的局限在于只评估模型最终输出的视频看起来是否符合物理直觉而从不追问模型是否真正调用了物理定律来生成这段视频。这产生了一个严重的盲区。视频模型在海量互联网视频上训练见过无数次苹果落地、球体碰撞、斜面滑动它完全有可能学会苹果落地时应该越来越快这个视觉模式却对 h 1/2 gt? 一无所知。一旦换一个不那么常见的场景——比如在月球上扔一个圆锥——模型就会露馅。Apple-π的核心贡献正是设计了一套能够追问解题过程的测评协议将物理推理分解为三个可以独立检验的阶段让我们第一次看清楚AI究竟在哪个环节出了问题。**二、Orchard数据集一片专门为考试准备的物理苹果园**要考查物理推理能力首先需要一批高质量的物理视频题目。研究团队为此建立了一个叫做Orchard果园的视频数据集共包含400个精心设计的物理场景。Orchard的构建原则与其他物理视频数据集有一个根本性的不同它不是先找到各种物理视频、再给它们贴标签而是先确定要考查的物理定律再围绕这些定律专门制作或筛选视频。这就像出卷老师先定好考试大纲再按大纲命题而不是随机翻课本找题目。视频来源分为三类。其中243个来自NVIDIA Isaac Sim物理仿真引擎这类视频的好处是物理参数完全可知每一帧物体的位置、速度、加速度都有精确记录相当于标准答案卷。另有121个来自团队在实验室受控环境下自行拍摄的真实视频在尽量隔离干扰因素的同时引入了真实光照、材质等视觉细节。最后36个来自YouTube上的物理教育频道用于覆盖前两类无法涉及的多样化场景。为了保证评估的公平性团队对所有视频中的运动物体做了统一规范只允许出现球体、正方体、圆柱体和圆锥体这四种几何形状。这个看似奇怪的限制其实有很深的考量——不规则形状或有语义含义的物体比如一只猫很容易让模型依赖对这类物体的经验知识而非物理定律来作答就像考试作弊一样干扰评估结果。用纯几何体相当于给所有选手穿上同款校服参加考试排除了认出题目的干扰。在内容上Orchard覆盖了经典力学中的十个任务按照主导物理定律组织成三大支柱。第一个支柱是万有引力定律包含自由落体、抛体运动、斜面运动和弯道圆周运动考查重力驱动下的各种轨迹。第二个支柱是动量守恒定律包含完全弹性碰撞碰后动能不损失、完全非弹性碰撞碰后合为一体和部分非弹性碰撞介于两者之间这三种情况用恢复系数e来区分e1是完全弹性e0是完全非弹性。第三个支柱是牛顿第一定律包含静止状态和匀速直线运动考查在合外力为零时物体的行为。此外还有第四个类别多定律组合。这类场景会把两个或多个物理定律串联起来比如一个物体先沿斜面滑下再飞出去做抛体运动最后撞上另一个物体发生碰撞。这种场景用来检验模型能不能把不同定律衔接起来使用就像考试里的综合应用题。每个场景都有详细的物理参数记录以及经过三轮人工审核的标注信息。研究团队甚至为测量精度做了详细规范物体质量精确到0.01克尺寸精确到0.05毫米初速度精确到0.05米/秒。两位标注员对关键字段的独立标注吻合度Cohens κ普遍超过0.9任务分类甚至达到了完美的1.0说明数据质量极高。**三、三段式推理协议这场考试怎么考、考什么**有了题目还需要一套考试方式。Apple-π设计了一个三阶段的评测协议对应科学推理的三个层次感知Perception、建模Formulation和推演Deduction。这三个阶段形成一个递进的链条就像侦探破案——先要看清现场感知再要判断嫌疑人用的什么作案手法建模最后还要根据手法推断出整个犯罪过程推演。考试的输入方式颇具匠心。每道题都给模型提供一张信息图式的第一帧——也就是在原始视频第一帧上叠加了物理参数标注的图片比如在球旁边标注质量m 1.0 kg在旁边标注重力加速度g 9.8 m/s?用箭头标出初速度方向。这样做是为了把读懂物理参数这件事从考题本身中剥离出去让模型可以直接把精力用在推理上而不是浪费在猜测这个参数属于哪个物体的歧义解析上。模型的输出形式也统一为视频——无论被问哪种问题模型都需要生成一段视频作为回答。这个设计来自链式帧推理的思路视频的每一帧就像思维过程的每一步生成视频相当于把推理过程画出来让整个思维链条可见可查。感知阶段分为两个子任务。第一个叫感知-文字相当于考OCR能力模型要把第一帧上标注的所有物理参数数字、公式、箭头标注原封不动地重现在一张纯白背景的图片上保持位置、字体、颜色完全一致。第二个叫感知-图形相当于考实例分割能力模型要把与物理实验相关的物体球、方块等单独隔离出来放在纯白背景上去掉所有背景、地面和标注信息。这两个子任务合起来检验模型能不能正确识别出这个场景里有什么物理量和这些量属于哪些物体。建模阶段同样分为两个子任务。第一个叫建模-文字考查模型对物理定律的符号掌握给出四个备选公式模型要选出正确的那个同时在纯白背景上写出三行文字——选项字母、正确公式的符号形式、以及把公式中的符号替换成具体数值后的结果。四个选项的设计很有讲究一个是正确答案一个是迷惑选项与正确公式共用相同符号但不是正确定律一个是无关选项来自完全不同的力学分支还有一个是捏造选项看起来像物理公式但实际上不存在。这样的设计让研究者能区分模型是真的选对了还是只是因为公式里有这些字母就瞎选。第二个叫建模-图形要求模型预测场景在某个特定时刻t*的状态——把每个物体画在它该出现的位置并且用橙色箭头标出每个物体的瞬时速度方向旁边附上速度数值。推演阶段只有一个任务给出带标注的第一帧生成一段完整的视频展示整个物理场景的动态演化过程从头到尾都要符合物理定律的预测。这是三个阶段里难度最高的因为它不仅要求某一个时刻的状态正确而且要求整段运动轨迹在每一帧都保持物理一致性。**四、打分体系既有主观评委也有客观仪器**评分系统由两套机制组成。一套是基于大模型评委MLLM Judge的主观打分另一套是基于物理定律的客观度量。两者结合才能既评估看起来好不好也评估物理上对不对。主观评分部分使用Gemini 3 Flash作为评委针对不同子任务设计了对应的评分细则。以感知-文字为例评委会检查18个维度包括文字字体是否匹配、颜色是否一致、位置是否正确、内容有没有错别字或幻觉、背景是否干净的白色等等。以建模-文字为例评委会检查选项是否选对、公式符号是否正确书写、数值替换是否准确、三行格式是否完整等11个维度。这些维度被分组聚合每个子任务最终得到一个0到1之间的分数。客观度量部分则直接用数学公式对比模型输出和物理预测的标准答案。对于感知-图形和建模-图形用的是分割IoU——把模型输出的物体区域和真实物体区域做交集与并集的比值越接近1说明位置越准确。对于推演任务则用了更丰富的一组指标归一化的PSNR衡量像素级别的重建质量、掩码PSNR只在物体区域计算避免背景干扰、空间IoU衡量运动发生的空间区域是否正确不管时间、时空IoU同时考察运动在哪里和什么时候发生、加权空间IoU衡量运动发生的频率分布是否匹配以及速度准确性通过3D速度估计对比模型和物理定律预测的速度向量误差。这六个客观指标和MLLM主观评分按比例合并其中物理准确性相关指标占60%权重视觉质量占20%帧完整性占20%。这个权重分配清楚地表明在Apple-π眼里看起来好看远不如物理上对重要。为了验证评委打分的可靠性研究团队还用开源模型Qwen3-VL-30B作为交叉验证评委对七个代表性模型重新评分。两个评委的皮尔逊相关系数在整体平均分上达到0.95在建模-文字和推演上甚至高达0.99说明排名结论是稳健的不依赖于特定评委模型的选择。**五、大考放榜11个模型的成绩单**研究团队对11个代表性模型进行了全面评测包括5个视频生成模型和6个统一理解-生成模型。每个模型在400道题、5个子任务、3次独立尝试上分别作答总计6000次评估。视频生成模型组包括Wan2.2、HunyuanVideo-1.5、VBVR-Wan2.2、Seedance 2.0和Veo 3.1。统一理解-生成模型组包括BAGEL、OmniGen2、SenseNova-U1-8B-MoT、SenseNova-U1-8B-MoT-Think、GPT Image 2和Nano Banana 2。成绩最令人瞩目的差距出现在视频生成模型和统一理解-生成模型之间。在视频生成模型里Seedance 2.0是最好的平均分0.473Veo 3.1次之0.313VBVR-Wan2.2第三0.373而HunyuanVideo-1.5最低只有0.177。相比之下GPT Image 2拿到了0.704Nano Banana 2拿到了0.699比最好的视频模型高出将近50%。这个差距说明了什么关键不在于谁生成的视频更好看而在于统一理解-生成模型具备明确的视觉理解能力——它们不只是生成画面而是先看懂再画出来。感知和建模阶段GPT Image 2和Nano Banana 2的分数远高于任何视频生成模型说明这类模型在读取物理参数、识别物体、选择定律方面更有优势。但值得注意的是即便是这两个最强的模型在推演阶段的得分也只在0.40左右——产生法律一致的时序运动对所有模型来说都是最难的关卡。VBVR-Wan2.2是个有趣的案例。它是在Wan2.2基础上用视频推理数据集进行微调的版本在感知-文字上拿到了0.923的超高分仅次于GPT Image 2的0.921和Nano Banana 2的0.934在感知-图形上也表现不错。这说明针对推理能力的专项训练可以显著提升模型读标注、找物体这类接口技能。但VBVR-Wan2.2在建模-文字上只有0.001在推演上也只有0.201说明读懂题目和真正理解物理定律是两件完全不同的事前者的提升没有自动迁移到后者。**六、逐阶段诊断AI究竟在哪里摔跤**Apple-π三阶段设计的最大价值是能够精确定位模型在推理链条的哪个环节出了问题而不是只知道它答错了。从整体趋势看感知最容易建模居中推演最难。这个梯度在所有视频模型上都很一致。感知-文字平均分在视频模型里是0.561感知-图形是0.380建模-文字骤降到0.168建模-图形是0.283推演是0.196。越往后分数越低。在感知阶段内部感知-文字比感知-图形容易。读取标注文字相当于OCR比把物体从背景中分离出来相当于目标检测要简单。这符合直觉——识别数字和符号模型见过大量训练样例但精确勾勒出几何体的轮廓并完全去掉背景在技术上更有挑战性。建模阶段的两个子任务揭示了一个微妙的选公式和用公式之间的鸿沟。一个模型可以选出正确的公式建模-文字但在预测物体在特定时刻应该在哪个位置的时候建模-图形却不准确。这说明知道用哪个公式和真的能用公式算出结果并把结果画到正确位置是两种不同的能力。推演阶段的挑战最为深刻。即便模型在前两个阶段都表现不错在推演上依然可能失手。因为推演要求模型不只是对某一个时刻做出正确预测而是要在整段视频的每一帧都保持与物理定律一致——物体要有正确的加速度、碰撞要产生正确的速度变化、圆周运动要保持正确的轨迹曲率。视觉上流畅的视频完全可以在物理上是错的两者并不等价。定性分析进一步揭示了一类常见的失败模式标注语义绑定失败。模型可以正确地把标注文字显示出来OCR成功也可以正确地把物体轮廓分离出来分割成功但却把一个标注的含义——比如初速度箭头的方向——理解错了。结果物体从第一帧开始就往错误的方向运动整个推演过程完全偏离正确轨迹。这揭示了一个深层问题模型能看到标注但不能理解标注所代表的物理含义。另一类常见失败则更基础模型根本没有正确执行格式要求比如把标注文字模糊成无法辨认的状态或者在应该显示纯白背景的地方混入了背景残影或者完全没有在图上画出速度箭头。这些错误甚至还没到物理推理层面就已经在输出正确格式这件事上失败了。**七、跨定律和跨来源分析两个额外的弱点**除了纵向的三阶段分析研究团队还做了两个横向的切割按物理定律分类和按视频来源分类。在物理定律层面多定律组合场景Multi的分数普遍低于任何单一定律场景。以最好的视频模型平均分为例万有引力相关任务得0.45动量守恒相关任务得0.51牛顿第一定律相关任务得0.49而多定律组合只有0.39。这个下降不是因为多定律场景更复杂虽然确实如此更本质的原因在于多定律场景需要把第一段物理过程的结果——物体的位置、速度方向、接触状态——作为第二段物理过程的初始条件。这个状态转移步骤对现有模型来说极具挑战性。模型可以分别处理斜面运动和抛体运动但当斜面末端的速度需要成为抛体初始速度时模型往往无法完成这个衔接。在视频来源层面所有模型在仿真视频上的得分都高于真实视频产生了一个仿真到真实的迁移差距Sim-to-Real gap。视频生成模型平均在仿真上得0.310在真实视频上只有0.224统一理解-生成模型在仿真上得0.564在真实上得0.508。这个差距的根源不在于两者的物理定律不同——重力在仿真里和现实里都是9.8米每秒平方——而在于真实视频引入了更复杂的光照、纹理、背景噪声让模型在定位和追踪物体时更容易出错进而影响物理推理的准确性。这两个横向分析共同指向一个结论现有视频模型在法律串联和视觉泛化这两个维度上都有明显短板而这两个维度恰恰是真实世界物理理解所必须的。**八、两个方案验证了协议设计的合理性**为了确认考试方式本身不存在泄题或刁难的问题研究团队做了两组对照实验。第一组叫文字参数替代实验。把第一帧上的信息图式标注换成结构化文字直接在提示词里写m 1.0 kg, h 2.0 m, g 9.8 m/s?等而不是叠加在图片上。结果两种方式下模型的得分差异极小各子任务的分差几乎都在±0.05以内。这说明Apple-π并不是靠让模型读图标注来人为增加难度信息图式标注的作用只是把物理量和视觉物体关联起来而不是作为物理推理的障碍。第二组叫精简提示词实验。把详细的输出格式说明去掉改用简短的任务描述。结果显示精简提示词对图形类输出任务感知-图形、建模-图形的负面影响最大说明详细提示词主要起到规范答案格式的作用。建模-文字反而在精简提示词下有所提升因为公式选择这件事本身不需要复杂的格式规范。整体来说精简提示词降低了平均分但对推演任务几乎没有影响——推演的难点不在于格式在于物理。这两组实验共同证实了Apple-π的设计符合其初衷它考查的是物理推理能力本身而非标注读取或格式遵循的技巧。**九、这场考试的结论与未来路线图**说到底Apple-π这场大考揭示了一个当前AI界普遍存在但很少被明确指出的问题视频模型学到的物理知识更多是视觉模式而非物理定律。它们知道苹果落地时应该越来越快但不知道为什么越来越快更不知道如果初速度是3米每秒、高度是5米、重力加速度是9.8那么0.8秒后苹果在哪里。研究揭示的三个核心瓶颈相互关联从感知到建模到推演的逐级衰减意味着每个阶段的缺陷都会叠加到下一个阶段多定律状态转移的弱点意味着模型处理复合场景的能力远落后于处理单一场景的能力仿真到真实的迁移差距意味着即便是在物理上表现相对较好的模型一旦换到真实世界的复杂视觉环境里就会显著退步。统一理解-生成模型在感知和建模阶段的显著优势给出了一个方向性的提示把先理解、后生成的架构引入未来的视频世界模型可能比单纯扩大视频生成模型的规模更有效。但即便是最好的统一理解-生成模型在推演阶段也只拿到0.40左右说明产生时序上连贯的、物理准确的视频动态是目前整个领域共同面对的核心难题。Apple-π数据集、评测协议和评分代码将公开发布供研究社区使用。对于想深入了解每一个评测细节——包括完整的提示词模板、指标计算公式、数据标注流程的读者原论文附录部分有详细的技术规范可通过arXiv编号2507.16401找到完整版本。物理规律统治了宇宙138亿年让AI真正理解它们看来还需要一些时间——但至少现在我们有了一把靠谱的尺子知道距离终点还有多远。---QAQ1Apple-π基准测试是用来衡量什么的AApple-π是一套专门评估视频模型物理推理能力的测评体系由新加坡南洋理工大学研究团队开发。它不只检查视频看起来是否符合物理直觉而是将物理推理分解为感知、建模和推演三个阶段分别检验模型能否读取物理参数、识别正确的物理定律以及生成符合该定律的完整运动轨迹从而判断模型究竟是凭视觉经验猜出了结果还是真正掌握了物理规律。Q2为什么视频生成模型在Apple-π上表现远不如统一理解-生成模型A核心差距在于理解能力。视频生成模型主要从海量视频中学习运动看起来像什么更擅长模仿视觉模式而统一理解-生成模型具备先看懂再生成的能力在读取物理标注和选择正确定律上更有优势。不过即便是最强的统一理解-生成模型GPT Image 2在推演阶段生成全程物理准确的视频得分也只有约0.40说明时序上的物理一致性是所有模型面临的共同难关。Q3Apple-π测试中所有模型在多定律组合场景上为何普遍失分A多定律组合场景需要模型完成状态转移——把第一段物理过程结束时的位置、速度和方向作为第二段物理过程的初始条件输入。比如物体沿斜面滑到底部后飞出做抛体运动斜面末端的速度必须准确传递给抛体运动的初始条件。现有模型可以分别处理斜面运动或抛体运动但跨越定律边界做状态衔接的能力明显不足导致多定律场景得分约0.30-0.39普遍低于任何单一定律场景。