ServiceNow等机构造了一套“考场“,专门给视觉语言模型出难题

发布时间:2026/7/24 22:32:07

ServiceNow等机构造了一套“考场“,专门给视觉语言模型出难题 这项由ServiceNow AI研究院联合蒙特利尔大学和Mila人工智能研究所共同开展的研究发表于2026年COLMConference on Language Modeling会议论文编号为arXiv:2607.10400v1发布于2026年7月11日。有兴趣深入了解的读者可以通过该编号查询完整论文。今天的人工智能模型处理文字已经越来越厉害你随手扔给它一段英文合同、一份财报、甚至一本教科书它往往能给出像模像样的回答。但有一类任务却一直让这些模型头疼——那就是处理几十上百页、图文表格混排的长篇文档。比如一份五十页的行业研究报告里面既有大段文字分析又穿插着各种折线图、柱状图、数据表格还时不时会让你在第3页的图表和第47页的文字之间来回跳转才能回答一个问题。这种场景才是真实世界文档理解的日常。然而当研究人员想弄清楚现有的视觉语言模型也就是那种能同时看图和读字的AI在这类任务上究竟哪里做得好、哪里彻底摔跟头他们却发现手头没有合适的工具。现有的测试集要么只有单页文档要么虽然文档很长但各种难度因素混在一起根本没法说清楚模型到底是因为图表没看懂、还是因为证据分散在太多页、还是因为问题本身太复杂才答错的。正是为了填补这个空白研究团队构建了一套名为SynthDocBench的全合成、可控基准测试——用中文直译就是合成文档测试台。这套测试台的特别之处在于它能像控制实验室实验一样精确地调节文档的长度、版式结构、内容模态是纯文字、还是图表、还是两者混合以及问题难度让每个因素都可以单独变化、独立分析。研究团队用它来考察了七款当前最前沿的视觉语言模型结果发现了三种此前从未被系统揭示过的失败模式。以下内容将带你走进这套测试台的设计逻辑和实验发现整个过程可以用一个核心比喻来理解把测试模型的过程看作一场精心设计的驾照考试。不同于以往那种把考生直接扔进真实路况的考法SynthDocBench像是一个标准化驾考场每条测试路线的坡度、弯道、限速牌都经过精确标定这样才能准确判断考生是不会上坡、还是不会转弯、还是根本看不清路牌。一、为什么需要一个标准化驾考场现有的文档理解测试集大多像是把考生直接扔进真实城市路况——文档来自真实的PDF报告、学术论文、法律合同问题由人工标注每份文档的版式、图表密度、文字风格都不一样。这种方式有其优点因为它贴近现实。但当模型在这类测试上答错时你根本没法确定原因是图表太复杂了是证据离得太远、横跨了太多页是问题措辞有歧义还是模型压根没在训练数据里见过这种版式早在几十年前认知科学和NLP领域就发展出了一套解决这类困境的策略合成数据。像bAbI任务集是专门用来测试语言推理基础能力的程序化生成问题集CLEVR数据集是用来测试视觉关系推理的合成图像PuzzleVQA则用抽象合成图案来诊断多模态推理瓶颈。这些工具的共同哲学是牺牲一点生态效度即与真实世界的相似程度换取更高的因果可归因性。换句话说驾考场里的路线虽然比真实路况简单但正因为简单且标准才能精确诊断你不会的那个动作。SynthDocBench把这一哲学带进了长篇多模态文档理解领域。所有文档由程序化流水线从零生成没有任何一份来自真实世界这就确保了研究人员可以精确控制每个变量然后独立分析每个因素对模型表现的影响。二、这套驾考场是怎么造出来的SynthDocBench的文档生成过程分为三个紧密耦合的阶段可以理解为先搭舞台、再布道具、最后写剧本。搭舞台的阶段流水线从一个话题种子出发——比如气候变化政策或人工智能在教育中的应用——利用大型语言模型从与该话题相关的公开信息中提取和重组内容生成结构化的报告骨架明确划分章节边界、标注哪些段落含有关键数据。布道具的阶段系统为每份文档选择一种版式风格。研究团队设计了六种版式原型分别是杂志风格大幅封面图、跨栏排版、仪表盘风格KPI卡片、密集图表网格、学术风格摘要框、编号章节、编辑风格大段落引用、章节标记、信息图风格全宽时间轴、数据标注以及野兽派风格厚重边框、等宽字体、超大数字。系统有60%的概率按话题特点选择最匹配的版式另外40%则完全随机分配这个设计的目的是防止模型通过版式来猜测话题——就像驾考场会刻意混排不同难度的路线让考生没法走捷径。写剧本的阶段也是这套系统最精妙的环节。每个图表在生成时会同步输出两个版本一个是视觉上真实可见的D3.js一种网页图表渲染工具渲染图就是文档里读者能看到的那张图另一个是隐藏的结构化元数据对象记录着这张图的坐标轴标签、所有数据点的精确数值、以及从数据中可以派生的各种结论最大值、最小值、趋势、异常点等。这个双层设计是整套系统能避免人工标注的关键——所有标准答案都从这个隐藏的元数据对象中确定性地推导出来不会有任何歧义。整份文档最终以HTML格式组装完成通过Playwright一种网页自动化工具渲染为PDF同时输出配套的问答清单。最终的数据集包含200份合成报告每份报告平均51.1页、约20568个单词、16.7张图表覆盖24种不同的图表类型从常见的柱状图、折线图、散点图到视觉上更容易混淆的哑铃图、棒棒糖图、斜坡图、迷你折线网格等以及6种版式原型。整个数据集共有1788道问题按三类任务均分图表阅读类597题、跨模态类594题、复杂多步推理类597题。三层质量控制机制确保了数据质量——对所有数值答案进行重新计算核验、用规则过滤器检查一致性、再对100道题进行人工抽查接受率超过96%。三、三类考题的设计逻辑SynthDocBench的三类问题不是随便划分的它们对应了三种在真实文档中最常见、也最具挑战性的信息提取场景。图表阅读类问题可以理解为只看这张图告诉我数字。问题聚焦于单张图表的精确数值读取分为三个子类型直接读值比如这张柱状图里代表2019年的那根柱子有多高、比较哪个类别的值最大两者之间相差多少以及趋势判断这条线在整体上是上升还是下降的。这类题看起来简单但其实对模型的像素级视觉解码能力要求极高因为答案必须精确不能靠周围的文字来猜测。跨模态类问题则要求模型在文字和图表之间建立桥梁。以一个典型例子来理解文档第8页某段话声称过去十年间全球儿童早婚率显著下降而对应的折线图在第12页你必须先找到这张图然后读出具体数字才能确认或量化这个文字描述。这类问题被设计为图表和支撑文字故意不放在相邻位置考察的是跨页面的模态整合能力。复杂多步推理类问题是难度最高的一档需要模型从2到4个分散的证据单元中提取信息然后组合推理得出答案。题目按难度分为L1到L5五级L1是最直接的数值查询L2是简单比较L3是聚合计算比如求平均或总和L4是需要结合领域知识的推断比如为什么在给定背景下X会优于YL5是最难的要求解读视觉编码比如这张图里不同颜色的点各自代表什么含义。四、七位考生进场成绩单长什么样研究团队将七款前沿视觉语言模型送进了这个驾考场分别是谷歌的Gemini-3.1-Pro、OpenAI的GPT-5.4和GPT-4o、Anthropic的Claude-Sonnet-4.5以及开源阵营的Qwen3.5-VL-122B、Qwen3-VL-235B、InternVL3-78B另外还加了一款相对小型的Qwen2.5-VL-7B做参照。所有模型接受考试时只能看到文档的渲染图像完全无法访问底层HTML源码或元数据——就像驾照考试时考官只看你在真实路况下的操作不接受我知道理论上怎么做。每份PDF被光栅化为144 DPI的页面图像每5页拼接成一个垂直长图条然后输入给模型。评分由GPT-5担任考官对每个模型答案, 标准答案对打出0到10分6分及以上算核心正确。为了验证这位考官打分靠不靠谱研究团队还用Gemini-3.1-Pro和Claude-Sonnet-4.5分别独立打分做交叉验证结果GPT-5和Gemini作为考官时的分数差异在3.5个百分点以内相关系数高于0.94说明打分结果不会因为换个考官而大幅波动。成绩单出来后最引人注目的是整体排名Gemini-3.1-Pro以0.725的整体准确率遥遥领先位居第一Qwen3.5-VL-122B一款1220亿参数的开源混合专家模型以0.655的准确率紧随其后Qwen3-VL-235B排第三0.586GPT-5.4排第四0.423这个成绩出乎不少人预料——一款商业旗舰模型排在两款开源模型之后GPT-4o0.386和InternVL3-78B0.383几乎打成平手统计上无法区分Claude-Sonnet-4.5排倒数第二0.314Qwen2.5-VL-7B以0.081的准确率垫底。这个排名的另一面也很有意思Gemini在DocVQA单页文档理解上只拿了93.4分比Qwen3-VL-235B的96.5分低但在SynthDocBench这个长文档战场上却反超了20多个百分点。这说明单页任务的能力和长文档处理能力之间的关联远比想象中复杂。研究团队还专门做了一个OCR纯文字基线测试用PyMuPDF工具从PDF里提取纯文本然后让GPT-4o在没有任何图像的情况下只凭文字作答。结果非常有指向性——在复杂多步推理类问题上纯文字模式的准确率高达0.798而视觉模式只有0.360说明这类问题的答案大多可以从文字中还原模型需要的是文本理解能力而非视觉解码能力但在图表阅读类问题上结果完全反转纯文字只有0.297视觉模式有0.457这证明图表问题真的需要看图不能靠读文字蒙混过关。而Gemini在图表阅读上的准确率0.759比纯文字基线高出了整整46个百分点清楚地表明视觉感知能力才是图表题的核心瓶颈。五、被揭露的三种失败模式考场设计的精妙之处在于它让三种此前被遮蔽的失败模式清晰地浮出水面。这三种失败模式就像驾考场把不会上坡、不会倒车入库和看不清路牌分开测试一样终于被独立地观察和记录下来。第一种失败模式是随推理深度加剧的性能退化。当问题从L1级直接读值上升到L5级视觉编码解读除Gemini之外所有模型的准确率都呈现出单调下降趋势。Claude-Sonnet-4.5从L1的0.382一路跌到L5的0.154降幅高达23个百分点GPT-4o在L10.271上的表现甚至异常地低于L20.455说明对它来说精确数值读取反而比组合推理更难这是一个颇为奇特的反直觉现象。Gemini则是唯一一个在各难度级别上都保持相对平稳的模型0.670到0.784之间波动显示出更强的鲁棒性。第二种失败模式是证据位置引发的系统性偏差。研究团队把每个图表在文档中的相对位置第几张图/总图数分成前三分之一、中间三分之一、后三分之一三个区间然后分析图表阅读题的准确率与位置的关系。结果发现八个被测模型中有五个在中间区域表现最差比前三分之一区域低了5到18个百分点。Qwen3.5-VL-122B的这一降幅最为极端从前段的0.820跌到中段的0.635足足低了18.5个百分点但有所回升地到了后段0.660。Claude-Sonnet-4.5则表现出从前到后单调下降的趋势0.418→0.342→0.301降幅11.7个百分点是所有模型中这一趋势最陡峭的。Gemini-3.1-Pro则展现出一个典型的U型曲线0.788→0.717→0.784这与NLP领域早有记载的迷失在中间现象高度吻合——语言模型普遍对序列的开头和结尾记忆更清晰而中间部分容易被稀释。第三种失败模式是长文档背景下图表精确阅读能力的崩溃。这一点在与已有基准测试的比较中最为直观同样的模型在ChartQA单张独立图表问答上能达到85%至91%的准确率但放进五十多页的长文档背景后图表阅读准确率普遍大幅下滑。OCR与视觉对比实验中那46个百分点的差距以及模型在视觉幻觉错误凭空报出图中不存在的数值上的高度集中都指向同一个结论在长文档的噪声背景下模型的像素级视觉解码能力出现了系统性退化这与它们在孤立图表上的表现形成了鲜明反差。六、细看错误有哪些特别值得关注的发现研究团队从1788道题里挑出了所有被测模型都得分不超过3分的109道全员失败题并对失败原因进行了分类分析。在这109道题中跨模态类问题占了58道超过半数而图表阅读类37道、复杂推理类14道。这说明在长文档场景下最难攻克的挑战不是单纯的图表理解而是在图表和文字之间建立准确的量化联系。在具体的错误类型中视觉幻觉模型自信地报出了图中根本不存在的数值是最主要的失败原因集中出现在密集数值图表、哑铃图和多系列比较图上。模型定位到了图表也识别出了目标元素但在最后一步的像素级数值提取上出了错而且报错通常非常有把握不会说我不确定。图表未找到模型说文档中找不到该图但实际上该图确实存在和精度错误找对了图表和元素但数字的量级或单位出错比如把百分比当成绝对数值或者把10亿级别读成百万级别也是高频错误类型。按问题细分类型来看趋势与模式判断类问题是所有模型表现最好的因为感知方向上升还是下降不需要精确数值提取容错空间大而数值读取和跨来源整合是最难的两类分别对应了视觉精度瓶颈和跨模态对齐瓶颈。在复杂推理类问题中技术性或定量推理题的模型间差距最大——Gemini得0.643GPT-4o只有0.111InternVL3只有0.156这一64%对11%的鸿沟意味着定量多步推理能力才是区分顶级模型的真正试金石。七、图像呈现方式如何影响成绩研究团队还对图像输入方式做了一系列消融实验即单独改变一个参数观察效果的实验发现了几个实用价值很高的规律。首先是每条图像条中包含的页数。对Gemini来说随着每条包含的页数从1增加到2、5、10准确率从0.369持续上升至0.792跨模态类问题的提升幅度最大从0.339升至0.707说明更多的上下文信息对于需要跨页整合证据的任务至关重要。但GPT-4o在每条2页时表现最好0.396增加到10页反而下降0.354Claude-Sonnet-4.5在每条5页时达到最优之后保持平稳或略降。这表明不同模型对最优信息密度的需求不同不存在一个对所有模型通用的最佳设置。其次是图像分辨率。对Gemini来说144 DPI是最优分辨率提升到216 DPI性能反而略微下降原因在于更高分辨率会增大图像文件大小触发API的4MB压缩限制JPEG压缩会损失图表的细节信息得不偿失。提示策略方面对Claude来说不使用系统提示词直接让模型自由回答时复杂推理类的准确率从0.337大幅跳升到0.515说明必须在2到4句话内回答的指令约束反而压制了需要展开推理步骤的问题的表现。链式思维提示让模型先拆分步骤再回答对所有模型都有小幅提升但在GPT-4o的图表阅读上反而有所下降因为更长的输出增加了引入中间幻觉步骤的风险。八、这套测试台的可信度有多高研究团队的外部效度检验即验证这套测试的结果是否与真实世界的能力排名一致给出了一个温和肯定的答案。SynthDocBench的整体准确率排名与MMLongBench-Doc一个基于真实文档的长文档理解测试的排名之间Spearman等级相关系数为0.657Pearson相关系数为0.683说明两者之间存在中等程度的正相关——在SynthDocBench上表现好的模型在MMLongBench-Doc上通常也不差但排名并不完全一致。有意思的偏差出现在GPT-4o身上它在MMLongBench-Doc上排名第二但在SynthDocBench上只排到第三。研究团队认为这很可能是因为SynthDocBench对精确图表数值读取和跨模态对齐的要求远高于MMLongBench-Doc那个更异质化的真实文档题库而这两项能力恰好是GPT-4o的薄弱环节。这种不完美的相关性本身就是一个有价值的信号SynthDocBench测量的能力维度与现有测试并不完全重叠它揭示的是额外的、此前被掩盖的模型局限。研究团队在Gemini-3.1-Pro的突出优势上也保持了应有的审慎。Gemini与第二名Qwen3.5-VL-122B0.655之间的差距高达7个百分点与第三名的差距接近14个百分点。但研究团队指出SynthDocBench使用HTML/D3.js渲染的图表这种风格可能与Gemini的训练数据分布更相似不能完全排除渲染风格熟悉程度对成绩的影响未来需要用其他渲染后端重复验证才能确定。归根结底SynthDocBench做的事情是给整个视觉语言模型领域设置了一个更精确的标尺。当前最强模型在DocVQA单页文档上已经逼近甚至超过人类基线但在这套控制变量的长文档测试台上即便是排名第一的Gemini也只拿到了72.5%——这还是在问题类型和文档结构都经过精心设计、相对公平的条件下。那些在图表上挣扎的模型、那些记不住文档中间内容的模型、那些随着问题变难而迅速崩溃的模型它们在真实世界里处理一份复杂的商业报告或科研文献时失败的风险会比这些数字所呈现的更高。这对普通人来说意味着什么如果你在工作中期望用AI来帮你处理那种又长又有图的报告这项研究的结论是一个清醒的提醒现在的AI在处理这类文档时并不像它在处理短文本时那样可靠。它可能看漏了图表可能把中间章节的数据搞混也可能在需要对比第5页图表和第38页数字的问题上一败涂地。理解这些局限才能更合理地使用这些工具而不是把它们当作全知全能的文档助手。至于研究团队本身他们计划未来将SynthDocBench扩展到更多文档类型如表格、表单、混合版式报告、更长的上下文以及更多样化的推理任务持续拓展这套驾考场的覆盖范围。QAQ1SynthDocBench和DocVQA这类现有文档测试有什么本质区别ADocVQA等测试使用的是真实文档当模型答错时很难判断是因为图表难、还是文档太长、还是问题措辞模糊。SynthDocBench则完全合成生成文档长度、图表数量、版式风格、问题难度都可以独立控制像实验室实验一样逐一排查原因这是它最核心的价值。Q2视觉语言模型在SynthDocBench上表现最差的是哪类题目A跨模态类问题是所有模型共同的最难关需要在不相邻的文字段落和图表之间建立量化联系。在所有模型集体失败的109道题中跨模态题占了58道超过了图表阅读类和复杂推理类的总和。Q3SynthDocBench里所说的位置偏差是什么意思A研究发现模型对文档中间部分的图表理解能力普遍弱于前段和后段八个被测模型中有五个出现了这一规律这被称为迷失在中间效应。最极端的例子是Qwen3.5-VL-122B从前段到中段准确率下降了18.5个百分点。这意味着如果一份报告的关键图表恰好在中间AI更可能在那里出错。

相关新闻