尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

ZipRerank:Very Efficient Listwise Multimodal Reranking for Long Documents——面向长文档的极高效率列表式多模态重排序

ZipRerank:Very Efficient Listwise Multimodal Reranking for Long Documents——面向长文档的极高效率列表式多模态重排序 一、研究背景与问题应用场景视觉问答VQA、多模态检索增强生成M-RAG等需要从长文档如PDF、网页中检索相关页面。标准范式两阶段架构——第一阶段用检索器快速召回候选页面第二阶段用重排序器精排。核心瓶颈现有的多模态列表式重排序器如MM-R5虽然准确率高但存在两大效率问题输入过长多个候选页面的视觉标记图像token拼接后序列极长Transformer自注意力计算量巨大。自回归解码慢生成排序结果需要多步迭代输出甚至包含推理链即使有KV缓存也很慢。二、核心方法ZipRerank1. 训练阶段两阶段阶段数据目标关键设计阶段一通用重排序预训练大规模纯文本重排序数据RankZephyr将文本渲染为图像学习通用列表式排序能力使用RankNet 成对损失 语言模型损失阶段二多模态微调MMDocIR真实文档图像用GPT-5生成软标签排序适应视觉文档场景使用软排序损失几何衰减的目标分布抗噪性强2. 推理阶段两大加速机制机制做法效果查询-图像早期交互剪枝用查询token与视觉token的余弦相似度每张图仅保留最相关的ρ比例视觉token大幅缩短输入序列长度单令牌解码每个候选页面对应一个字母标识符A、B、C...模型一步输出所有logits直接按分数排序消除自回归解码单次前向传播完成三、实验结论数据集MMDocIR10个领域313篇长文档、ViDoRe泛化测试。第一阶段检索器DSE单向量和 ColQwen多向量后期交互。主要结果对比项ZipRerankMM-R5SOTA提升/优势Recall3/5更高较低全面超越或持平Recall1略低更高MM-R5靠推理链保top-1但代价大LLM推理延迟~0.36秒~3.82秒加速约10倍端到端速度538ms/查询4107ms/查询加速约7.6倍消融实验关键发现两阶段训练缺一不可去掉任一阶段性能明显下降。软排序损失优于硬排序损失RankNet对教师噪声更鲁棒。单令牌解码在几乎不损失准确率的情况下速度提升6倍以上。参数研究保留比例ρρ越小越快但准确率略有下降可灵活权衡。候选数kk≥20时性能稳定LLM时间随k线性增长。泛化与鲁棒性在ViDoRe上优于MM-R5证明跨领域泛化能力。使用较弱的GPT-5-nano作为教师时ZipRerank仍能超越教师本身说明训练策略鲁棒。四、贡献总结问题分解明确识别出列表式多模态重排序的两大延迟来源长上下文 自回归解码。训练创新两阶段训练 软排序损失实现在弱监督下的鲁棒列表式学习。推理创新查询感知视觉剪枝 单令牌解码实现单次前向传播的高效重排序。实用价值在MMDocIR和ViDoRe上达到SOTA水平延迟降低一个数量级适合实际部署。五、局限性依赖教师模型生成排序可能继承其偏差。激进剪枝可能丢失细粒度信息小文字、密集表格、视觉相似页面。主要在文档图像检索上验证更多领域/语言需进一步测试。ZipRerank通过两阶段训练让模型学会高效排序再通过查询感知剪枝单步解码让推理速度大幅提升在几乎不牺牲准确率的前提下将重排序延迟降低了约10倍使得多模态长文档重排序真正可用于实际系统。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要列表式重排序是基于视觉的检索和多模态检索增强生成M-RAG处理长文档时的关键但计算成本高昂的组件。尽管最近基于视觉语言模型VLM的重排序器实现了强大的准确性但其实用性通常受到长视觉标记序列和多步自回归解码的限制。我们提出了 ZipRerank一种高效率的列表式多模态重排序器直接解决了这两个瓶颈。它通过轻量级的查询-图像早期交互机制减少了输入长度并通过单次前向传播对所有候选者进行评分从而消除了自回归解码。为了实现有效的学习ZipRerank 采用了两阶段训练策略i在呈现为图像的大规模文本数据上进行列表式预训练以及ii使用 VLM 教师蒸馏的软排序监督进行多模态微调。在 MMDoCIR 基准上的大量实验表明ZipRerank 匹配或超越了最先进的多模态重排序器同时将大型语言模型LLM推理延迟降低了多达一个数量级使其非常适合延迟敏感的实际系统。1. 引言基于视觉的长文档多模态检索已成为现代多模态系统中的基础能力支持视觉问答VQA和多模态检索增强生成M-RAG等广泛应用。在这些场景中文档通常视觉内容丰富且跨越许多页面要求模型能够联合推理文本查询和大量文档图像集合。图 1. 在 MMDoCIR 上页面级重排序的速度-准确性权衡Recall3 与 LLM 延迟。ZipRerank红色变化令牌保留率 (rho)实现了与 MM-R5 相当的最优性能同时将延迟降低了约 (10 times)并以约 (58times) 更低的推理成本显著缩小了与 GPT-5-mini 的差距。在纯文本信息检索中有效性和效率通常通过两阶段架构来平衡。第一阶段检索器使用密集表示执行大规模相似性搜索随后由重排序器对顶级候选进行细化以提高排序质量。在此范式中点式重排序器独立地对每个查询-文档对进行评分通常以重复推理为代价实现强准确性而列表式重排序器则联合处理所有候选者通过避免冗余计算提供了一种更高效的替代方案。然而将列表式重排序扩展到长多模态文档会带来巨大的效率挑战。随着候选页面数量的增加以及每个页面贡献成百上千个视觉标记所产生的输入序列迅速超出基于 Transformer 模型的实际限制导致严重的计算和内存开销。最近的多模态列表式重排序器如 MM-R5表明引入显式推理例如通过思维链可以显著提高性能。然而这些提升是以增加延迟和资源消耗为代价的限制了它们在现实世界中延迟敏感场景下的实用性。多模态列表式重排序的低效率可追溯到两个主要原因。首先由于长多模态上下文预填充成本变得过高其中对串联视觉标记的注意力计算占主导地位。其次自回归解码引入了额外的延迟因为重排序器通常以严格顺序的方式生成多标记输出包括推理轨迹和排序序列。即使采用 KV 缓存这种依赖结构也会导致显著的减速尤其是随着候选者数量的增加。在这项工作中我们提出了 ZipRerank一个用于训练面向长文档检索的高效列表式多模态重排序器的框架。我们的方法整合了训练和推理两方面的创新。在训练方面我们采用两阶段策略阶段1利用大规模纯文本重排序数据学习通用的列表式排序行为而阶段2则使用由强大 VLM 教师生成的排序增强的 VQA 风格数据使模型适应多模态场景。为了解决这种监督中固有的噪声我们引入了一个软排序目标该目标在候选者之间分配梯度评分而不是依赖严格的成对或硬标签。在推理时ZipRerank 通过互补的效率机制直接针对上述两个瓶颈。首先我们使用轻量级的查询-图像早期交互模块进行查询感知的视觉标记剪枝从而减少输入长度。其次我们采用单 logit 评分策略使模型能够在单次前向传播中对所有候选者进行排序从而消除了自回归解码。这些设计在保持建模复杂跨模态交互能力的同时显著降低了延迟。我们在 MMDocIR 上评估了 ZipRerank这是一个用于长多模态文档检索的具有挑战性的多领域基准。在广泛的实验中ZipRerank 与最先进的多模态重排序器 MM-R5 相比取得了具有竞争力甚至在某些情况下更优的性能同时将 LLM 推理延迟降低了多达一个数量级。此外它持续改进了强大的第一阶段检索器。这些结果表明通过精心协同设计训练目标和推理机制可以显著缩小基于 VLM 重排序的效率-准确性差距。我们的主要贡献总结如下延迟分解。我们识别了面向长文档的列表式多模态重排序器中的两个基本瓶颈视觉令牌上的长上下文 Transformer 计算和自回归解码开销为高效设计提供了清晰的基础。面向高效列表式重排序的训练。我们提出了 ZipRerank一种两阶段训练范式通过 VLM 教师蒸馏的监督和抗噪的软排序目标将通用排序能力从大规模文本数据迁移到多模态环境从而在弱监督下实现鲁棒的列表式学习。单次高效推理。我们引入了一个端到端的高效重排序流水线该流水线结合了查询感知的视觉令牌剪枝与单 logit 列表式评分减少了输入长度和解码成本实现了单次前向传播推理。效率-有效性权衡。在 MMDocIR 上的大量实验表明ZipRerank 匹配或超越了最先进的重排序器同时实现了高达一个数量级的缓存 LLM 延迟降低并通过全面的消融实验验证了每个设计组件。2. 相关工作信息检索中的重排序器。检索器-重排序器范式是信息检索中平衡效率和有效性的标准框架。在第一阶段密集检索器将查询和文档编码为嵌入向量以进行可扩展的相似性搜索通常针对高召回率进行优化。第二阶段的重排序器随后细化前 kk 个候选者以提高排序准确性。虽然有效但重排序通常会产生显著的计算开销和延迟。相比之下ZipRerank 专注于通过重新设计训练和推理来降低这第二阶段的成本实现在不牺牲排序质量的情况下进行高效的列表式评分。多模态信息检索MMIR。随着多模态应用如 M-RAG、多模态搜索和 VQA的兴起对视觉丰富文档的检索越来越受到关注。诸如 MMDocIR 等基准测试捕捉了现实世界的挑战包括长文档、多样化的领域以及需要跨多个页面进行跨模态推理的查询。ZipRerank 正是针对此场景设计的其目标是解决长多模态文档带来的可扩展性和效率挑战同时保持强大的跨模态推理能力。多模态信息检索MMIR检索器。多模态检索器可大致分为单向量和多向量方法。单向量检索器如 DSE将每个文档编码为单个嵌入向量以实现高效检索而多向量或后期交互方法如 ColQwen使用多个表示以增加计算成本为代价实现更高的准确性。最近的工作如 Light-ColPal探索了令牌缩减技术以提高效率。这些方法主要优化第一阶段的检索步骤而 ZipRerank 则通过专注于高效的第二阶段重排序来补充它们后者仍然是多模态流水线中的主要瓶颈。多模态信息检索MMIR重排序器。多模态重排序器通常采用点式或列表式设计。点式方法独立地对每个查询-文档对进行评分通常实现强准确性但由于需要重复前向传播而导致高延迟。最近的多模态重排序器如 LamRA-Rank 和 UniME-V2-Reranker 进一步扩展了这一方向通过调整大型多模态模型以适应通用检索和重排序任务并支持点式或列表式排序公式。列表式重排序器联合处理多个候选者并生成或评分一个有序列表提供比点式评分更高效的公式。其中MM-R5 通过结合思维链推理展现了强大的性能。然而其对长多模态输入的自回归生成的依赖导致了大量的推理延迟。ZipRerank 与以往重排序器的不同之处在于它明确地协同设计了训练和推理以提高效率它通过单 logit 评分消除了自回归解码并通过查询感知的令牌剪枝减少了输入长度从而实现了具有竞争性准确性的单次重排序。3. 预备知识3.1. 问题定义3.2. 延迟来源在列表式重排序中推理延迟通常由重排序器的 Transformer 计算主导而非第一阶段的检索。两个因素驱动了成本。首先输入上下文可能非常长因为提示词将查询与来自多个候选页面的视觉标记连接起来通常导致数千个标记在这种长上下文上的注意力计算成为主要瓶颈。其次许多重排序器以自回归方式输出一个有序列表需要多个顺序解码步骤。即使使用 KV 缓存每一步都必须处理相同的长上下文因此生成过程进一步放大了延迟。我们的推理优化通过缩短有效的视觉标记序列和通过单次评分避免多步解码来解决这两个来源。对于一个解码器-only 的 Transformer其上下文长度为 n生成长度为 u推理成本可近似为4. ZipRerank 框架我们介绍 ZipRerank一个用于训练面向长文档检索的高效列表式多模态重排序器的框架图 2。4.1. 训练阶段我们使用指令风格的公式训练 ZipRerank见图 5。每个训练样本包含一个文本查询 q 和一个包含 mm 个候选文档页面的列表这些页面呈现为图像。每个候选者被分配一个唯一的单令牌标识符例如A, B, ……目标输出是按相关性降序排列的这些标识符的有序序列。训练分为两个阶段阶段1使用完全监督的排序进行通用列表式排序行为的预训练阶段2使用教师蒸馏的软监督进行视觉文档重排序的微调。4.1.1. 阶段 1通用重排序预训练在阶段1我们利用大规模的纯文本重排序语料库并将文本段落渲染成类似页面的图像以预训练通用重排序能力。由于这些数据集提供了完整的排序监督我们优化4.1.2. 阶段 2视觉重排序微调在阶段2我们在多模态检索数据集例如VQA 风格数据上进行微调这些数据通常只提供一个真实正例。为了获得对整个候选列表的监督我们使用一个更强的 VLM 教师例如OpenAI 的 GPT-5来生成候选者的辅助排序并将其视为软标签。我们优化几何衰减的动机来自基于排名的偏置精度RBP它假设在排序列表中存在一个固定的延续概率因此对排名靠后的结果赋予指数级递减的重要性。与阶段1中的成对损失不同此目标能够适应教师排序中的不确定性它以真实项为锚点同时为其他高排名候选者分配分级评分从而在多个候选者可能都看似相关时提高鲁棒性。4.2. 推理阶段在推理时我们针对长文档多模态重排序中的两个主要延迟来源i由高分辨率页面图像和列表式连接引起的长输入序列以及ii自回归生成所需的多次前向传播。我们通过查询-图像早期交互来解决i并通过采用单令牌解码来产生最终排序只需一次 LLM 前向传播从而解决ii。5. 实验5.1. 实验设置5.1.1. 数据集训练。我们使用两个数据集从 Qwen3-VL-8B 微调我们的模型。阶段1使用 RankZephyr这是一个从 GPT-4 排序中蒸馏的大规模文本段落重排序数据集。我们将每个段落渲染成 280×280 的图像并动态调整字体大小以最大化画布内的文本覆盖率。阶段2在 MMDocIR 训练集上进行微调。基准测试。我们在 MMDocIR 基准的页面级检索任务上进行评估。评估集包含 313 篇长文档涵盖 10 个不同领域平均长度为 65.1 页以及 1,658 个专家策划的查询。遵循 MM-R5我们使用第一阶段检索器检索前 20 个候选页面然后在第二阶段对其进行重排序。5.1.2. 评估指标该指标衡量在 top-k 结果中检索到的真实证据页面的比例。在跨数据集/子集聚合时我们报告微平均和宏平均 Recallk微平均是对所有查询取平均而宏平均是先计算每个数据集/子集内的平均值然后再对各子集取平均。LLM 挂钟时间。作为主要结果表中的辅助效率指标我们报告缓存的 LLM 重排序时间不包括视觉编码和其他预处理成本。该指标隔离了在视觉嵌入可用后 LLM 重排序步骤的成本对于比较不同重排序器的解码和评分效率很有用。对于基于 API 的模型我们报告 API 挂钟时间。为了补充此缓存指标我们还在附录 C.5 中提供了端到端效率分析包括视觉编码、查询感知过滤、LLM 时间、吞吐量、FLOPs 和峰值 GPU 内存。表 1. 使用第一阶段检索器 DSEwiki−ss​ 的页面级检索和重排序主要结果。5.1.3. 模型我们考虑两种第一阶段检索器DSEwiki−ss​一个单向量检索器和 ColQwen一个多向量后期交互检索器。对于基于 VLM 的列表式重排序基线我们与 Llama-3.2-11B-Vision、Qwen3-VL-8B-Instruct、GPT-5-nano 和 GPT-5-mini通过官方 API进行比较。我们还包括最近提出的列表式多模态重排序器包括 MM-R5、LamRA 和 UniME。我们从 Qwen3-VL-8B-Instruct 检查点微调 ZipRerank。更多细节包括超参数、训练设置和检查点请参见附录 B。表 2. 使用第一阶段检索器 ColQwen 的页面级检索和重排序主要结果。5.2. 主要结果表 1 和表 2 分别展示了在由 DSEwiki−ss​ 和 ColQwen 检索的前 20 个候选者上的重排序结果。ZipRerank 在所有 k 值上都持续改进了两个第一阶段检索器证明了其强大的重排序有效性同时缓存的 LLM 重排序时间小于 0.4 秒。与 MM-R5 相比我们的模型以显著更低的延迟和计算成本实现了具有竞争力的性能。在 DSEwiki−ss​ 和 ColQwen 输入上ZipRerank 都取得了更高的 Recall3 和 Recall5同时在 Recall1 上略逊于 MM-R5。这反映了速度与 top-1 准确性之间的权衡MM-R5 显式生成推理链来证明顶部结果的合理性这有利于 Recall1但会带来大量的自回归开销。与零样本基于 VLM 的重排序相比我们发现相对较小的模型如 Llama3.2-11B-Vision 和 Qwen3-VL-8B-Instruct 并不能持续改进第一阶段检索器。这表明对于较小的 VLM 来说有效的列表式重排序具有挑战性它们既需要遵循排序指令又需要联合推理多达 20 个页面图像。相比之下更强大的 VLM 如 GPT-5-mini 表现要好得多这促使我们选择使用有能力的教师模型为阶段2训练生成软标签。同时如此大型的 VLM 对于部署来说慢得不切实际即使通过 API每次重排序请求也可能需要超过 20 秒。这种差距凸显了在严格延迟约束下提供高质量的专业重排序器的必要性。为了评估查询-图像早期交互的影响我们包括了 ZipRerank-50%即在过滤后仅保留 50% 的视觉标记。请注意Qwen3-VL 已经应用了激进的池化4:1因此这代表了高压缩率。正如预期令牌减少导致性能适度下降但也减少了运行时间。延迟减少并非完全成比例这是由于批处理大小和我们两步推理过程用于分别提取查询嵌入中的架构开销等因素造成的。总体而言这些结果突显了我们方法的实用性它在适合实际部署的延迟和计算预算下实现了强大的重排序增益。5.3. 消融研究为了评估每个设计组件的贡献我们对 ZipRerank 的变体进行了消融研究。表 3 总结了在 MMDoCIR 基准上对 DSEwiki-ss 的 top-20 结果进行重排序的消融变体结果。无第一阶段预训练。跳过通用重排序预训练直接在阶段2训练数据上微调 Qwen3-VL-8B-Instruct。结果表明移除第一阶段预训练会持续降低性能。我们将此下降归因于阶段2监督的多样性和规模较小以及有效训练步数的减少。此消融表明第一阶段预训练对于学习强大且可泛化的重排序行为是必要的。无第二阶段微调。此版本跳过多模态重排序微调仅使用阶段1预训练进行训练。移除第二阶段微调会持续降低性能这表明以视觉为中心的训练数据提供了阶段1之外的额外监督对于学习鲁棒的多模态重排序很重要。无单 Logit 解码。当我们用标准自回归生成替换单 logit 解码时排序性能保持基本相当但推理速度慢了 6 倍多。这表明我们的训练策略有效地使模型与单 logit 解码机制对齐从而在不牺牲准确性的情况下实现高效推理。无软排序损失。将阶段2的软排序损失替换为阶段1使用的 RankNet 损失会导致性能适度下降尤其是在 k1 时。这一结果支持了软排序目标在从有噪声的、教师增强的监督中学习时的有效性。表 3. 在 DSEwiki-ss 上的 ZipRerank 消融研究。5.4. 参数研究ρ 的影响。我们改变公式4中的视觉标记保留比例 ρ并报告相应的 LLM 时间和 Recallk。如附录 A.1 中的计算模型所预测图 3 显示在长上下文场景下降低 ρ 会减少时间但也会导致重排序质量下降。这种权衡可以根据特定应用的延迟和准确性需求进行调整突显了我们查询-图像早期交互令牌过滤的灵活性。随 k 的扩展。我们改变输入候选数 k以评估 ZipRerank 在重排序列表增长时的鲁棒性。如图 4 所示对于 k≥20性能总体稳定而 k10 时由于检索器提供的候选集有限召回率较低。正如预期随着更多候选页面贡献更多输入标记LLM 时间随 k 增加。5.5. 在新基准上的泛化能力我们在 ViDoRe 的英文子集上评估 ZipRerank以测试其领域外泛化能力。如表 4 所示在 DSE 和 ColQwen 两种设置下ZipRerank 在列表式重排序器中取得了最佳的 NDCG5。它将 MM-R5 从 49.0 提升到 53.4使用 DSE并从 55.8 提升到 59.9使用 ColQwen。ZipRerank-50% 尽管只保留了一半的视觉标记但性能依然强劲表明效率提升并非特定于 MMDocIR。点式 LamRA 获得了最高分但需要对每个候选者进行评分而 ZipRerank 在单次前向传播中执行列表式重排序。5.6. 对教师模型的鲁棒性我们通过用较弱的 GPT-5-nano 教师替换 GPT-5-mini 来研究 ZipRerank 对教师强度的敏感性。如表 5 所示使用 GPT-5-nano 训练的 ZipRerank 与使用 GPT-5-mini 的版本性能接近。而且它持续优于 GPT-5-nano 教师本身例如在 DSEwiki-ss 上它在 Recall1/3/5 上从 59.0/79.1/84.7 提升到 63.6/82.2/87.1。这表明 ZipRerank 对较弱的教师监督具有鲁棒性并受益于所提出的两阶段训练和软排序目标。表 4. 在 ViDoRe英文上的 NDCG5。表 5. 对阶段2教师强度的鲁棒性。我们比较了教师模型与使用其生成的排序训练的 ZipRerank 模型。Ma-Avg 代表宏平均Mi-Avg 代表各数据集的 recall k 分数的微平均。6. 结论我们提出了 ZipRerank一个用于训练面向长文档的高效列表式多模态重排序器的框架。ZipRerank 采用两阶段训练流程结合大规模文本重排序和以视觉为中心的 VQA 风格数据以及互补的目标函数使模型具备强大的重排序能力。为了解决长多模态输入序列和自回归解码造成的过高延迟我们提出了一种轻量级的查询-图像早期交互机制用于查询感知的视觉标记缩减并采用单 logit 解码来加速推理。在 MMDocIR 和 ViDoRe 上的大量实验表明ZipRerank 匹配或超越了最先进的多模态重排序器同时效率显著提高使其适用于延迟敏感的实际系统。图 3. 图像标记保留比例 ρ 对重排序有效性Recall1, 3, 5和延迟LLM 时间毫秒影响的参数研究基于 DSEwiki-ss 的第一阶段结果。图 4. 输入段落数量 (k) 对重排序有效性Recall1, 3, 5和延迟LLM 时间毫秒影响的参数研究基于 DSEwiki-ss 的第一阶段结果。
返回列表