尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

清华等DataClaw0:18B参数成数据剪裁分水岭,小模型分工,大模型统一

清华等DataClaw0:18B参数成数据剪裁分水岭,小模型分工,大模型统一 DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams作者Cong Wan, Zeyu Guo, Zijian Cai, Jiangyang Li, SongLin Dong, Lin Peng, Xiangyang Luo, Zhiheng Ma, Yihong Gong核心发表机构Xi’an Jiaotong University、University of Chinese Academy of Sciences、Shenzhen University of Advanced Technology、Tsinghua University论文链接arXiv:2606.21337v2发布于arXiv 预印本cs.LG|—|—|—|| 4B | SFT Only | 71.86 | 58.24 || 4B | GRPO w/oR a n c h o r R_{anchor}Ranchor​| 72.94 | 55.71 || 4B | GRPO w/R a n c h o r R_{anchor}Ranchor​| 69.53 | 60.18 || 4B |Δ \DeltaΔ(SFT Only → w/ anchor) | −2.33 | 1.94 || 9B | SFT Only | 82.54 | 70.83 || 9B | GRPO w/R a n c h o r R_{anchor}Ranchor​| 82.36 | 71.96 || 9B |Δ \DeltaΔ| −0.18 | 1.13 || 27B | SFT Only | 86.15 | 76.42 || 27B | GRPO w/R a n c h o r R_{anchor}Ranchor​| 88.27 | 81.03 || 27B |Δ \DeltaΔ| 2.12 | 4.61 |Field 分数在所有高于 minimal init 的变体中饱和到 100.00因此表中省略。绝大部分能力来自 SFT加入R a n c h o r R_{anchor}Ranchor​的 GRPO 效果随规模单调变化4B 时 Semantic 下降 2.33 分、Sequence 仅提升 1.94 分净有害9B 时接近中性27B 时两项同时提升Semantic 2.12、Sequence 4.61。这是与跨域迁移阈值约 18B相互独立的第二个证据低于容量阈值时本应互补的目标五个域或结构保真与语义质量会竞争同一表征优化一个会损害另一个高于阈值时则相互放大。实践指导是RL 阶段在约 9B 以下不应使用9B 时可选用27B 时明确值得。专家路由消融。论文测试了用错误专家处理输入域的后果对 Embodied 输入使用 GUI 专家时Field 与 Semantic 均直接归零对 GUI 输入使用 Embodied 专家时Field 归零。单域专家在自己的域内很强例如 GUI 专家处理 GUI 输入时 Field 100.00、Semantic 84.93、Sequence 76.41但在其他域上几乎完全崩溃。这说明准确的专家选择是不可或缺的而这也是联合训练所消除的脆弱性。匹配数据比较与跨域迁移矩阵。论文的关键实验设计是匹配数据比较对每个域D DD单域专家只在D DD上训练联合模型在D DD上评估时也只看与专家完全相同的D DD数据子集。因此联合模型任何额外优势都必然来自另外四个域而非因为它看过更多D DD数据。在 27B 下联合模型在五个域中的四个上领先唯一例外是 Daily Life。在领先的域上优势在低数据 regime 最大AIGC 在只给 10% 域数据时领先 9.7 分给 100% 时仍领先 9.4 分。图 6 展示了将“联合相对专家的收益”对“该域已有数据量”回归的结果斜率约为 −0.61 分/每增加 1K 域内示例在约 13K 个示例处过零——只有 Daily Life16.1K超过该点因此它是唯一偏好独立训练的域。跨域迁移矩阵进一步揭示了迁移的结构所有非对角项均为正均值 8.2对角项域内训练均值 41.0因此没有负迁移。最大的非对角迁移符合结构预期GUI ↔ Embodied 互相迁移最大14 和 13因为两者都需要恢复有序动作序列Daily / Education / AIGC 之间迁移较大9~13因为三者都需要对未修剪视频做时间分割。Held-out 域泛化。论文进一步测试了联合模型在完全没看过某域任何样本时的表现Held-out 域BaseJoint w/o DRecov.Joint (all)Expert DDaily35.4659.7268%70.9271.46Embodied38.7266.9456%89.3486.91GUI44.1871.3654%94.7191.28Education33.9161.0561%78.1472.35AIGC31.0555.1854%75.8666.42联合模型在未见过该域任何样本的情况下平均恢复 zero-shot base 到完整联合模型之间差距的59%恢复率最高为 Daily Life68%最低为 GUI 与 AIGC54%。这与其结构直觉一致GUI 最依赖领域特有的界面约定AIGC 则高度依赖生成任务特有的运动描述二者从其他域借力最困难。定性分析。图 7 展示了两个代表性场景的定性对比左侧是机器人操作数据构建右侧是 GUI 任务重建。相比通用 MLLM 的输出红色叉标记无效/不完整输出DataClaw0能够准确识别关键行为模式、选择时间上一致的证据片段、剔除无关轨迹片段、并建立完整结构化的任务监督而基线模型则出现片段不匹配、缺失关键字段、保留干扰物、输出非结构化序列等问题。这直接展示了“tailoring”与“captioning”之间的实际差别。4.4 下游验证 / Downstream Validation为了验证DataClaw0裁剪的数据“不仅格式良好而且实际有用”论文设计了统一的定向精炼协议Targeted Refinement。对同一条原始流由四种来源分别处理下游基座模型自身self-refinement 对照、Gemini-3.1-Pro-Preview、DataClaw0-9B、DataClaw0-27B。随后应用相同的过滤流程从每个来源采样等量有效实例用相同的超参数微调相同的下游基础模型从而隔离“数据质量”而非“数据量”的效应。三个下游任务覆盖了不同的输出空间与推理需求长视野 GUI 导航基座 Qwen3.5-4B指标 Step Success Rate / Task Success RateS S R # successful steps # total steps , T S R # successful tasks # total tasks \mathrm{SSR} \frac{\#\text{successful steps}}{\#\text{total steps}},\quad \mathrm{TSR} \frac{\#\text{successful tasks}}{\#\text{total tasks}}SSR#total steps#successful steps​,TSR#total tasks#successful tasks​动作视频生成基座 Wan2.2-I2V-5B指标 FVD、temporal consistency、Contact mAP微调配置为 200 个 clips、分辨率480 × 832 480\times832480×832、每 clip 81 帧、3 epochs、学习率1 × 10 − 5 1\times10^{-5}1×10−5、batch size 1、8×A100 80GB。时空 VQA基座 Qwen3.5-4B指标 Partial Accuracy / Overall Accuracy。下游结果如下SFT 数据来源GUI SSR↑GUI TSR↑Video FVD↓Video Cons.↑Video Cont.↑VQA Part.↑VQA Ovr.↑Zero-shot Base Model12.41.2385.268.418.528.39.8Processed by Base Model16.83.5362.169.124.233.514.2Processed by Gemini-3.1-Pro39.514.2295.476.248.553.431.5DataClaw0-4B-O28.68.1325.271.837.442.721.5DataClaw0-4B-E31.49.8314.772.941.645.324.1DataClaw0-9B-O34.912.7301.574.245.848.628.4DataClaw0-9B-E38.215.6288.675.851.252.133.2DataClaw0-27B-E41.317.4279.877.153.654.234.9DataClaw0-27B-O43.119.8268.478.956.456.737.6结论有三层。第一自我改进收益有限基座自身处理自身数据只比 zero-shot 略好简单的 self-refinement 不足以应对这些挑战性任务。第二高质量结构化监督至关重要Gemini 与DataClaw0处理的数据都带来显著提升。第三DataClaw0-27B-O在所有指标上全面领先包括 Gemini 此前在部分/步骤级指标上的优势项GUI SSR 43.1 vs 39.5VQA Partial 56.7 vs 53.4。端到端指标的差距更大VQA Overall 37.6 vs 31.5TSR 19.8 vs 14.2说明DataClaw0优化的“紧凑、schema 对齐、任务相关”监督对端到端任务解决更有效而通用模型容易产生啰嗦但非关键的描述。更值得关注的是Omni-vs-Expert 的排序在下游任务中完整复现4B 时 -E 胜TSR 9.8 vs 8.19B 时 -E 胜15.6 vs 12.727B 时 -O 胜19.8 vs 17.4。这证明DataClaw0-val上测得的跨域迁移不是自评指标的产物而是能在外部任务中产生实际效果的能力。基准能否预测下游效用图 8(a) 将DataClaw0-val的 Overall 分数与每个 checkpoint / 外部标注者的平均下游增益做散点。相关性极强Pearsonr 0.97 r0.97r0.97Spearmanρ 0.98 \rho0.98ρ0.9813 个点。但存在两个系统性偏差9B Omni checkpoint 与 GPT-4o 都位于趋势线下方即它们的基准分数“高估”了实际下游效用。原因在于两者产生相对“啰嗦”的记录field/sequence 评分会奖励这种详细程度但下游训练不一定从中受益。论文因此将基准定位为“可预测但未校准”的开发信号而非最终目标。五、相关工作 / Related Work与多模态大模型数据管线的关系。现有数据管线大多是“被动处理”启发式采样帧、生成粗粒度描述、或直接提示 VLM 输出 caption/QA。这些方法在短、精选输入上有效但在长噪声流上容易产生幻觉、碎片化、信息密度低的问题。DataClaw0将数据生产本身建模为可学习能力强调意图条件下的熵减——模型必须主动决定从高熵原始流中保留什么、丢弃什么、以什么结构输出。这与传统的“描述”范式有本质区别。与指令合成/数据整理工作的关系。Self-Instruct、WizardLM、Orca 等工作聚焦单模态或短文本指令合成通过提示强语言模型生成多样化指令来扩展训练集。DataClaw0针对的是连续多模态流要求时空一致、隐式物理理解和结构 schema 遵守。另一个区别在于这些方法通常面向通用指令跟随能力而DataClaw0的输出直接面向“下游训练消费”——它的监督形式是可供后训练直接使用的结构化样本而非对话文本。与 Agentic AI 的关系。现有 agent 工作强调推理时的规划、工具调用与迭代修正。DataClaw0虽然灵感来自 agentic workflow但推理时不做工具调用、不迭代修订只做一次条件映射。Agentic 性质主要体现在数据构建阶段的“提取 合成”流水线设计。论文的这种克制是有意的它保证了训练后的模型可以被廉价、稳定地部署不需要额外的推理时基础设施。六、局限性与展望 / Limitations Future Work能力来自专有 teacher。论文明确承认DataClaw0是从专有 VLM如 Gemini-3.1-Pro引导出来的。因此论文不声称创造了 teacher 所不具备的能力只声称能够将该能力摊销到一个远小得多的开放权重模型中。这意味着DataClaw0的数据构建阶段仍然依赖专有模型虽然这一成本被一次性支付并摊销但并未完全消除。未来方向是用“执行反馈”execution feedback代替 teacher 模仿作为训练信号以放松对专有标注器的依赖。泛化范围有限。论文只覆盖了五个领域与对应的 schema 家族。虽然数据贫乏域与 held-out 域的实验证明了一定的跨域迁移能力但论文不声称泛化到医疗、工业、科学发现等未探索的多模态域。18B 的容量阈值本身是否随领域数量、领域异质性、输出 schema 复杂度变化也是一个开放问题。容量阈值刻画粗糙。三个骨干规模4B、9B、27B定位了交叉点的大致位置但没有刻画阈值的形状阈值是尖锐的还是平滑的在不同领域组合下是否移动是否有其他因素如训练数据量、RL 阶段时长能提前触发正迁移论文没有提供答案。评估的主观性与验证的规则依赖。DataClaw0-Intent的模糊意图评估依赖用户研究评分者来自实验室内部且 Krippendorff’sα 0.71 \alpha0.71α0.71仅支持指示性解读。与此同时推理管线的接地验证仍依赖硬规则、事实锚点与量化指标缺乏完全端到端学习的验证器。预处理阶段的长视频切分依赖基于规则的脚本论文计划未来替换为长视频理解模型以自适应识别事件边界。匹配数据比较的剩余不确定性。虽然匹配数据比较有效分离了“数据量”与“跨域迁移”两个因素但联合模型与专家模型在优化目标上仍有差异联合模型必须同时满足多个域的 schema这本身可能施加一种“结构正则化”。论文的实验无法完全区分“跨域迁移带来的知识共享”与“多任务训练带来的隐式正则化”各自贡献了多少。七、总结 / ConclusionDataClaw0的核心贡献在于将“原始多模态流 → 训练数据”的转换从重复支付的工程劳动转变为一次学习、处处复用的模型能力。论文用严谨的规模实验回答了“五个异构域是否应该共享一个模型”这一问题答案是取决于容量。约 18B 参数是一个经验性的分水岭——低于它域间竞争主导分域专家是更优的工程选择高于它跨域迁移主导联合模型既更准确又更便宜。匹配数据比较证明了迁移而非数据量是反转的原因数据贫乏域收益最大、held-out 域恢复 59% 的域内性能、以及下游三项任务对同一排序的复现构成了一致的证据链。这一工作对多模态数据工程有两点启示。第一数据裁剪确实可以被训练成一个专门能力而且该能力可以蒸馏到远小于 teacher 的开放权重模型中显著降低数据生产的边际成本。第二多任务数据生产模型的架构选择不应被视为固定的设计偏好而应被视为关于模型容量的经验事实——在不同规模下正确的答案可能正好相反。论文同时报告了全部三个规模的完整结果而不是只展示最好看的配置这种诚实为后续研究提供了可靠的参照基准。原文摘要:Raw multimodal streams are abundant but noisy, redundant, and unaligned with any particular training objective. Turning them into supervision today means either brittle heuristics or repeatedly querying a proprietary vision-language model, a cost that recurs with every new sample. We ask whether this conversion can instead be learned once and reused, and formalise intent-conditioned Data Tailoring: given a raw stream and a high-level intent, a model must return schema-aligned, evidence-grounded training instances. Training DataClaw0 at 4B, 9B and 27B, we find that whether five heterogeneous domains should share one model depends on capacity. A jointly trained model is worse than per-domain experts at the two smaller scales and better at the largest, placing the crossover near 18B parameters. Matched-data comparisons, in which the joint model sees exactly the same data per domain as that domain’s expert, attribute the reversal to cross-domain transfer rather than to data volume: it gains most where a domain is>博客内容为准
返回列表