尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

ARC 得分只差 4.7 个点,推理成本却差 57 倍:150M 参数的 BDH-CQ 把单题成本打到 0.07 美分

ARC 得分只差 4.7 个点,推理成本却差 57 倍:150M 参数的 BDH-CQ 把单题成本打到 0.07 美分 ARC 得分只差 4.7 个点推理成本却差 57 倍150M 参数的 BDH-CQ 把单题成本打到 0.07 美分一道抽象推理题跑一次只要 0.07 美分约等于半厘钱。在这个价位上一个只有 1.5 亿参数的模型拿到了 29.5% 的正确率。作为对照OpenAI 的 GPT-5.6 Luna 用省电模式能答对 34.2%只比它高 4.7 个百分点但单题成本是 4 美分贵了大约 57 倍。也就是说一个参数规模小了几个数量级的模型在 ARC-AGI-1 上差点追平大模型成本却只是零头。这篇论文 8 月中旬出现在 Hugging Face 每日论文上arXiv 编号 2608.09888。研究团队来自 Pathway一家专做后 Transformer 架构的 AI 实验室。BDH-CQ 的名字拆开看前一半来自实验室自研的 BDHDragon Hatchling架构后一半指向它最特别的地方把上下文学习和循环隐空间推理装进同一个系统。它不打一个字草稿也能把一道没见过的推理题解出来。一、先看两个数字ARC-AGI-1 是什么决定了 29.5% 这个分数有多大分量。它全称 Abstraction and Reasoning Corpus是一个专测「从极少示例里现场学新规则」的抽象推理基准。每道题先给几个输入输出的彩色网格示范再给一个待解的网格模型要当场悟出背后的变换规则并应用。它不允许调用任何外部知识也没法靠背题被认为是衡量「举一反三」能力的硬骨头。BDH-CQ 在这套公开评测的 400 道题上用 ARC 榜单通行的 pass2 口径两次尝试里答对一次就算对拿到了 29.5%。跑一道题平均约 0.85 个 H200 GPU 秒按每小时 3 美元的算力价格折算单题成本约 0.0007 美元也就是 0.07 美分。真正刺眼的是把它放进「得分对成本」坐标里看。按 ARC Prize 截至 2026 年 7 月的成本口径GPT-5.6 Luna低推理档得分 34.2%单题 4 美分是 BDH-CQ 的约 57 倍。即便把 OpenAI 在 7 月 30 日对 Luna 公开 API 降价 80% 算进去价差仍然有约 11 倍。论文的表述是这个工作点刷新了 ARC-AGI-1 此前报告的成本精度帕累托前沿在同等或更低成本下没有任何已记录系统能拿到至少这个分数。二、要解决的问题想得越深烧得越贵为什么 ARC 上一直只有大模型玩得起根子在主流推理模型的实现方式。今天的推理模型普遍靠「思维链」思考也就是把推理过程一步步写成文字 token再把这些 token 喂回模型继续推。思路越绕生成的 token 越多成本几乎跟着字数线性涨。ARC 这类题又偏偏要求模型在极短的时间里学会一个新规则很多模型会把思考过程拉得极长来「硬想」单题成本因此居高不下。另一条路是上下文学习把几个示范直接塞进上下文窗口让模型在推理时照着学。可上下文窗口是越长越贵的东西示范一多注意力计算和缓存占用都跟着涨同样不便宜。BDH-CQ 想同时拆掉这两个成本来源既不在推理时吐一堆文字草稿也不把示范无限堆进上下文。它把「记忆新规则」和「多步思考」都搬进一个不产生文字的隐空间让推理成本的增速和思考深度脱钩。这篇论文另一个不寻常的地方是把成本账算到了每一道题。过去 ARC 榜单上的高分大多来自数百亿甚至数千亿参数模型的长思维链单题成本动辄几美分甚至更高BDH-CQ 用实测的硬件时间而不是 API 报价来折算成本把「单题多少钱」摆到台面上这也是「刷新帕累托前沿」这个说法能够成立的前提。成本口径一旦统一模型的架构差异就直接转化成了账单上的数字差。三、方法关键创新不吐字的推理推理期更新的记忆BDH-CQ 的处理流程可以分成三步看。第一步是吸收示范。题目给出的若干示范会被逐条送进模型不断更新一个循环记忆状态。这个状态是固定大小的不随示范数量线性膨胀相当于把示范背后的「规则」压缩进一个紧凑的表示而不是把示范原文全部摊开。第二步是隐空间思考。示范吸收完之后模型在一个高维隐空间工作区里做多轮迭代计算逐步精化对答案的估计。整个过程不把中间推理状态翻译成语言你只会看到输入进去答案出来中间想了几轮、想了什么都不以文字形式出现。第三步是输出。模型把最终隐状态解码成答案网格。有几个设计细节值得单独说。第一推理过程中参数完全冻结不更新任何权重变的只是记忆状态。第二训练时既不给任务标识符也不用评估任务的示范对避免模型靠「认题」作弊。第三训练数据是一套 ARC 风格数据混合包括 ARC-AGI-1 训练集、RE-ARC、ConceptARC、ARC-Heavy、ARC-GEN100K 等再叠加数据增强。和 Transformer 最本质的差别在这里Transformer 的「记忆」是越来越长的 KV 缓存上下文多长缓存就多长BDH-CQ 用的是有界循环关联状态上下文信息被压进固定大小的记忆里。这套设计源自 Pathway 的 BDH 架构用高维正激活和低秩通信替代标准的注意力前向过程。推理深度还能按需调节。论文里报告了一个 effort 旋钮推理轮数从低档提到高档pass2 从 21% 涨到 29.5%成本同步上升。也就是说你可以对简单的题少想几步、对难的题多想几步部署时多了一个精度和成本的自由调节项。四、实验结果一张表看懂差距把 29.5% 放进主流系统里比较最直观的是一张对照表。系统ARC-AGI-1 pass2单题推理成本说明BDH-CQ150M 参数29.5%约 0.07 美分约 0.85 H200 GPU 秒/题GPT-5.6 Luna低推理档34.2%约 4 美分ARC Prize 2026 年 7 月口径两者差距4.7 个百分点约 57 倍Luna 7 月 30 日降价后约 11 倍论文不只报了一个总分还做了一组受控实验看这个小模型到底「学会」了什么。结果有四条它能绑定新的映射关系示范里出现过的颜色、形状对应能被记住并应用它能外推部分学过的算子见过的变换换一种长相出现也能处理示范覆盖度越高准确率越高说明它确实在利用上下文信息当需要把两个算子组合时它的失败是结构化的而不是均匀乱错说明模型的局限有规律可循不是纯粹碰运气。五、意义与局限这篇论文最有冲击力的结论是一个观念层面的反转思考不必等于说话。过去几年AI 推理的能力几乎和「生成长文本思维链」画等号成本也跟着 token 数走。BDH-CQ 用 150M 参数证明把推理搬进隐空间迭代可以让「聪明」和「便宜」不再互斥至少在这个任务上是这样。它对行业也有现实含义。如果这类架构能从 ARC 扩展到大语言模型擅长的领域token 计费式的推理成本模型会被重估不吐字的思考天然没有 token 费。论文也提到团队在 1B 到 600B 参数规模的预训练中观察到与 Transformer 类似的扩展规律说明这条路在更大规模上未必会撞墙计划下一步把架构推向数学推理、ARC-AGI-2 和 ARC-AGI-3。局限同样要讲清楚。第一评测主要落在 ARC-AGI-1 公开 400 题上语言、数学、长文本推理都还没有证明。第二ConceptARC 细分上严格任务准确率和 test-pair 准确率之间有差距意味着同一道规则换一组测试输入时它仍会翻车。第三0.07 美分是折算成本由实测硬件时间乘单价得到不是 API 报价。第四150M 参数是当前主打配置更大的模型还没发布说它能全面挑战前沿大模型为时尚早。还要提醒一句4.7 个百分点的差距是在 ARC-AGI-1 公开 400 题上测出来的论文作者的结论也严格限定在「成本效率」而非「绝对能力」没有宣称小模型已经全面超越大模型。ARC 的分数只是衡量通用智能的一个窗口距离真正的通用能力还很远。对读者来说值得记住的不是「29.5 超过 34.2」这种错误结论而是另一句话当推理不再按字计费AI 应用的成本结构可能会被整个重算。这条路刚开了一个头。
返回列表