,LoongRL核心技术从入门到精通,收藏这一篇就够了!)
这篇论文主要探讨了如何让大语言模型在长文本场景下具备更强的逻辑推理能力。通常情况下模型处理长文档更多依赖检索Retrieval而在复杂推理Reasoning上往往表现不足。微软亚洲研究院的研究者们通过一种名为 LoongRL 的强化学习框架尝试填补这一空白。研究的核心在于设计了一套名为 KeyChain 的合成数据形象地说就像是在长文中布置了一场“寻宝游戏”强迫模型在训练过程中学会“规划、检索、推理、反思”的一整套思维链条。这种方法最显著的优势在于极高的性价比模型只需在 16K 的长度上进行训练就能将习得的推理能力泛化到 128K 甚至更长的上下文中。实验结果也相当令人振奋7B 和 14B 参数量的中小模型在应用此方法后在多个长文本推理基准测试中取得了与 GPT-4o、o3-mini 等顶级模型相当的成绩。这项工作不仅证明了小模型在长窗口任务上的潜力也为低成本解决长文本推理问题提供了一个值得借鉴的新范式。第一章引言 (Introduction)现在的“推理模型”Reasoning Models如 OpenAI 的 o1 和 DeepSeek-R1 确实火了一把让大家看到了强化学习RL在激发模型 Chain of Thought (CoT) 方面的巨大潜力。但你有没有发现这些模型“顿悟”的时刻大多发生在短上下文的场景里比如解一道数学题或者写一段代码它们更多依赖的是模型“肚子里”的内隐知识Internal Knowledge。可是真实世界里大量的工作——比如读几百页的法律文档、给庞大的代码库改 Bug——是需要模型盯着外部输入的长文本External Input Contexts来看的。光靠“检索”Retrieval找到信息是不够的还得基于这些信息进行复杂的推理。这就引出了这篇论文的核心痛点我们如何让模型在长达 128K 甚至更长的上下文中不仅能“找到”信息还能像处理短文本一样聪明地“思考”我们先来聊聊背景。现在的 LLM 都在卷上下文长度Context Window动不动就支持 100K、1M 甚至更多。虽然模型能“吃”进去这么多数据但它们真的“消化”了吗作者在开篇就犀利地指出目前的模型在长文本上主要还是在做“检索”Retrieval而不是“推理”Reasoning。作者的思路很清晰既然 RL 在短文本上能通过激发 CoT 带来性能飞跃DeepSeek-R1, OpenAI o1那我们是不是可以用同样的思路通过 RL 去发掘长文本场景下特有的“思维模式”Thinking Patterns想法虽好但落地极难。作者列举了横在面前的三座大山这其实也是目前长文本研究领域的共识痛点数据的“不可能三角”有效的 RL 训练通常依赖 Outcome-based Reward结果奖励来避免 Reward Hacking。这就要求题目必须具备三个苛刻条件•难度够高不能是靠简单检索就能做对的必须触发推理。•依赖长文推理过程必须依赖长输入不能靠模型瞎编。•答案确定必须有标准答案方便验证。现实中这种高质量的“长文本推理题”极度稀缺Extremely Scarce。算力成本的“天价”长文本推理通常需要在接近目标长度的语境下训练。在短文本1K tokens上跑 RL 还可以接受但在 128K tokens 的长度上跑 RL Rollouts那个显存和计算成本Compute and Memory Costs是普通实验室甚至大厂都难以承受的。能力的“跷跷板”就算你有钱有数据只在长文本上训练很容易导致模型“捡了芝麻丢了西瓜”——灾难性遗忘Catastrophic Forgetting把短文本处理能力和通用推理能力给搞丢了。针对上面这些问题作者提出了本文的主角——LoongRL。这是一个数据驱动的 RL 方法核心在于它是怎么构造数据的。作者提出了一个非常有意思的数据合成方法叫 KeyChain关键链。此外为了防止 RL 里的 Reward Hacking模型刷分作者还设计了一个 Rule-based Answer Verifier基于规则的答案验证器采用 two-way substring exact match双向子串精确匹配这比单纯的字符串匹配更鲁棒能处理 free-form自由格式的回答。在 KeyChain 数据上跑完 RL 后作者观测到了一个非常漂亮的现象——模型涌现出了一种特定的思维模式Emergent Pattern作者将其总结为Plan – Retrieve – Reason – Recheck(规划 – 检索 – 推理 – 反思)•Plan先把大问题拆解。•Retrieve去长文里找证据。•Reason基于证据做推断。•Recheck自己检查一遍对不对。更令人兴奋的是这种能力具有极强的泛化性Generalization。虽然训练是在 16K 的长度上进行的但训练出来的模型在 128K 的任务上依然表现出色这就完美解决了前面提到的“算力成本”问题——我们不需要在 128K 上做 RL只要在 16K 上练好“内功”它自己就能应用到更长的场景里。最后看看效果作者在 Qwen2.5-7B 和 14B 上验证了 LoongRL•涨点显著在长文本多跳 QA 任务上准确率分别提升了 23.5% 和 21.1%。•越级挑战LoongRL-14B 最终得分 74.2。这个分数是什么概念它几乎追平了庞然大物 OpenAI o3-mini (74.5) 和 DeepSeek-R1 (74.9)。•全面发展不仅长文本推理强了长文本检索NIAH 测试全过而且短文本能力也没丢通过 Balanced Data Mixing 策略。本章小结第一章主要立论长文本推理 \neq 长文本检索。现有的 RL 方法如 o1在长文本场景下缺位。作者通过 LoongRL 填补了这一空白核心创新在于 KeyChain 数据合成方法它成功地在低成本16K 训练下激发出模型通用的长文本推理模式Plan-Retrieve-Reason-Recheck让小模型14B也能在长窗口推理上硬刚最顶尖的大模型。第二章相关工作 (Related Works)在深入 LoongRL 的技术细节之前我们需要先环顾四周看看这个领域里其他的玩家都在做什么。简单的说现在的 LLM 发展有两条明显的“技能树”一条是推理Reasoning像 o1 和 DeepSeek-R1 那样通过“慢思考”解决复杂问题另一条是长上下文Long Context像 Kimi 或 Claude 那样能读完一整本书。本章的核心议题是这两条技能树目前是割裂的谁能把它们合二为一 也就是实现真正的“长文本推理”。最近大语言模型LLM推理能力的爆发主要归功于高质量的思维链Chain of Thought, CoT。目前获取 CoT 主要有两种流派•蒸馏派Distillation通过更强的教师模型Teacher Model生成数据来教学生模型Yang et al., 2025。•自学派RL / Self-generation通过强化学习让模型自己探索涌现出自我反思Self-reflection的能力Guo et al., 2025。⚠️ 现存问题这些研究绝大多数都集中在短上下文Short-context任务上比如数学题Math和代码生成Code。在这些任务中模型更多依赖的是“内功”训练时记住的知识而不是“眼力”从外部长文中获取信息。虽然有一些工作如 Yen et al., 2024尝试用 Prompting 技术来激发长文推理但这受限于基座模型本身的能力天花板另一些尝试用合成数据进行微调SFT但这往往会引入噪声和偏见。 值得关注的先行者QwenLong-L1作者特别提到了 QwenLong-L1 (Wan et al., 2025)。这是一个值得尊敬的尝试它扩展了 R1-distill-Qwen-32B在长达 60K tokens 的序列上进行了 RL 训练鼓励模型探索长距离的推理路径。但也留下了遗憾它虽然迈出了这一步但并没有解决最核心的问题——如何设计高质量的 RL 训练数据 这正是 LoongRL 想要回答的问题。要训练长文本模型数据是老大难。目前主流的数据合成方法Long-Context Synthetic Data通常比较简单粗暴“注水法”Padding / Document-filling拿现成的短文本问答数据集如 HotpotQA, MuSiQue然后在里面塞进去一大堆无关的文档Irrelevant Documents。作者认为现有的合成数据虽然提升了长度但在生成高质量、高挑战性High-quality, Challenging的训练数据方面依然捉襟见肘。本章小结本章梳理了长文本推理的研究现状。虽然 RL 在短文本推理上已经取得了巨大成功如 DeepSeek-R1但在长文本领域的应用还处于起步阶段。现有的数据合成方法大多只是简单地增加无关文档“物理加长”而未能提供足够的逻辑挑战“化学增强”。这为 LoongRL 的提出——特别是其核心的 KeyChain 数据构造方法——提供了完美的切入点。第三章方法论 (Methodology)这一章是整篇论文的“灵魂”。作者到底用了什么魔法让模型在 16K 的训练长度下就能学会 128K 的推理能力答案就在于两个核心组件一个是精心设计的数据构造方法 KeyChain另一个是适配长文本的强化学习策略。核心思想其实非常直观甚至有点像是在设计一个“寻宝游戏”。作者并没有堆砌复杂的数学模型而是通过巧妙的数据工程Data Engineering和务实的奖励设计Reward Design解决了长文本 RL 训练难、贵、不稳定的问题。3.1. KeyChain 数据构造给模型设计个“寻宝游戏”还记得我们在引言中提到的“不可能三角”吗我们需要既难、又依赖长文、还有标准答案的数据。作者提出的解法叫做 KeyChain (关键链)。核心理念把问题“藏”起来普通的问答QA是直接把问题扔给模型“请问文章里提到的小明今年几岁”而 KeyChain 的逻辑是我不直接问你问题。我给你一堆线索你要自己顺藤摸瓜找到真正的问题然后再回答。具体是怎么造出来的Step-by-Step作者制定了三条原则真实性 (Reliability基于真实 QA 数据)数据源必须来自真实世界的问答如 HotpotQA, MuSiQue以防止合成数据常见的幻觉问题。全长依赖 (Full Context Dependency必须读完全文)解题过程必须依赖对长上下文的完整理解而不是靠模型内部知识Internal Knowledge或简单的直接检索Direct Retrieval。挑战性 (Challenge逼出推理能力)难度必须足够高不能让模型一眼看穿这样才能在 RL 训练中提供足够的梯度信号。整个构造过程就像是在“加密”一个普通的问题详见原文 Figure 2Step 0: 种子数据筛选 (Seed Dataset Curation)不是所有的问答都适合拿来训练。作者从 HotpotQA, MuSiQue, 2WikiMultiHopQA 中选取了 277K 个原始问答对o L _ i , o q _ i , o a _ i {oL\_i, oq\_i, oa\_i}oL_i,oq_i,oa_i。•筛选策略使用 Qwen2.5-32B-Instruct 对这些题进行测试每个题答 8 次。•去两头留中间剔除掉那些全对Pass rate1太简单或全错Pass rate0太难或有错的题目只保留适中难度的 72K 条数据。Step 1: 上下文“注水” (Context Extension)为了模拟真实世界的长文档往往包含大量无关信息作者将原始的短上下文 oL_i 扩展到 16K tokens。•干扰项来源为了保证干扰的真实性作者从那 200K 个被剔除的问答任务中抽取文档作为干扰项Distractors。•严谨性确保干扰文档与原始文档没有任何重叠纯粹是为了增加检索难度。Step 2: 埋藏“关键链” (KeyChain Insertion)这是最精彩的一步。作者在长文中插入了一系列 Key-Value 键值对形成“链条”。•链条结构K e y t o V a l u e ( N e x t K e y ) Key to Value (Next Key)KeytoValue(NextKey)。每个 Key 都是一个 32 位的 UUID 字符串由 0-9 和 A-F 随机组成例如 7a0f9ecc…确保全局唯一且无法通过语义猜测。•真假链条◦真链条 (Target Chain)沿着线索走到底Value 会指向原始问题 (Original Question)o q _ i oq\_ioq_i。◦假链条 (Distractor Chains)文中还混入了大量干扰链条它们最终指向的是从其他数据集随机抽取的干扰问题 (Distractor Questions)。◦随机打散这些 Key-Value 对被打散并随机插入到 16K 的文档中模型必须像拼图一样把它们找出来。Step 3: 提出新问题 (New Question Construction)原来的问题 oq_i 已经被藏在链条尽头了。现在作者给模型一个新的指令q _ i q\_iq_i“请找到从 [Start UUID] 开始的链条所隐藏的问题并回答它。”3. 为什么这样设计有效通过这种设计模型面对的不再是一个简单的 QA 任务而是一个被迫的 多阶段推理过程定位 (Localize)首先在 16K 的大海中找到起始 Key。追踪 (Trace)顺着 UUID 一步步跳转Multi-hop直到解码出真正的问题。注意如果模型偷懒随便找个问题回答很可能会撞上那堆“干扰问题”而导致任务失败。推理 (Reason)拿到真正的问题后结合原始文档进行长文本推理。这就逼迫模型不能偷懒必须在长文中进行复杂的逻辑游走。4. 涌现的长文本推理模式 (Emergent Long-Context Reasoning Patterns)原文中特别提到了一个令人惊讶的发现使用 KeyChain 数据进行强化学习训练能让模型涌现出类似人类的长文本推理模式 (Emergent, human-like long-context reasoning patterns)。正如原文 Fig. 1(a) 所示面对一个长文本 QA 任务模型表现出了非常结构化的思考过程•制定计划 (Explicit Plan)首先生成一个明确的计划将大问题分解为子问题和子步骤。•分步检索 (Retrieve)为每一步检索相关信息。•主动反思 (Actively Re-check)在不确定时会主动重新检查检索到的内容然后再继续。这种 Plan-Retrieve-Reason-Recheck 的循环带来了高度逻辑化和可靠的解决方案。此外这种推理模式甚至改进了传统的长文本检索任务。在 Appendix A.5 的 RULER vt benchmark 案例中模型不再像传统检索那样直接跳到答案而是进行一步步、人类可读的检索 (Step-by-step, human-readable retrieval)逐步定位正确答案。核心亮点从 16K 到 128K 的泛化最重要的一点是这种在短上下文 (16K tokens) 上学到的“规划-检索-推理-反思”行为能够泛化到更长的上下文 (up to 128K tokens)。这意味着我们可以在 16K 序列上训练同时保持强大的超长上下文性能极大地体现了 KeyChain RL 方法的鲁棒性和可扩展性。3.2. 长文本强化学习如何低成本训练有了数据接下来就是怎么练Training。长文本 RL 训练非常昂贵作者在这里做了一系列极具性价比的工程决策。3.2.1 算法选型GRPO作者选择了 Group Relative Policy Optimization (GRPO)。熟悉 DeepSeek-R1 的朋友对这个词肯定不陌生。相比于传统的 PPOGRPO 省去了 Value ModelCritic直接通过一组采样Group Sampling来计算优势Advantage这大大节省了显存。目标函数公式如下这里有一个细节作者设置了很小的 KL 惩罚b e t a 0.001 beta 0.001beta0.001并且移除了熵正则项Entropy Loss。注意通常熵正则项是为了鼓励探索但在长文本场景下它容易导致熵不可控地增长导致训练不稳定。去掉它是一个根据实践得出的重要 trick。3.2.2 奖励设计拒绝 LLM-as-a-judge怎么给模型的回答打分•数学题容易答案唯一。•长文问答难答案是开放的Free-form。通常的做法是用另一个 LLM 当裁判LLM-as-a-judge但这对长文本来说太奢侈了——你训练一个 128K 的模型还得跑一个 128K 的裁判模型作者提出了一个朴实无华但极其有效的 Rule-based Reward基于规则的奖励格式约束强行要求模型把答案写在 \boxed{} 里。双向子串精确匹配 (Two-way substring exact match)不要求 100% 一模一样。只要•预测答案 \subseteq 标准答案•或者 标准答案 \subseteq 预测答案就算对 思考这个设计非常聪明。它容忍了模型多说几个字或者少说几个字只要核心信息对上了就行。这在保证了评估效率计算极快的同时避免了传统 Exact Match 过于死板的问题。3.2.3 训练配方混合数据与三阶段策略 (Training Recipe)如果说 KeyChain 是“食材”GRPO 是“炉灶”那么这一节就是具体的“烹饪菜谱”。作者的目标很明确既要练成长文本推理的“绝世武功”又不能丢了短文本的基础能力General Abilities。为此作者制定了两条核心策略混合数据集 (Data Mixing) 和 三阶段训练 (Multi-Stage Training)。混合数据集营养均衡不偏科为了防止模型练了长文本就忘了短文本灾难性遗忘作者构建了一个包含四类数据的“营养套餐”数据类型数量长度范围难度作用 (Role)KeyChain Data7,500~16KHard主菜。包含 HotpotQA, MuSiQue 等数据集的 KeyChain 变体。专门用来逼出“Plan-Retrieve-Reason”的思维模式。Medium QA7,500~12K-16KMedium副菜。标准的多跳 QA。对于像 7B 这样的小模型来说KeyChain 太难了需要这类中等难度题目过渡一下。Needle Retrieval1,024~16KVaries维生素。纯粹的“大海捞针”任务。保持模型在长文中精准定位信息的能力。Math Data5,0001KMixed甜点。短文本数学题DAPO MATH。防止模型变成“只会读长文的傻子”保持通用的逻辑推理能力。关键决策作者特意选择在 16K 的长度上进行训练而不是直接上 128K。这是一个极其务实的 trade-off用 16K 的成本练出逻辑然后泛化到 128K。 事实证明这完全可行。三阶段训练循序渐进专攻错题一口吃不成胖子作者设计了一个三阶段的课程表Curriculum•阶段 0热身 (Warm-up)◦内容除了 KeyChain 以外的所有数据。◦目的先让模型把检索Retrieval和基础推理练熟。如果一上来就给 7B 模型看 KeyChain 这种“天书”模型可能会直接崩盘Optimization instability。◦注14B 模型底子好直接跳过此阶段。•阶段 I进阶 (KeyChain Augmentation)◦内容加入 KeyChain 数据。◦目的正式上强度。逼迫模型学会规划、检索、整合证据链。•阶段 II攻坚 (Difficulty-focused Training)◦策略“错题本”策略。◦做法对每个问题生成 8 个回答Rollouts。▪如果 8 个全对 \rightarrow 简单题扔掉不练。▪如果有错 \rightarrow 难题保留下来重点练。◦效果这样筛选下来只剩下 30%-40% 的高难度数据。这不仅节省了计算资源还避免了模型在已经会的题目上“过拟合”Over-fitting。训练参数 (Training Setup)对于技术党这里还有一些硬核参数供参考•显卡7B 模型用了 16 张 A10014B 模型用了 8 张 MI300X。•Rollout 配置Temperature 0.6, Top-p 0.95。•学习率1e-6。本章小结第三章详细阐述了 LoongRL 的核心方法论可以概括为数据 算法 训练配方三位一体•KeyChain 数据构造通过改写-切分-打散-拼接四步法将传统 QA 数据集改造成需要多跳推理的长文本挑战。这是 LoongRL 能够激发模型Plan-Retrieve-Reason思维模式的关键。•GRPO 强化学习算法采用 Group Relative Policy Optimization通过组内排名奖励而非绝对分数来引导模型学习。配合巧妙的基于规则的奖励函数双向子串匹配既高效又准确。•混合数据与三阶段训练在 16K 长度上训练混合 KeyChain、Needle、Math 等多类数据通过热身-进阶-攻坚三阶段课程式学习既练就了长文本推理能力又保持了短文本的通用能力。核心洞察LoongRL 的成功不是靠暴力堆数据或盲目拉长上下文而是通过精心设计的数据增强和高效的强化学习让模型学会了一种可泛化的推理范式。这种范式在 16K 上训练却能无缝迁移到 128K 甚至更长的上下文中。第四章实验 (Experiments)这一章是 LoongRL 的“验金石”。作者不仅要证明这个方法“有效”能做长文推理还要证明它“高效”用小模型打败大模型更要证明它“鲁棒”长文强了短文也没变弱。让我们看看 LoongRL 是如何在 Qwen2.5 的基础上上演一场“以小博大”的精彩好戏。4.1. 实验设置角斗场与参赛者 (Setup)首先我们来看看这场“比武招亲”的擂台设置。1. 参赛选手 (Models)作者选取了两个不同量级的模型作为基座Base Model•Qwen2.5-7B-Instruct轻量级选手。•Qwen2.5-14B-Instruct中量级选手。这也暗示了作者的野心如果能在 7B/14B 这种尺寸上跑通长文本推理那其实际应用价值将远超那些 70B 的巨无霸。2. 强劲对手 (Baselines)为了证明含金量作者找来的对比对象个个都是“狠角色”•顶级闭源模型OpenAI o3-mini, GPT-4o。•顶级开源推理模型DeepSeek-R1, QwQ-32B。•长文本竞品QwenLong-L1-32B, R1-Distill-Qwen 系列。3. 训练细节 (Training Details)•算法GRPO (Group Relative Policy Optimization)。•上下文长度16K敲黑板训练只用了 16K但测试要测到 128K。•计算资源◦7B 模型16 张 A100 GPU。◦14B 模型8 张 MI300X GPU。观察这个计算资源相对来说是非常亲民的。相比于动辄几千张卡预训练或者几百张卡做长文本微调LoongRL 的训练成本可以说非常低。4.2. 核心战绩以小博大 (Main Results)实验结果可以说是全方位的胜利作者总结了三个维度的表现。1. 长文本推理越级挑战 (Competitive at smaller scale)这是本论文最核心的指标。数据来自 LongBench 等权威榜单。•惊人的 7BLoongRL-7B 拿到了 72.4 分。◦对比这个分数直接碾压了 QwenLong-L1-32B (70.1)甚至比 R1-Distill-Qwen-32B (65.5) 还要高一大截。◦含义一个 7B 的小模型通过正确的 RL 训练在长文推理上干掉了比它大 4 倍的模型。•强悍的 14BLoongRL-14B 拿到了 74.2 分。◦对比这个分数已经和 DeepSeek-R1 (74.9) 以及 o3-mini (74.5) 处于同一梯队了。◦含义LoongRL 让 14B 模型拥有了媲美顶级闭源模型的长文推理能力。❓ 为什么 R1-Distill 系列表现不佳作者发现直接用 DeepSeek-R1 的数据蒸馏Distillation出来的模型如 R1-Distill-Qwen在长文本任务上表现并不好甚至有退化-17.7%。核心洞察DeepSeek-R1 的训练数据主要集中在短文本推理数学/代码它并没有针对“长文本检索推理”的模式进行优化。 这再次证明了 KeyChain 数据的独特价值。2. 泛化能力举一反三 (Generalize better to long)LoongRL 最让人惊喜的一点是它的泛化性。•训练只看了 16K 长度的文本。•测试在 128K 长度的 RULER 测试中LoongRL-7B 依然保持了 93.4 (16K) - 76.8 (128K) 的高分。•对比作为对比普通的 SFT 模型或者 R1 蒸馏模型随着长度增加性能呈现断崖式下跌Degrade sharply。核心观点这说明模型学到的不是简单的“在第几行找答案”而是一种通用的“Plan-Retrieve-Reason”思维范式。这种范式与文本长度无关因此可以无缝迁移到更长的上下文中。3. 短文本能力不仅没丢反而更强 (Near-lossless short reasoning)做长文本最怕的就是“捡了芝麻丢了西瓜”。但 LoongRL 甚至在短文本上也涨点了•MMLU提升 2.8% (7B)。•MATH保持高水准。这得益于我们在第三章提到的“混合数据策略”Data Mixing让模型在修炼长文内功的同时也没落下基础知识。4.3. 消融实验缺一不可 (Ablation Study)为了证明每个组件都在起作用作者做了详细的消融实验。1. 多阶段 RL 训练维持改进 (Multi-stage RL training sustains improvements)为了探究 LoongRL 如何获得强劲的性能作者展示了 7B 和 14B 模型在三个 RL 阶段的逐步增益。•准确率提升如原文 Fig. 4 (a,b) 所示长文本推理准确率在每个阶段Warm-up - Stage I - Stage II都保持持续增长。•思考变长如原文 Fig. 4 (c,d) 所示平均回答长度Response Length在训练过程中稳步增加。这说明模型在课程学习的引导下正在学会进行越来越深入的思考。这充分证明了多阶段 RL 课程设计的有效性。2. KeyChain 数据真的有用吗作者尝试把 KeyChain 数据换成普通的 Long-context QA 数据。•结果分数从 72.4 掉到了 66.2。•结论普通的 QA 数据只能教模型做简单的阅读理解只有 KeyChain 这种复杂的“寻宝游戏”才能逼出模型深层次的推理规划能力。3. 为什么要用双向子串匹配作者对比了三种奖励计算方式Exact Match (完全匹配)太严格模型少写个标点就判错效果最差。LLM-as-a-judge (用大模型打分)效果不错但太慢太贵。Two-way Substring (双向子串)本文方法。•效果不仅计算飞快而且最终训出来的模型效果最好72.4 分。•结论在 RL 中Reward 的“宽容度”和“准确度”同样重要。 过于苛刻的 Reward 会打击模型的探索积极性。本章小结第四章用扎实的实验数据为 LoongRL 正名。实验结果传递了三个极其积极的信号小模型大有可为7B/14B 模型在长文推理上完全可以挑战 32B 甚至 70B 的模型。RL Distillation在长文本这个特定领域针对性的 RL 训练比盲目蒸馏通用的 CoT 数据更有效。泛化是关键通过 KeyChain 习得的思维模式让模型突破了训练长度的物理限制实现了低成本的长文本能力扩展。第五章结论 (Conclusion)这篇论文提出了 LoongRL这是一种数据驱动的强化学习方法Data-driven Reinforcement Learning Approach专门用于解决长上下文推理Advanced Long-context Reasoning的难题。回顾全篇它的成功建立在一个核心基石之上KeyChain 数据集。❓ 为什么 KeyChain 这么重要作者通过 KeyChain把普通的、模型看一眼就能答对的多跳问答Multi-hop QA强制转化成了高难度任务High-difficulty Tasks。这就像是把“开卷考试”变成了“寻宝游戏”逼迫模型不能只靠“翻书”检索而必须学会“思考”。作者在结论中再次点出了模型在训练过程中涌现出的独特思维模式“Plan - Retrieve - Reason - Recheck”(规划 - 检索 - 推理 - 反思)这不仅仅是一个流程更代表了模型认知能力的质变。它不再是一个简单的“文本匹配器”而变成了一个具备主动规划能力的智能体。这可能是这篇论文最具有工业界价值的一个发现这种涌现出的推理能力具有极强的泛化性Generalizes Remarkably Well。•训练模型仅仅是在 16K token 的上下文长度上训练的。•推理模型却能有效地解决长达 128K tokens 的任务。这意味着我们不需要为了长文本推理去烧那一千倍的显存。只要方法对小窗口里也能练出大智慧。•分数LoongRL-14B 模型在长文本 QA 基准测试中拿到了 74.2 的高分。•对手这个成绩足以让它与 o3-mini 和 DeepSeek-R1 这样的大体量前沿模型Frontier Models分庭抗礼。•无损更重要的是这种长文本能力的提升并没有以牺牲短文本能力为代价。模型成功保留了关键的短上下文推理和检索能力Short-context Reasoning and Retrieval Capabilities。LoongRL 证明了通过构建高质量的合成数据KeyChain配合低成本的 RL 训练我们完全可以在中小参数模型7B/14B上实现顶级的长文本推理能力。这打破了“长文本推理昂贵计算”的刻板印象为未来的 Agent 和长文档分析应用开辟了一条极具性价比的新路。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】