如何速成LLM以伪装成一个AI研究者(8)——Scaling Law,从两阶段训练到mid-train

发布时间:2026/7/26 22:47:03

如何速成LLM以伪装成一个AI研究者(8)——Scaling Law,从两阶段训练到mid-train 往期回顾如何速成LLM以伪装成一个AI研究者1——循环卷积编解码器注意力Transformer如何速成LLM以伪装成一个AI研究者2——Pre-LNKV-Cache优化MoE如何速成LLM以伪装成一个AI研究者3——预训练监督微调强化学习RLHF/DPO如何速成LLM以伪装成一个AI研究者4——PPOGRPODAPOGSPO如何速成LLM以伪装成一个AI研究者5——显存估算显卡选择如何速成LLM以伪装成一个AI研究者6——LoRAAdapterP-tuning量化QLoRA如何速成LLM以伪装成一个AI研究者7——面试八股免责声明作者也是伪装的有错漏属于正常现象欢迎评论指正。本文作者实在懒得手打了基本使用DeepSeek生成。前言Scaling LawLLM 预训练的摩尔定律Scaling Law 是 LLM 预训练中最重要的经验规律之一——它描述了模型性能与计算量C、参数量N、数据量D之间的量化关系。它是一种纯粹的经验公式并不是基于理论推导、拥有明确理论依据的而是对预训练中的一些现象的观察和总结。它为“该用多大模型、喂多少数据”提供了方向性指导。OpenAI Scaling Laws2020Scaling Laws for Neural Language Models 首次系统性地提出模型 loss 与 C、N、D 各自呈幂律关系而与模型结构层数、宽度等关系不大。核心公式L ( x ) L ∞ ( x 0 x ) α L(x) L_{\infty} \left(\frac{x_0}{x}\right)^\alphaL(x)L∞​(xx0​​)α其中x xx可以是 C / N / D 中的任意一个。直观含义想让 loss 线性下降资源需要指数级增加。Chinchilla 定律DeepMind2022Training Compute-Optimal Large Language Models 进一步回答了一个关键问题在固定计算预算下参数和数据如何分配才最优结论训练一个参数较少但数据更多的“小”模型效果优于参数庞大但数据不足的“大”模型。最优配比N ∝ C 0.5 N \propto C^{0.5}N∝C0.5D ∝ C 0.5 D \propto C^{0.5}D∝C0.5——参数和数据应同步增长比例约为1 个参数 : 20 个 Token。Chinchilla 公式L ( N , D ) L ∞ A N α B D β , α ≈ 0.34 , β ≈ 0.28 L(N,D) L_\infty \frac{A}{N^\alpha} \frac{B}{D^\beta},\quad \alpha\approx 0.34,\ \beta\approx 0.28L(N,D)L∞​NαA​DβB​,α≈0.34,β≈0.28实际意义与局限Scaling Law 让我们在训练前就能大致估算最优模型规模避免盲目堆参数。但它也有明显局限它只优化验证集 loss不直接反映推理成本、延迟、下游任务表现等实际需求。随着后训练技术RLHF、DPO 等的发展单纯“堆算力”已不是唯一解如何在有限资源下做更聪明的取舍才是更值得关注的方向。从两阶段训练到mid-trainWhat is mid-train传统模型训练分为 pre-train 和 post-train 两阶段pre-train 在海量通用数据上无监督学习获得语言能力和广泛知识但数据质量参差不齐post-train 则用精标数据做指令微调和对齐提升交互能力但数据量有限、成本高昂。随着模型能力持续提升直接处理长程推理、代码生成等高难任务时从“粗粮”突然跳到“细粮”会导致能力断层。mid-train 正是为填补这一断层而出现——它在 pre-train 之后、post-train 之前用高质量数据做无监督训练平滑过渡。mid-train 的核心理念很简单用更接近 post-train 质量的数据做类似 pre-train 的无监督训练。打个比方pre-train 是小学教基础post-train 是大学专精mid-train 就是承上启下的中学。mid-train从24年开始兴起25年下半年爆发到26年已经从模型训练的“可选项”变成了彻底的“必备项”。mid-train 的规模mid-train 主要依赖两类数据领域专业数据大量引入数学、代码、科学、推理等高质量语料弥补 pre-train 阶段在这些领域的不足大幅提升模型的复杂推理能力。通用回放数据保留一定比例的原始预训练数据防止模型在专业化过程中遗忘基础知识。以 Step 3.5 Flash196B 参数 的公开技术报告为例其三阶段的 token 配比如下Pre-train总计约 17.6T tokens第一阶段 open-domain 预训练 14.6T tokens4k 上下文第二阶段 annealing long-context 共 3T tokens4k → 32k 上下文。Mid-train总计约 750B tokens先做 32k 专业化训练 386B tokens其中 81B21%为预训练回放 token侧重软件工程与工具使用再做 128k long-context 训练 364B tokens保留 10.5B 回放 token并通过合成长程推理数据 自然长文档进一步强化长上下文能力。Post-trainSFT两级管道 SFT仅 30k 条精标数据训练 3 个 epoch。mid-train 的 token 量约为 pre-train 的 1/24但其数据质量与专业化程度远高于 pre-train充分说明 mid-train 已经成为标准三阶段训练流中不可或缺的一环。Why mid-train当前一个显著势头是高质量的 mid-train 正在逐步替代传统 SFT。背后主要驱动有三点数据供给变了Agent 能力成熟使得长轨迹数据可以自动化大规模生成不再依赖昂贵的人工标注SFT 数据的“稀缺性”被打破。长上下文技术成熟YaRN、ABF 等位置编码技术将上下文窗口拓展到几十万甚至百万 token让模型能够在训练中直接处理完整的长程推理链。训练方法突破轨迹分割等方法将超长轨迹切分成有重叠的片段分批训练降低了显存压力使复杂推理链的高效学习成为可能。可以说mid-train 已不再是简单的“过渡阶段”而是提升基模高阶能力、打通长程推理的核心战场。mid-train的不足尽管已经从“可选”变成了模型训练的“必选”mid-train依然面临许多问题评估的滞后性与高成本Mid-train的评估高度依赖后训练Post-training的最终结果这是一种滞后指标。而其高昂的计算成本又使得试错变得不切实际严重阻碍了迭代效率。“黑箱”属性与缺乏可控性现代训练流程缺乏可控性预训练语料不透明导致难以区分最终能力的提升究竟来自哪个阶段。数据合成与分布的挑战如何合成大规模、多样化、高质量的数据依然还是挑战所在。同时静态训练数据与实际动态环境间的分布不匹配也是一大难题

相关新闻