
本文深度解析GPT与Llama的训练流程差异。GPT采用Pretrain、SFT、Reward Model、PPO四阶段Llama在此基础上增加了Rejection Sampling并使用DPO替代PPO。文章通俗讲解了预训练、微调及强化学习如何让AI从“接话茬”进化为“专家”揭示了从GPT到Llama的训练范式演变。一、训练阶段全景图两条不同的成长路线如果把训练一个大模型比作培养一个孩子那么 GPT 和 Llama 的教育路线是不同的GPT 系列OpenAI的四阶段训练阶段英文全称中文名核心任务阶段一Pretrain预训练大量阅读学习语言和知识阶段二SFT监督微调学会回答问题不再接话茬阶段三Reward Model奖励模型学会判断回答好坏阶段四PPO强化学习持续优化越答越好Llama 系列Meta的五阶段训练阶段英文全称中文名核心任务阶段一Pretrain预训练同 GPT阶段二Reward Model奖励模型同 GPT阶段三Rejection Sampling拒绝采样筛选优质回答阶段四SFT监督微调同 GPT阶段五DPO直接偏好优化替代 PPO 的强化学习关键区别GPT 用 PPOProximal Policy Optimization做强化学习Llama 用 DPODirect Preference Optimization替代了 PPOLlama 多了 Rejection Sampling 阶段二、预训练PretrainAI 的九年义务教育2.1 什么是预训练预训练是整个训练过程中最耗时、最烧钱的阶段。你可以把它理解为 AI 的九年义务教育——让模型通过海量阅读掌握人类语言和基础知识。在这个阶段模型会 大量阅读啃下海量的人类文字资料 亦步亦趋地学习一字一字地模仿人类如何使用文字 积累知识学习到最多的人类知识和表达方式2.2 训练数据有多海量说到海量我们先来认识几个数量级单位m百万1,000,000b十亿1,000,000,000t万亿1,000,000,000,000那么实际用了多少呢模型训练数据量相当于多少段落Llama 315 万亿 Tokens37.5 亿个段落Llama 4 Scout40 万亿 Tokens100 亿个段落Llama 4 Maverick22 万亿 Tokens55 亿个段落GPT-33000 亿 Tokens7500 万个段落15 万亿 Tokens 是什么概念 如果按 4000 个 Token 算一个段落那就是 37.5 亿个段落2.3 模型是怎么学习的——段落联合概率这里要引入一个核心概念段落联合概率。简单来说就是让模型能一字不差地生成整个段落的概率。举个例子假设训练数据中有这样一段文字人类简史从动物到上帝模型学习的过程是这样的看到人预测下一个字是类的概率 P(类)看到人类预测下一个字是简的概率 P(简)看到人类简预测下一个字是史的概率 P(史)看到人类简史预测下一个字是:的概率 P(以此类推…所有这些概率的乘积就是段落联合概率。2.4 训练的真相从随机到精通最开始模型内部只是一堆随机初始化的数学公式它什么都不懂预测下一个字的概率低得可怜。但没关系算法工程师会写代码让模型不断调整内部的数学公式目标是提高每一条训练数据的段落联合概率。这就像是公司有 37.5 亿个员工训练数据每个员工都对公司的政策模型参数有意见公司只有一套政策不可能满足所有人但可以通过不断调整提高整体满意度经过几百万轮甚至上千万轮的迭代模型终于从什么都不懂变成了精通人类语言。2.5 预训练有多烧钱模型显卡配置训练时间估算成本Llama 22000 张 A10021 天数亿人民币Llama 3.1 (405B)16000 张 H10054 天数十亿人民币当时一张 H100 显卡市场价约 25 万人民币2.6 预训练结束后的模型有什么问题预训练结束后的模型虽然语言能力很强但有个致命问题——它只会接话茬不会真正回答问题。比如你说“这个训练数据处理起来可真是头疼。”它可能会回答“对啊这个训练数据可太头疼了。”你看它就是在顺着你的话往下说并没有提供任何有价值的信息。这就像是个最佳捧哏而不是问题解决者。所以我们需要进入第二阶段——SFT监督微调。三、SFT监督微调让 AI 学会正经回答问题3.1 先搞懂几个概念在进入 SFT 之前我们需要先理解几个机器学习的基础概念 有监督 vs 无监督有监督Supervised有正确答案标签无监督Unsupervised没有正确答案自己看着学 什么是标签标签就是人类标注的正确答案。举个例子假设你要训练一个模型来自动分类电商评论评论内容标签正确答案“商家送货速度棒棒的”正向评论 ✅“送货速度可太慢了差评”负向评论 ❌“这可太好吃了” vs “味道确实真不错”语义相似 ✅ 自监督Self-Supervised预训练阶段用的就是自监督学习——没有人工标注的答案文本自己就是自己的答案。比如输入“人类简史从动物到”正确答案“上帝”来自原文模型预测后和原文对比看对不对3.2 SFT 解决什么问题SFT 的核心目标是让模型从接话茬变成正经回答问题。具体来说模型要学会 对话任务有来有回地交流 分类任务判断文本属于哪一类 推理任务逻辑分析和推断 代码生成写程序、修 Bug 解析任务提取结构化信息3.3 SFT 的训练数据长什么样SFT 阶段用的都是一问一答的形式问题输入中秋节应该吃什么标准答案标签中秋节应该吃月饼可能还得来点儿大闸蟹。这些问答对最初都是人工撰写的。专业的数据标注工程师会设计各种问题指令撰写高质量的标准答案确保覆盖不同类型的任务3.4 数据量对比预训练 vs SFT阶段数据量说明预训练37.5 亿条Llama 315 万亿 TokensSFT几十万条约是预训练的 1/10000以 GPT-3.5 为例预训练7500 万条数据3000 亿 TokensSFT仅 1.3 万条问答数据虽然 SFT 数据量小但质量要求极高——每一条都是精心设计的教材。四、数据标注背后的真相4.1 人工标注的成本困境你可能好奇这些高质量的训练数据是怎么来的答案是人工标注。但这里有个问题如果要标注几十万条甚至上百万条数据如果每条都请专业的 AI 研究员来标注成本会高得离谱。4.2 OpenAI 的解决方案OpenAI 早期采用了一个极具争议的方案——雇佣肯尼亚的低成本标注工人。成本约 2 美元/天任务对同一个问题的多个回答进行排序哪个更好4.3 为什么用排序而不是打分你可能会问为什么不直接让标注工给回答打分比如 1-10 分而是让他们排序呢原因是打分很难统一标准。200 个标注工每个人的背景、经验、学识不同你觉得 8 分的回答他可能觉得只有 6 分标准极其难统一但排序就简单多了只需要判断 A 比 B 好不需要说 A 是 8 分还是 9 分人类对好坏顺序的一致性远高于具体分数4.4 为什么是 4 个答案一起排序OpenAI 经过大量测试发现方式一次得到的数据量时间成本2 个答案对比1 条A B1 倍4 个答案排序6 条BA, BC, BD, AC, AD, CD2-3 倍效率提升 2-3 倍因为阅读问题的时间成本是固定的如果一次能标 4 个答案而不是 2 个虽然时间多花了一点但产出的数据量却多了 6 倍。4.5 标注数据的局限性肯尼亚标注工虽然便宜但也有明显的局限知识水平有限2 美元/天的工人知识丰富程度肯定偏低做不了复杂任务只能做简单的排序不能写高质量答案现在已不用OpenAI 现在的标注数据越来越复杂已经不用这种方式了这也解释了为什么 SFT 阶段的数据量可以很小——因为高质量的人工标注太贵了。五、Reward Model奖励模型教会 AI 判断好坏5.1 为什么需要奖励模型SFT 之后的模型已经能回答问题了但还有一个问题它不知道自己的回答好不好。就像学生做完作业需要老师批改一样模型也需要一个评分系统来告诉它这个回答好那个回答不好。5.2 奖励模型是怎么训练的训练奖励模型的数据是成对的比较数据就是刚才肯尼亚工人标注的那些对于同一个问题人类标注师会提供一个更好的回答高分一个较差的回答低分模型学习的目标就是学会给好回答打高分给差回答打低分。5.3 举个例子问题“如何学习编程”回答 A较差回答 B更好“多写代码就行了。”“学习编程建议分三步1先学一门入门语言如 Python2跟着教程做项目3阅读优秀开源代码并模仿。坚持练习是关键。”得分2/10得分9/10奖励模型要学会给回答 B 打高分给回答 A 打低分。5.4 奖励模型充当教练角色到了这个阶段我们不再直接训练大模型本身而是训练一个新的模型——奖励模型。这个奖励模型就像是教练运动员大模型做动作教练奖励模型打分运动员根据分数调整自己的动作六、PPO vs DPO两条不同的强化学习路线6.1 什么是强化学习有了奖励模型之后我们就可以用强化学习来进一步优化大模型了。简单来说大模型生成一个回答奖励模型给这个回答打分大模型根据分数调整自己的参数目标是获得更高的分数这就像训练小狗做对了 → 给奖励零食→ 小狗记住这个动作做错了 → 没有奖励 → 小狗调整行为6.2 GPT 的选择PPOOpenAI 使用的是 PPOProximal Policy Optimization这是一个迭代循环的过程SFT 模型 → 训练 Reward Model → PPO 优化 → 回到 Reward Model → ...这个过程会反复进行多轮直到模型表现无法继续提升为止。这个不断循环的过程就是著名的 RLHFReinforcement Learning from Human Feedback基于人类反馈的强化学习。6.3 Llama 的选择DPOMeta 的 Llama 系列没有使用 PPO而是使用了 DPODirect Preference Optimization直接偏好优化。方法全称特点PPOProximal Policy Optimization需要奖励模型训练稳定但复杂DPODirect Preference Optimization不需要奖励模型更简单直接DPO 的优势更简单不需要训练单独的奖励模型更直接直接用人类偏好数据优化策略效果相当在很多任务上效果与 PPO 相当甚至更优6.4 Llama 多出来的 Rejection SamplingLlama 在 Reward Model 和 SFT 之间还多了一个 Rejection Sampling拒绝采样 阶段。这个阶段的作用是让模型对同一个问题生成多个回答用奖励模型给这些回答打分只保留得分最高的回答用这些优质回答来训练 SFT这样可以筛选出最优质的训练数据提高 SFT 的效果。七、GPT vs Llama训练流程对比图GPT-3/4 训练流程Step 1: 收集示范数据训练监督策略SFT ↓ Step 2: 收集对比数据训练奖励模型Reward Model ↓ Step 3: 使用 PPO 针对奖励模型优化策略 ↓ ↺ 循环回到 Step 2直到收敛Llama 训练流程Step 1: 预训练Pretrain ↓ Step 2: 训练奖励模型Reward Model ↓ Step 3: 拒绝采样Rejection Sampling ↓ Step 4: 监督微调SFT ↓ Step 5: 直接偏好优化DPO关键差异总结维度GPT (OpenAI)Llama (Meta)强化学习方法PPODPO奖励模型使用与 PPO 循环迭代用于 Rejection Sampling额外阶段无Rejection Sampling开源性闭源开源八、行业趋势从追赶到并跑8.1 两年追赶之路从 2023 年开始整个行业都在追赶 OpenAI 的 GPT。2023 年初各家都在摸索训练方法五花八门2023 年中开始模仿 GPT 的四阶段训练2024 年下半年基本追上DeepSeek、Qwen、Llama 4 等都采用了类似的训练范式8.2 什么是追上的标准判断一家公司的模型是否追上了 GPT一个很简单的标准就是是否跑通了 RLHF 这套训练模式。如果你能跑通Pretrain → SFT → Reward Model → PPO/DPO基本上就能做出一个和 GPT 相当水平的模型。8.3 Llama 4 的转向有趣的是Llama 3 还坚持用自己的五阶段流程Pretrain → RM → Rejection Sampling → SFT → DPO但到了 Llama 4Meta 也换成了和 GPT 类似的四阶段流程。这说明OpenAI 的这套训练范式已经被行业验证为最优解。九、总结从婴儿到专家的成长之路让我们用一张图来总结整个训练流程十、写在最后训练一个大语言模型就像培养一个孩子预训练是义务教育——大量阅读打基础SFT是专业培训——学会具体技能奖励模型是老师评分——知道什么是对的强化学习是实践反馈——在实际中不断优化整个过程需要 数月时间 数亿甚至数十亿人民币️ 成千上万张顶级显卡 大量工程师和标注师的努力 甚至包括肯尼亚标注工的辛勤劳动所以下次当你和 ChatGPT 对话时不妨想想——这背后是多么庞大的工程啊附录核心概念速查表概念英文含义预训练Pretrain通过海量文本学习语言和知识监督微调SFT (Supervised Fine-Tuning)用问答数据训练模型做任务奖励模型Reward Model给回答打分判断好坏强化学习RL (Reinforcement Learning)通过反馈持续优化RLHFRL from Human Feedback基于人类反馈的强化学习PPOProximal Policy OptimizationOpenAI 用的强化学习算法DPODirect Preference OptimizationMeta 用的强化学习算法拒绝采样Rejection Sampling筛选优质回答的方法段落联合概率-模型生成整个段落的概率对齐Alignment让模型符合人类期望如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取