尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Lukasz Kaiser Keynote 深度解读:推理模型从 AlphaGo 到 o 系列的 8 年范式跃迁

Lukasz Kaiser Keynote 深度解读:推理模型从 AlphaGo 到 o 系列的 8 年范式跃迁 摘要Lukasz Kaiser 是 2017 年那篇改变整个 AI 走向的论文《Attention Is All You Need》的共同作者之一,也是 OpenAI GPT-4 与 GPT-5 的核心科学家。2026 奇点智能大会 Keynote,他将带来《推理模型的历史、现在与未来》——这是首次有 Transformer 共同创始人在中国系统性分享推理范式跃迁。本文按 8 年时间线梳理其核心论点与对工程实践的判断。SEO关键词:Lukasz Kaiser / OpenAI 科学家 / Transformer 共同创始人 / 推理模型 / AlphaGo / AlphaZero / o 系列 / 蒙特卡洛树搜索 / 强化学习 / Agentic Scaling / 2026 奇点智能大会一、为什么这场 Keynote 值得专门飞北京听过去 8 年,Lukasz Kaiser 的研究主线几乎贯穿了大模型从「理解语言」到「学会推理」的全部关键节点。理解他的判断,等于理解 OpenAI 内部的推理范式演化逻辑:2017— Transformer 架构(《Attention Is All You Need》),奠定后续所有大模型的基础2018— AlphaZero,用纯强化学习在围棋/国际象棋/将棋上击败所有人类与 Stockfish/Leela2019— 加入 OpenAI,主导 GPT 系列的核心架构工作2020— GPT-3,展示大规模预训练的 Scaling Law2022— InstructGPT、ChatGPT,把人类反馈强化学习(RLHF)推到工业级2024— o1 与 o3,首次让大模型在「思考」这件事上有了可量化的提升路径2025— GPT-5,把推理能力推到「日常工作流」级别2026— 奇点大会 Keynote,系统复盘从 AlphaGo 到 o 系列的范式跃迁这意味着,他不是事后总结者,而是这 8 年推理范式演化的核心设计者。二、Keynote 8 年时间线:从蒙特卡洛到 Agentic Scaling 2017 — Transformer:注意力机制的工业临界点那一年,Lukasz 与 7 位共同作者(包括 Ilya Sutskever、Ashish Vaswani、Noam Shazeer)在 NeurIPS 上发表了《Attention Is All You Need》。这篇论文的核心判断是:RNN 的循环结构不再是必须的,纯注意力机制就能让模型学到长程依赖。工程意义:从此 GPU 并行训练成为可能,模型规模可以无障碍地拉到 10B、100B 级别。 2018 — AlphaZero:搜索 学习 超越人类AlphaZero 是 Lukasz 与 David Silver 团队的关键成果。它用单一神经网络同时承担策略网络与价值网络功能,通过自我对弈蒙特卡洛树搜索(MCTS)生成训练数据,在围棋、国际象棋、将棋三个领域从零开始超越人类世界冠军。关键判断:推理 搜索 学习。模型本身不一定要在参数里记住所有答案,而是要能在推理时主动展开搜索树。 2019-2022 — GPT 系列:预训练 RLHF 的工业范式加入 OpenAI 后,Lukasz 主导了 GPT-3、GPT-4 的核心架构工作。这一阶段的核心范式是:先用海量无监督数据预训练一个超大基座,再用人类反馈强化学习(RLHF)对齐到人类意图。GPT-3 的关键数字:1750 亿参数,在 300B token 上训练;GPT-4 进一步把多模态引入基座。这一阶段的范式是「预训练 Scaling Law」——模型能力随参数、数据、算力的指数级增长而线性增长。 2024 — o 系列:把推理从「直觉」变成「思考」o1 是 OpenAI 推理范式跃迁的关键产品。它在数学竞赛(AIME)、博士级科学问答(GPQA)、编程竞赛(Codeforces)上首次让大模型达到了专家级水平。o1 的核心创新:在推理时引入思维链(CoT) 强化学习。模型不再是一次性输出,而是先「思考」——内部展开大量 token,验证中间步骤,最后才给出答案。这相当于把 AlphaZero 的「搜索学习」范式搬到了语言模型上。关键判断:推理能力不是「涌现」的,而是可以显式训练的。o 系列的训练范式是 RL 过程奖励模型(PRM),而非传统 SFT。 2025 — GPT-5:推理 工具 Agent 的工业整合GPT-5 把推理能力、工具调用、长期记忆、Agent 框架整合到单一模型接口。这相当于把过去分散在不同产品线的能力(ChatGPT、Code Interpreter、Custom GPTs)统一到一个基座上。这一阶段的范式是「Agentic Scaling」——模型能力不再只靠预训练参数堆叠,而是靠推理时算力 工具调用 多步规划的协同。 2026 — Keynote 预判:从单模型到自进化系统结合大会主题「从 Agentic Scaling 到自进化」,可以预判 Lukasz 在本届 Keynote 将给出三个关键判断:推理算力将取代训练算力成为新的 Scaling 维度。o 系列的内部思考 token 已经能达到数十万甚至上百万级别,这意味着一次推理的成本可能超过一次完整训练。过程奖励模型(PRM)将取代结果奖励模型成为主流。原因:结果奖励只对最终答案给信号,而过程奖励能对每一步推理给信号,训练效率高出 5-10 倍。自进化 推理 工具 长期记忆的闭环。模型在生产环境与用户交互的每一步都是训练数据,新版本会从这些数据中自动学习并升级。三、对工程实践的 5 个直接启示重新设计算力预算:训练算力与推理算力的比例正在从 80:20 倒置为 20:80,基础设施团队需要提前规划推理集群规模。过程奖励模型(PRM)是新的训练基础设施:不要再只构建结果评测集,要把每一步推理的中间结果都纳入训练信号。推理时展开 token 数量是关键超参数:o1 在不同任务上展开的 token 数量从 1K 到 100K 不等,工程上需要动态调度。工具调用是第一性公民:让模型「会用工具」比让模型「记住所有知识」重要得多,这是 Agentic Scaling 的工程基础。从演示级到生产级只差一个 Loop:大会主题里的「从 Harness 到 Loop」正是这个意思——把模型嵌入到一个「感知-思考-行动-反馈」的闭环里,而非单次调用。四、参会建议:不要只听 Keynote,要追问 3 个问题Lukasz 的 Keynote 必然高密度,建议在 Day 1 下午「AI 原生软件研发」和「AI 计算平台」分会场继续追问:Q1(给 Coding Agent 团队) 系列在代码生成任务上展开的内部 token 数量是多少?如何控制成本?Q2(给基础设施团队):OpenAI 内部推理集群的 GPU 利用率与 KV Cache 命中率是多少?有什么可复用的工程经验?Q3(给产品团队):GPT-5 整合 Agent 框架后,产品设计会发生什么变化?什么场景下不再需要 Prompt Engineering?五、常见问题 FAQQ1:Lukasz Kaiser 在 OpenAI 主要负责什么?Lukasz Kaiser 是 OpenAI 核心科学家,主导了 GPT-4、GPT-5 的核心架构工作,同时参与 o 系列推理模型的研发。他是 2017 年 Transformer 论文的共同作者,也是 2018 年 AlphaZero 的核心贡献者。Q2:推理模型和传统大模型的核心区别是什么?传统大模型是「一次性直觉输出」——给定 prompt,直接给出答案;推理模型是「先思考后回答」——在内部展开大量 token 进行验证、反思、规划,最后才输出答案。后者在数学、代码、博士级科学问答上显著优于前者。Q3:如何提前了解 Lukasz 的研究主线?推荐关注 3 篇代表作:2017 年《Attention Is All You Need》(Transformer)、2018 年 AlphaZero 论文(《Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm》)、OpenAI o1 系统博客(2024 年 9 月发布)。想现场与 Lukasz Kaiser 等 70 位嘉宾面对面,可前往奇点大会官方渠道免费领取大会 PPT 详细资料。
返回列表