从 GPT-2 到 Kimi K3:22580 倍背后,真正改变的是 AI 的“记忆方式”

发布时间:2026/7/31 5:49:39

从 GPT-2 到 Kimi K3:22580 倍背后,真正改变的是 AI 的“记忆方式” 从 GPT-2 到 Kimi K322580 倍背后真正改变的是 AI 的“记忆方式”原帖《22580: From GPT2 to Kimi3, Explained》可以用一句话概括从 GPT-2 到 Kimi K3大模型真正的进步不只是参数变多而是学会了更高效地保存、修改、遗忘和重新检索信息。一、“22580”究竟是什么意思原帖采用约 1.24 亿参数的 GPT-2 作为基准而 Kimi K3 总参数量为 2.8 万亿2.8 万亿 ÷ 1.24 亿 ≈ 22580所以一个 Kimi K3 的总参数量大约相当于 22580 个小型 GPT-2。但这不代表 Kimi K3 的智力、速度或者效果是 GPT-2 的 22580 倍。Kimi K3 是 MoE 混合专家模型虽然拥有 2.8 万亿总参数但每个 token 实际激活的参数约为 1040 亿。其官方规格为93 层、69 层 KDA、24 层 Gated MLA、896 个路由专家每次选择其中16个另有2个共享专家。MoonshotAI 官方资料因此“22580”更像一个有冲击力的规模对比不是性能倍数。二、GPT-2把全部历史都保存下来GPT-2 使用标准 Softmax Attention。生成一个新词时模型会拿当前的 Query 与前面所有 token 的 Key 进行比较再从 Value 中找出相关信息。这就像写文章时每增加一句话都要重新翻阅前面的所有内容。KV Cache 可以保存已经计算过的 Key 和 Value避免重复计算但它仍有两个问题上下文越长KV Cache 占用的显存越大完整注意力的计算量随序列长度近似平方增长。所以当上下文扩展到几十万甚至一百万 token 时传统注意力会变得非常昂贵。三、Linear Attention把历史压缩到一块“白板”里线性注意力不再保存每个 token 独立的 Key 和 Value而是把历史信息压缩进一个固定大小的状态矩阵。可以把它理解为标准注意力保存整本原始笔记需要时逐页查找线性注意力把笔记不断浓缩到一块固定大小的白板上。这样做的好处是生成新 token 时的状态大小不再随上下文长度持续增长特别适合超长文本。缺点也很明显白板容量有限。内容越写越多不同信息会相互覆盖和干扰模型可能记得大意却丢失精确细节。四、DeltaNet让模型学会“修改记忆”普通线性注意力只是不断往白板上叠加内容旧信息很难被精确修改。DeltaNet 引入了 Delta Rule先用当前 Key 读取旧值比较旧值和准备写入的新值只写入两者之间的差异。这就像数据库中的更新操作不是在旧记录后面无限追加而是定位原记录并进行修改。由此固定大小的状态不再只是一个累加器而变成了可以更新的关联记忆。五、Gated DeltaNet 与 KDA让模型学会遗忘DeltaNet 能修改特定记忆但仍缺少主动清理旧信息的能力。Gated DeltaNet 加入了遗忘门可以让历史状态逐渐衰减。Kimi Delta Attention也就是 KDA又把这种遗忘机制细化到不同通道有些信息可以长期保留有些信息可以快速遗忘有些关联可以被新事实精确覆盖。这相当于模型不但拥有一块白板还拥有了分区域、分优先级的自动擦除机制。六、Kimi K3 为什么仍然保留传统注意力固定状态再聪明也不可能无损保存一百万 token 的全部细节。因此 Kimi K3 没有完全抛弃 Softmax Attention而是采用混合架构69层 KDA负责高速、低成本地维护滚动记忆24层 Gated MLA周期性回到原始上下文中进行更精确的全局检索。可以把它理解为平时看压缩摘要需要核对细节时再翻原始资料。这才是 Kimi K3 架构的关键它不是押注某一种注意力机制而是在“快速记忆”和“精确回查”之间做工程平衡。此前的 Kimi Linear 在特定百万 token 测试环境中报告了最高约6倍解码加速以及最多75%的 KV Cache 降低这些是特定模型、硬件和上下文条件下的“最高值”不能理解成所有任务都会快6倍。Kimi Linear 官方项目七、MoE容量巨大但不是每次全部运行Kimi K3 的2.8万亿参数主要来自 MoE 专家系统。模型面对不同 token 时会调用不同专家。例如代码内容交给更擅长代码的专家组合数学推理调用另一组专家普通语言、视觉或者工具操作又可能选择不同组合。每次只激活16个路由专家和2个共享专家因此它可以拥有巨大的知识容量而不必让2.8万亿参数每次全部参与计算。不过未激活的参数虽然不参与本次运算权重仍然需要保存和分布到大量设备上。即使按理想4bit计算2.8万亿参数的原始权重也约需1.4TB所以它仍不是64GB内存电脑能够本地运行的模型。八、AttnRes不仅向前查 token也向上查“思考过程”传统 Transformer 的残差连接会把前面各层的输出不断相加。模型越来越深后早期有价值的信息可能被大量后续输出稀释。Attention ResidualsAttnRes允许当前层根据输入内容选择性地调用更早层的表示而不是把所有层等权相加。因此Kimi K3 实际上在两个方向上管理记忆KDA和MLA解决“序列方向”的记忆前面哪些 token 值得保留AttnRes解决“网络深度方向”的记忆前面哪一层的理解最值得取回。这相当于模型不仅能翻阅之前看过的资料还能回到自己 earlier 的某一步分析结果。AttnRes 论文九、需要注意的两个技术细节第一FlashAttention 并没有从数学上消除标准注意力的平方复杂度。它主要通过分块计算减少显存读写和中间矩阵占用从而显著提速真正改变序列长度复杂度的是线性注意力一类架构。第二Kimi K3 也不是“纯线性注意力模型”。它仍保留24层 Gated MLA因此长上下文的精确检索能力并未被完全压缩成固定状态。它追求的是混合方案而不是把所有历史都塞进一块有限白板。总结从 GPT-2 到 Kimi K3技术演进可以归纳为三个问题存什么从保存全部 KV转向固定状态和稀疏专家怎么更新从不断叠加转向差分写入和选择性遗忘怎么检索从逐 token 全量查找转向滚动记忆、周期性全局回查和跨层检索。所以Kimi K3 最值得关注的并不是“参数达到 GPT-2 的22580倍”而是它已经从一个单一的 Transformer演变成了一套分层记忆系统日常使用压缩记忆重要时回查原文不同问题调用不同专家必要时还可以返回早期思考层重新取回信息。这可能也是未来大模型架构的重要方向不再寻找一种包打天下的注意力机制而是把快速记忆、精确检索、主动遗忘和稀疏专家组合成一个完整系统。

相关新闻