
一、开篇:线性注意力的"翻身仗"2025 年 10 月,月之暗面(Moonshot AI)——Kimi 智能助手背后的公司——发布了一项引人注目的工作:Kimi Linear。它的核心是一种新的注意力机制——KDA(Kimi Delta Attention),一种带细粒度门控的线性注意力。用 KDA 与少量全注意力层按3:1的比例混合,Kimi Linear 交出了一份让整个领域侧目的成绩单:KV Cache 削减约 75%百万(1M)token 上下文下,解码速度提升约 6 倍更令人惊讶的是:在相同训练配方的公平对比下,质量不降反升——在短上下文、长上下文、强化学习等多种场景下全面超过了全注意力基线这最后一点尤其重要。因为在此之前,线性注意力一直背负着一个"原罪"。线性注意力的"原罪"线性注意力(linear attention)的想法早在 2020 年前后就已出现:去掉注意力中的 softmax,注意力就能改写成一个固定大小的递推状态——训练线性复杂度O(N)O(N)