:1M上下文真能“记住“全程吗?多轮对话与长程一致性实测)
Kimi K3 深度测评二1M上下文真能记住全程吗多轮对话与长程一致性实测系列第二弹专攻多轮对话 长上下文。K3 最大的卖点之一就是 1M token 上下文和为长程任务而生的 agent 定位。但它真能在几百轮对话里不跑偏、不遗忘、不乱改设定吗本文给出可复现的测试方法与真实公开数据并附一键脚本。一、为什么多轮/长上下文是 K3 的主场传统 8K–128K 模型在多轮任务里容易① 忘掉早期约束② 角色人设漂移③ 长文档中间失忆lost in the middle。K3 用两件事正面硬刚这个问题1,048,576 token 上下文约等于一次吞下 70–100 万字一本长篇小说或整个中型代码库。KDA 混合线性注意力 Attention Residuals用可检索的历史状态替代逐位置全注意力理论上在超长序列上保持更低的内存与更稳的远程依赖。公开独立评测也印证了这一点AA-LCR长上下文推理75%是被测模型中的最高分BrowseComp 91.2SOTA说明它在长篇大海捞针 多步检索上极稳。二、怎么测才不算自嗨三档测试法我设计了一套三档递进的多轮一致性测试读者可直接用文末脚本跑档位目标关键观测点L1 基础记忆在 30 轮里记住一个暗号/设定第 N 轮是否还能召回初始约束L2 长文档追问塞入一篇 5 万字文档跨 20 轮追问细节是否出现中间失忆、是否张冠李戴L3 长程 agent多轮里逐步改需求加字段、换技术栈是否保持全局一致、是否偷偷回退旧设定评判标准客观可量化召回率 正确回应约束的轮次 / 总轮次漂移率 人设/设定发生非预期改变的轮次 / 总轮次一致性 跨轮答案不自相矛盾的比例三、基于公开数据的预期表现我没有私有实测数据但可以结合已公开能力画像给出合理预期供你跑脚本后对照长文档检索L2鉴于 BrowseComp 91.2 与 AA-LCR 75%预期在 5 万字文档内细节追问表现优秀召回率高、失忆少。长程 agentL3鉴于 AA-Briefcase #2、AutomationBench-AA #1预期多步需求演进稳但需留意幻觉率偏高见下带来的设定编造风险。⚠️ 关键风险提示K3 在 AA-Omniscience 上非幻觉率仅 49%且准确率上升、幻觉率也上升——也就是说它倾向于更努力地编一个看似合理的答案。在多轮里尤其要警惕它会把没记住的约束补成一个新设定。这正是 L3 测试要重点打的。四、一键可复现测试脚本PythonOpenAI SDK 兼容把下面脚本保存为kimi_k3_multiturn.py设置环境变量KIMI_API_KEY后pip install openai即可运行。跑完请记录L1 是否答对技术栈/代号L2 汇总是否标注了正确出处L3自行扩展是否在改需求后仍一致。把你的真实输出贴出来就是一篇带实测数据的博客。五、小结K3 在长上下文维度是真有料的AA-LCR 75% BrowseComp SOTA 背书多轮记性预期优于同档开源模型。但它高幻觉率的特质意味着长程任务里你要多做约束回收校验别完全放任它自由发挥。 数据来源与实测说明重要能力数据来自Artificial Analysis、Moonshot 官方、LMArena等公开渠道2026 年 7 月下旬快照。⚠️ 本文多轮测试结果为方法学设计 公开能力画像推导非本人私有实测文末脚本供读者自行取得真实输出。厂商编码/agent 分数混合不同 harness非严格同口径谨慎看待。不构成任何商业或投资建议。