】G-Memory 论文解读:多智能体三层图记忆,把协作轨迹变成可检索经验|从多智能体记忆架构视角)
摘要本文解读 NeurIPS 2025 Spotlight 论文《G-Memory: Tracing Hierarchical Memory for Multi-Agent Systems》。该论文提出三层图记忆架构 G-Memory通过融合insight graph可泛化洞见、query graph查询与任务状态与interaction graph原子话语构成的协作轨迹把多智能体系统冗长的协作过程沉淀成可检索的经验其特别之处在于——检索沿图双向遍历向上取高层洞见、向下取精简后的协作片段并按每个 agent 的角色分发完全不改动 AutoGen / DyLAN / MacNet 等框架的源码。实验表明在 5 个基准 × 3 个多智能体框架 × 3 个 LLM 骨干上几乎全面领先具身行动最高提升 20.89%、知识问答最高提升 10.12%而整个系统的 token 成本只增加约 140 万为多智能体系统的跨 trial 自我进化提供了一套可直接复用的记忆基础设施。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQG-Memory 到底是什么一句话能说清吗它和 MemoryBank、Voyager 这类记忆方案的本质区别是什么为什么记忆要分三层只留一层不够吗记忆变多了token 成本会不会失控它需要训练吗能不能直接接到我自己的多智能体框架上参数应该怎么选参考链接论文基本信息项目内容标题英文G-Memory: Tracing Hierarchical Memory for Multi-Agent Systems标题中文多智能体系统的层级记忆把协作轨迹组织成三层图作者Guibin Zhang$^{}$, Muxin Fu$^{}$, Guancheng Wan, Miao Yu, Kun Wang$^{\dag}$, Shuicheng Yan$^{\dag}$机构新加坡国立大学 · 同济大学 · UCLA · A*STAR · 南洋理工大学会议NeurIPS 2025arXivarXiv:2506.07398项目网站github.com/bingreeky/GMemory背景与动机大模型驱动的多智能体系统LLM-powered MAS在感知、规划与执行上已经明显超过单智能体AutoGen、DyLAN、MacNet 这类框架把多个角色组织起来用分工与互相纠错换来更强的任务表现。但它们的自我进化能力长期受限于记忆设计论文把这个问题拆成两个病灶。第一是记忆过度简化。MetaGPT、ChatDev、MacNet 等框架的记忆基本停留在 inside-trial 层面跨 trial 时只传递被压缩过的最终产物——比如上一轮的最终答案或执行结果。于是最值钱的信息被丢掉了谁在第几步把谁从错误里拉了回来、哪条协作路径导致了失败。第二是缺少跨 trial 与角色定制。团队里不同 agent 承担不同角色却拿到同一份历史上下文结果是在不同任务上重复同一种协作错误。既有方案各自的局限也很清楚。单智能体记忆Generative Agents 的观察加反思、MemoryBank 的遗忘曲线、Voyager 的技能库、MemGPT 的上下文分页都是围绕「一个智能体与自己的对话」设计的多智能体侧的 MetaGPT-M、ChatDev-M、MacNet-M 要么只做 inside-trial要么只保存历史查询的最终答案而 GPTSwarm、ADAS、AFlow、MaAS 这类自动化 MAS 专注优化拓扑或提示词架构越来越臃肿进化往往还是一次性的不随经验累积。论文的切口来自组织记忆理论organizational memory theory人类组织的知识检索会先命中宽泛的「图式」再逐步细化到具体案例。对应到智能体团队就意味着记忆必须有层级——从抽象可泛化的洞见到细粒度的协作片段——并且要按角色分发。这条思路最终换来可量化的收益具身行动任务最高提升20.89%知识问答任务最高提升10.12%。研究主线从问题到结论基准/方法设计G-Memory 的核心设计是把团队经验组织成三张互相连通的图它们共同覆盖「抽象—具体」的完整谱系。Insight Graph洞见图节点是可泛化的洞见内容及其支撑查询集合超边表示「某条洞见通过某个查询语境化了另一条洞见」。它负责回答「这类任务通常该怎么做、要避开什么陷阱」。Query Graph查询图节点是查询本身、任务状态成功或失败以及该查询对应的协作轨迹边表示查询之间的语义关系。它让检索不再只依赖向量相似度而是可以利用图拓扑。Interaction Graph交互图节点是原子话语包含说话人与内容边表示「这句话被传递并启发了下一句」。它保留了谁在什么时候纠正了谁这类关键细节。三张图不是静态档案而是随每个任务闭环生长任务执行结束后交互层写入这次协作的轨迹查询层新建节点并与「本次检索到的 top-M 历史查询」以及「所用到洞见的支撑查询」连边洞见层则用摘要算子生成新洞见、并回写支撑集。这种设计让记忆的更新完全发生在图结构上不需要任何梯度训练。一个容易忽略的设计动机是上下文预算如果直接把检索到的历史全部塞进提示词既会压垮模型的上下文也会让不同角色的智能体互相干扰。因此 G-Memory 把「检索」和「分配」拆成两步先在图层面筛出多粒度的候选再按角色过滤——这一步是它能同时做到「性能涨、token 不涨」的原因。分类全景方法细节方法分成三个动作粗粒度检索、双向遍历、按角色分配。第一步粗粒度检索加 hop 扩张。新查询先与查询图做 top-k 余弦相似度匹配论文取 k 属于 {1,2}但相似度只看表象于是把命中节点在图上的邻居一并并入候选集形成一跳扩张后的候选集合。论文的敏感性分析显示一跳最好两跳、三跳反而变差——扩张过头会把不相关的洞见带进上下文。第二步双向遍历。向上遍历把候选查询投影到洞见图凡是支撑查询集与候选集合有交集的洞见都被取出。向下遍历先用一个 LLM 打分器评估每个候选历史查询与当前查询的相关性取出 top-M 个再用图稀疏器从这些冗长的轨迹里抽出核心对话子图——哪些轮次交代了关键约束、哪些轮次出现了纠错都由稀疏器判定保留。这样向下拿到的不是日志全文而是可操作的协作片段。第三步按角色分配。分配算子 $\Phi$ 会针对每个智能体的角色与当前查询评估每条洞见、每个稀疏子图的效用与相关性只把相关部分写入该智能体的记忆状态。同一个团队里规划者拿到的是策略型洞见执行者拿到的是操作型片段——这也是「角色定制记忆」落到实处的环节。参数与实现。嵌入函数用 all-MiniLM-L6-v2向下遍历取 top-M 的 M 在 {2,3,4,5} 中选取检索 top-k 的 k 在 {1,2} 中选取。调用时机是「每个查询开始时注入一次记忆」论文也指出实践者可以配置更细粒度的调用。实验设计与结果评测协议。实验覆盖三个领域五个基准知识推理用 HotpotQA 与 FEVER指标为 exact match具身行动用 ALFWorldsuccess rate与 ScienceWorldprogress rate游戏用 AgentBoard 的 PDDLprogress rate。为了把「记忆有用」与「模型更强」「框架更好」区分开实验做了三层交叉AutoGen、DyLAN、MacNet 三个多智能体框架Qwen-2.5-7B、Qwen-2.5-14B 与 GPT-4o-mini 三个骨干对比对象包括 No-memory、Voyager、MemoryBank、Generative Agents、MetaGPT-M、ChatDev-M 与 MacNet-M 七类记忆设计。Qwen 系列用 Ollama 本地部署GPT 系列走 OpenAI 接口。主结果AutoGen Qwen-2.5-14B。基准No-memory最强记忆基线G-Memory提升ALFWorld具身74.6382.0985.8211.19SciWorld具身46.8459.0060.6213.78PDDL游戏44.9254.4655.2410.32HotpotQA知识24.4933.2134.6110.12FEVER知识63.2764.6971.438.16三个框架的平均表现Qwen-2.5-14B。MAS 框架No-memory最强记忆基线G-Memory相对 no-memoryAutoGen50.8356.77MetaGPT-M61.5410.71DyLAN53.0356.57MetaGPT-M59.696.66MacNet49.0854.76Generative57.858.77敏感性与超参。记忆不是「取得越多越好」。hop 扩张方面一跳一致最好或接近最好AutoGen 上 ALFWorld 峰值 85.82%、PDDL 峰值 55.24%两跳时 PDDL 掉到 49.79%原因是向上遍历扩张过头会把无关洞见带进上下文干扰任务特定推理。参数 k 的最优区间是 {1,2}k5 时 ALFWorldAutoGen 掉 7.71%。消融两层都不可替代。把洞见层与交互层分别关掉性能都会下降只保留交互时AutoGen 平均掉 4.47%、DyLAN 掉 3.82%只保留洞见时分别掉 3.95% 与 3.39%。两者同时启用时 PDDL 与 FEVER 都取得最好结果——协作轨迹略比抽象总结更难替代。MAS启用层PDDLFEVERAutoGen仅 interaction54.4663.27AutoGen仅 insight50.0068.77AutoGen两层全开55.2471.43DyLAN仅 interaction48.7561.39DyLAN仅 insight46.6964.31DyLAN两层全开51.1266.66定性案例。在 ALFWorld 中任务「把干净布料放到台面」检索到高度相似的历史查询「把干净鸡蛋放进微波炉」两者都要求物体处于 clean 状态检索到的协作片段里求解智能体先放鸡蛋再清洗而被监督智能体纠正这条「谁纠正了谁」的轨迹直接给出了可操作的操作顺序。在 HotpotQA 的网页检索任务中记忆则提供了「不要被同名人物误导」的洞见避免智能体基于错误实体作答。记忆结构的可视化证据。洞见图在 ALFWorld 上呈现「同类任务密集互联、跨类别稀疏连接」的模式说明洞见既在同类任务内收敛也能跨任务迁移查询图在 ALFWorld、SciWorld 与 PDDL 上都出现相似聚类并在 gpt-4o-mini、Qwen-7B、Qwen-14B 下保持一致说明结构来自任务本身而非某个模型的偏置。结果对比总结关键发现跨域、跨框架、跨骨干几乎全胜。三个 MAS 的平均增益为 AutoGen10.71、DyLAN6.66、MacNet8.77单任务峰值是 MacNet 在 ALFWorld 上的20.89从 58.21 提升到 79.10。通用记忆未必帮多智能体。Voyager 让 AutoGen 在 PDDL 上掉4.17%、MemoryBank 掉1.34%ChatDev-M 让 MacNetSciWorld 掉2.32%——缺少角色定制与高层洞见的记忆甚至会产生负迁移。成本结构是「固定开销、随经验递增的收益」。PDDLAutoGen 上10.32%的性能只多花约1.4e6tokens对比 MetaGPT-M 花 2.2e6 tokens 只换 4.07%。两层记忆缺一不可交互层略更关键。关掉交互层平均掉4.47%AutoGen/3.82%DyLAN关掉洞见层掉3.95%/3.39%。记忆要克制。一跳扩张、k 取 {1,2} 最优k5 时 ALFWorldAutoGen 掉7.71%两跳时 PDDL 掉到49.79%。无需梯度训练即可进化。记忆完全在图结构上累积与连边ALFWorld 的成功率曲线显示它用更少的 trial 就达到更高天花板。局限性任务覆盖有限。作者明确只验证了 3 个领域 5 个基准建议扩展到医学问答等更多样任务留作 future work。调参依赖任务。hop 数与 k 的最优值随任务变化一跳、k 取 {1,2} 最好论文没有给出可直接使用的选择启发式。额外的 LLM 调用。向下遍历依赖 LLM 相关性打分与图稀疏化会带来 token 与延迟开销论文只报系统总量没有把开销拆解到各环节。失败记忆的污染未做评估。失败任务同样以「Failed」状态写入查询图并参与洞见生成但论文没有单独评估错误记忆被检索到时的风险。机制解释偏弱。为什么 hop 扩张过多反而变差只给了「引入无关洞见」的定性解释缺少受控实验佐证。表述层面的小问题。原文存在少量笔误如 intializes、子节标题用词不一致Hierarchy Memory Update、同一句里两次使用同一个序号 (ii)以及一处被注释掉的强声明引用时需要注意。常见问题FAQG-Memory 到底是什么一句话能说清吗把多智能体团队的历史协作过程组织成三张图保存可泛化洞见的 insight graph、保存查询与任务状态的 query graph、保存原子话语轨迹的 interaction graph。新任务到来时先在图里检索再按每个 agent 的角色分发记忆执行结束后三张图一起吸收这次经验。它和 MemoryBank、Voyager 这类记忆方案的本质区别是什么那些方案是为单智能体设计的MemoryBank 用遗忘曲线管理对话记忆Voyager 用技能库存放可执行代码Generative Agents 用记忆流加反思。它们把「智能体自己的经历」当作记忆对象G-Memory 的记忆对象是智能体之间的协作——谁向谁说了什么、哪一步被纠正了并且按角色做差异化分发。为什么记忆要分三层只留一层不够吗分工不同洞见层提供「这类任务通常怎么做、要避开什么坑」的策略性指导交互层提供「这次具体应该按什么顺序操作」的过程性参考。消融实验显示只保留任一层都会掉点——只留交互时 AutoGen 平均掉 4.47%只留洞见时掉 3.95%。记忆变多了token 成本会不会失控不会。论文报的数字是PDDLAutoGen 上性能提升 10.32%整个系统的 token 只多约 1.4e6对比之下 MetaGPT-M 多花 2.2e6 tokens 只换来 4.07%。原因是记忆并不直接把历史拼进提示词而是先在图层面筛选、再按角色分配上下文长度由筛选结果决定而不是由历史长度决定。它需要训练吗能不能直接接到我自己的多智能体框架上不需要训练。记忆的更新完全发生在图结构上写轨迹、连边、生成洞见没有梯度更新。接入方式是在框架外层做插件论文在 AutoGen、DyLAN、MacNet 三个主流框架上都验证过即插即用不需要改框架源码。参数应该怎么选论文的经验是「宁可少取」hop 扩张取一跳初始相似查询数 k 取 1 到 2向下遍历的协作子图数 M 在 2 到 5 之间选取。k5 时 ALFWorldAutoGen 会掉 7.71%两跳扩张时 PDDL 会掉到 49.79%说明靠图扩张补召回比靠多取相似查询更稳。参考链接论文 arXiv 摘要页arXiv:2506.07398代码开源仓库github.com/bingreeky/GMemoryMemoryBank记忆管理基线arXiv:2305.10250Voyager技能库记忆基线arXiv:2305.16291Generative Agents观察加反思记忆arXiv:2304.03442MemGPT上下文分页arXiv:2310.08560智能体记忆综述后续生态arXiv:2512.13564MacNet多智能体协作扩展重要基线arXiv:2406.07155给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件