尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

【NeurIPS 2025】MoEMeta:MoE 元学习,少样本关系学习的混合专家框架|从知识图谱少样本推理视角

【NeurIPS 2025】MoEMeta:MoE 元学习,少样本关系学习的混合专家框架|从知识图谱少样本推理视角 摘要本文解读 NeurIPS 2025 论文《MoEMeta: Mixture-of-Experts Meta Learning for Few-Shot Relational Learning》。该论文提出MoEMeta元学习框架通过融合稀疏混合专家MoE、注意力邻居聚合与任务定制局部适配解决知识图谱少样本关系学习FSRL中「全局共享知识」与「任务专属上下文」难以兼顾的问题其特别之处在于用 32 个专家、top-5 稀疏路由显式建模跨任务共享的关系原型。实验表明 MoEMeta 在 Nell-One、Wiki-One、FB15K-One 三个基准上全面刷新 SOTANell-One 1-shot MRR 达0.322相对次优方法 HiRe 提升11.8%为知识图谱推理与少样本学习提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQMoEMeta 解决什么问题混合专家为什么能提升少样本泛化任务定制局部适配是什么MoEMeta 在哪些数据集上表现如何去掉混合专家会怎样论文是否开源代码参考链接论文基本信息项目内容标题英文MoEMeta: Mixture-of-Experts Meta Learning for Few-Shot Relational Learning标题中文MoE 元学习少样本关系学习的混合专家框架作者Han Wu, Jie Yin机构The University of Sydney · Peking University会议NeurIPS 2025arXivhttps://arxiv.org/abs/2510.23013项目网站无论文未提供官方项目页背景与动机知识图谱KG以三元组 $(h, r, t)$ 编码事实支撑问答、搜索与推荐等应用但真实图谱天然不完整——长尾关系、新兴关系往往只有几个已知三元组。传统 KG 补全方法TransE、TransD、DistMult、ComplEx依赖充足训练数据在小样本场景下严重失效因此少样本关系学习FSRL成为重要方向给定新关系 $r$ 的 $K$ 个支持三元组预测查询三元组中缺失的尾实体。现有 FSRL 方法多基于 MAML 式元学习但存在两个关键局限第一各任务独立学习元知识忽略跨任务共享的关系模式——例如FatherOfPerson与BrotherOf共享「家庭」主题而ColorOf属于物理属性关系并非 i.i.d. 的第二单一全局参数初始化无法针对具体任务做局部适配实体在不同关系下呈现完全不同的侧面如 Elon Musk 既是CeoOf的参与者也是FatherOfPerson的参与者。从论文叙事看作者采用「先树靶、再打靶」的结构先明确指出两个局限再用what to generalize与what to adapt的对仗框架给出方案最后用数字兑现承诺详见附录的叙事分析。MoEMeta 的定位历史上MoE 从 1991 年 Jacobs 的自适应专家混合起步2017 年 Shazeer 的稀疏门控 MoE 解锁大规模训练同一时期 MAML 确立元学习范式、MetaR 将其引入 FSRLMoEMeta 在 2025 年把两条线汇合用稀疏 MoE 建模关系原型用投影做局部适配完成了从通用机器学习到结构化关系学习的技术迁移。研究主线从问题到结论图 4MoEMeta 研究主线流程图——从长尾关系样本稀缺到三基准 SOTAMermaid 流程图。基准/方法设计MoEMeta 的总体框架分三个组件注意力邻居聚合门控加权一跳邻居增强头尾实体表示、MoE 元知识学习32 个专家、每次激活 top-5产出关系原型 $R_{\mathcal{T}_r}$、任务定制局部适配三个投影向量 $p_h$、$p_r$、$p_t$支持集上内循环微调。训练采用双循环结构内循环适配局部参数外循环用查询集损失更新全局参数 $\Phi$。图 1MoEMeta 框架支持集经注意力邻居聚合与稀疏 MoE 得到关系原型再经任务定制投影适配后计算得分与边距损失。与既有方法的差异在于MetaR 简单平均所有支持三元组得到关系表示而 MoEMeta 用稀疏专家子集建模可组合的关系原型RelAdapter 等浅层适配方法不做任务差异建模而 MoEMeta 的投影机制在嵌入层面完成局部适配参数量仅 $O(d)$。分类全景图 5少样本关系学习方法全景分类——度量学习 / 元学习 / KG 嵌入与 MoEMeta 的定位Mermaid 分类图。方法细节① 注意力邻居聚合。对实体 $e$ 的一跳邻居元组 $(r_i, e_i)$先拼接嵌入得到 $c_i r_i \oplus e_i$经线性变换与 ReLU 激活后用 sigmoid 门控 $g_i \sigma(\beta^\top \text{ReLU}(W c_i))$ 加权聚合结果残差加到自身嵌入上头、尾实体独立编码保证表示既含自身信息又含局部结构。② 稀疏 MoE 元知识学习。每个专家 $f_j$ 是两层 MLP隐层 64。对支持三元组 $(h_i, t_i)$门控网络计算 softmax 分数 $s_{i,j}$只保留 top-$N$ 个专家其余置零关系表示为 $\mathbf{r}i \frac{1}{N}\sum{j \in \text{Top}N} g{i,j} f_j(h_i, t_i)$支持集上平均得到关系原型 $R_{\mathcal{T}_r} \frac{1}{K}\sum_i r_i$。稀疏路由迫使专家专业化学习跨任务共享、可组合的关系模式。③ 任务定制局部适配。每个任务维护三个随机初始化的投影向量在支持集上内循环更新$h h (p_h^\top R_{\mathcal{T}r}) \cdot R{\mathcal{T}_r}$$r$、$t$ 同理。打分函数为投影空间中的二范数距离 $|h R - t|_2$配合边距损失$\gamma1$完成适配。Meta-testing 阶段全局参数冻结仅微调局部参数。实现细节嵌入维 100Nell/FB15K、50Wiki邻居上限 50Adam 批量 1,024、学习率 $10^{-3}$单张 P100、5 次随机种子平均。实验设计与结果评测使用三个标准基准指标为 MRR 与 Hits1/5/10全部结果取 5 次随机种子平均并做配对 t 检验$\alpha0.05$数据集关系数实体数三元组数任务数Nell-One35868,545181,10967Wiki-One8224,838,2445,859,240183FB15K-One23714,541281,624119主表对比Nell-One 与 Wiki-One 的 MRR1-shot / 5-shot方法Nell-One MRR1-shotNell-One MRR5-shotWiki-One MRR1-shotWiki-One MRR5-shotMetaR-I0.2500.2610.1930.221GANA0.2360.2450.2600.261HiRe0.2880.3060.3220.371RelAdapter——0.2470.305MoEMeta0.3220.3390.3250.377FB15K-One3-shot上 MoEMeta 的 MRR 为 0.423Hits10 达到 0.651相对次优的 RelAdapter0.405 / 0.575分别提升 4.4% 与 13.2%。门控可视化直观展示了关系原型的有效性图 2门控值分布32 专家相似关系激活相似专家子集模式差异大的关系激活显著不同的专家。图 3MoE 超参敏感度Nell-One 5-shot固定 $N5$ 时 $M32$ 最优固定 $M32$ 时 $N5$ 优于 3 与 10整体稳健。复杂度方面邻居聚合 $O(Knd^2)$、MoE 元知识学习 $O(NKd^2)$、局部适配仅 $O(d)$推理每三元组毫秒级训练开销与 MetaR、RelAdapter 相当Nell-One 训练约 26,277 秒 vs MetaR 22,691 秒换来的却是显著更优的性能。结果对比总结图 6MoEMeta 结果对比总结——三基准上的 MRR 与提升幅度Mermaid 流程图。关键发现全面 SOTANell-One、Wiki-One1/5-shot与 FB15K-One3-shot上 MoEMeta 全部排名第一且多数提升达到统计显著paired t-test$p0.05$。最猛提升在 Hits1Nell-One 1-shot Hits1 达 0.228相对 HiRe 提升 23.9%——把正确尾实体排到首位的能力显著增强。MoE 是最大贡献组件消融显示去掉 MoE 后 Nell-One 1-shot MRR 从 0.322 跌至 0.291-9.6%5-shot 更跌 13.6%。局部适配主攻复杂关系N-N 关系去掉局部适配后 MRR 从 0.404 跌至 0.372下降幅度最大N-1 关系最抗消融0.945 → 0.874。门控可解释相似关系如家庭类激活相似专家不同模式显著分离证明关系原型真实存在。超参稳健$M \in {16,32,64}$、$N \in {3,5,10}$ 扫描中 32/5 最优性能曲线平稳。局限性结构依赖邻居聚合依赖 KG 一跳结构孤立或稀疏实体的表示受限。超参调优专家数 $M$ 与激活数 $N$ 需按数据集选择32/5 最优但非普适。候选集假设评测需给定候选实体集 $C_{h,r}$开放场景下候选构建困难。未结合预训练未利用 LLM 或大规模预训练表示跨域泛化未验证。作者展望将关系原型扩展到更多关系类型与更大规模 KG并结合预训练上下文表示。此外论文的致谢整段被注释、运行时间表标题on Wiki-One and FB15K-One与正文给出的 NELL 训练时间范围不完全对应阅读时需注意。常见问题FAQMoEMeta 解决什么问题少样本关系学习FSRL知识图谱中新关系只有 $K$ 个支持三元组时模型仍需预测缺失的尾实体。MoEMeta 是该任务上的元学习框架。混合专家为什么能提升少样本泛化关系并非独立同分布而是语义聚类、共享可组合模式。MoEMeta 用 32 个专家、top-5 稀疏路由学习跨任务共享的关系原型新关系可借用已有专家组合避免孤立建模导致的过拟合。任务定制局部适配是什么每个任务维护三个投影向量 $p_h$、$p_r$、$p_t$在支持集上内循环微调把嵌入投影到任务专属子空间参数开销仅 $O(d)$与全局关系原型互补。MoEMeta 在哪些数据集上表现如何Nell-One1/5-shotMRR 0.322/0.339Wiki-One1/5-shot0.325/0.377FB15K-One3-shot0.423全面刷新 SOTA。去掉混合专家会怎样消融显示 MRR 在 Nell-One 1-shot 下降 9.6%、5-shot 下降 13.6%是所有组件中影响最大的证明稀疏 MoE 是泛化能力的核心来源。论文是否开源代码论文正文未提供官方代码仓库仅在附录列出基线方法MetaR、FAAN、MetaP、HiRe、GMatching的开源实现链接。参考链接arXiv 摘要页https://arxiv.org/abs/2510.23013NeurIPS 2025 论文页https://neurips.cc/virtual/2025/poster/118111MAML元学习范式根基https://arxiv.org/abs/1703.03400Shazeer et al., Sparsely-Gated Mixture-of-Experts稀疏门控 MoEhttps://arxiv.org/abs/1701.06538Wu et al., Meta-Semantics Augmented FSRLEMNLP 2025一作相关工作https://aclanthology.org/2025.emnlp-main.1569.pdf给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表