尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

ML-Papers-of-the-Week 2025年6月 AI 论文全景解读:7 篇突破性论文里的 3 条技术主线

ML-Papers-of-the-Week 2025年6月 AI 论文全景解读:7 篇突破性论文里的 3 条技术主线 ML-Papers-of-the-Week 2025年6月 AI 论文全景解读7 篇突破性论文里的 3 条技术主线【免费下载链接】AI-Papers-of-the-WeekHighlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week70 亿参数的模型在 16 目标多跳问答上打赢了 140 亿的对手内存占用还小了 3.7 倍——这是 ML-Papers-of-the-Week 2025 年 6 月 AI 论文解读里最反直觉的一条。另一条同样扎眼一个扩散语言模型打字速度每秒 1109 个 token。下文按技术方向分组把这周值得读透的 7 篇论文过一遍。全景速览一张表看完 7 篇论文论文简称所属方向一句话定位最硬核的 1 个数字Mercury推理加速并行生成多 token 的扩散语言模型代码生成提速 10 倍1109 tokens/secH100MEM1内存与效率用一个共享内部状态把内存钉死在恒定大小的 RL 智能体内存减少 3.7 倍RLT推理与 RL只教解题思路、不直接解题的 7B 教师模型仅 125 步训练AI Search Paradigm多智能体Master–Planner–Executor–Writer 四角色搜索流水线4 个专职智能体DeepRare多智能体 / 垂直领域MCP 三层架构的罕见病诊断系统Recall1 57.18%AlphaGenome垂直领域单碱基分辨率、覆盖 100 万碱基对的调控预测24/26 基准领先Claude 情感支持研究AI 伦理与安全450 万次对话里情感支持场景的行为画像占比 2.9% 的对话7 篇论文落在四条互不重叠的战线上前两条在算力的账单上做文章中间两条重构系统与强化学习的分工后两条则一头扎进生命科学一头扎进人机关系的灰色地带。速度与内存的军备竞赛扩散生成与恒定内存智能体自回归解码一直是 LLM 成本侧的老大难——一次只能吐一个 token推理开销随输出长度线性膨胀。这周的 7 篇里有两篇分别从生成机制和记忆结构两个位置对它开刀。Mercury1109 tokens/sec 的扩散语言模型并行生成的代价与红利Mercury 系列要解决的老问题是自回归生成把输出长度焊死在速度上限上。它的答案是 Mercury 系列扩散语言模型dLLM即不逐词预测下一个字而是像去噪一样粗到精地并行填出整段文本底层仍是 Transformer 架构多令牌并行生成取代了逐词自回归。效果直接体现在扩散语言模型推理速度上NVIDIA H100 上Mercury Coder Mini 跑到 1109 tokens/secSmall 版本为 737 tokens/sec代码生成速度较传统模型提升 10 倍。质量并没有为速度买单——HumanEval、MBPP 等代码基准上与 Claude 3.5 Haiku、Gemini 2.0 Flash Lite 持平填充中间FIM代码补全场景模型要根据前后两段代码补出中间缺失部分任务上则超越了 Codestral 2501 和 GPT-4o Mini。Copilot Arena 人类评估中Coder Mini 以 25ms 延迟拿到第二高的 Elo 评分。对做代码补全产品的人25ms 这个延迟水平值得写进自己的 benchmark 计划。MEM17B 恒定内存智能体如何赢下 16 目标多跳问答长序列智能体的另一个死结是记忆传统做法把全部历史交互追加进上下文内存随步数无界增长。MEM1 的做法是丢掉过时上下文每个推理步骤只更新一个共享的内部状态IS可以理解成跨步骤携带的一小块记忆压缩态并配合 PPO 风格的 RL 训练PPO一种基于策略梯度的强化学习算法全程不需要外挂内存模块。实验数字很硬70 亿参数的 MEM1 在 16 目标多跳 QA 任务上超过 140 亿参数的 Qwen2.5-14B-Instruct同时内存用量减少 3.7 倍、推理速度提升 1.78 倍。对内部状态的进一步分析还显示MEM1 自发形成了结构化内存管理、选择性注意力和查询重构这几类接近人类策略的行为。同一份算力账单Mercury 压缩的是想多少遍并行生成MEM1 压缩的是记多少东西恒定内存两条路殊途同归。强化学习的新分工RLT 用解释当教鞭测试时扩展test-time scaling是今年的热点但多数做法是把模型堆得更大、蒸馏管道拉得更长。RLT 换了个思路强化学习不一定非得训练解题者。RLT只解释、不解题的 7B 教师模型传统 RL 直接训练解题器时探索阶段极其难搞。RLT 框架Reinforcement-Learned Teachers让模型接收问题 已有解决方案作为输入用 RL 优化它生成的解释目标是让下游学生模型真正学会——两种奖励分别是学生重现解决方案的能力、以及解释本身的逻辑合理性。解释而非解决绕开了探索难题也省掉了后处理环节。结果仅 70 亿参数的 RLT其生成的解释在 AIME、MATH、GPQA 等基准上压过了 320 亿参数以上的蒸馏管道DeepSeek R1、QwQ 一类训练只需 125 步、1 个 epoch且无需后处理。对可解释 AI 来说教得好不好第一次成了可优化的显式目标。多智能体流水线从通用搜索到罕见病诊断单个大模型在多步、重工具调用的任务上已经触顶这周的 2 篇多智能体工作给出了同一个骨架答案按角色拆分用协议层对接工具。Towards AI Search ParadigmMCP 驱动的四角色搜索系统复杂信息合成任务要查、要筛、要排、要写靠单体模型很难稳定完成。这个模块化多智能体搜索系统把流程拆给四个专职角色Master总控、Planner规划、Executor执行、Writer成文。工具接入走 MCPModel-Context Protocol智能体调用外部工具的统一协议层服务器动态选择工具子集形成动态能力边界任务规划用 DAG有向无环图即任务分解后没有环路的结构组织支持执行中动态重规划搜索结果的排序由 LLM 偏好对齐完成具体用 RankGPT 和 TourRank 两种策略Writer 则经过 ATM对抗性训练让模型对含噪声的输入保持稳健调优来抵抗噪声检索。整体在复杂信息合成任务上表现出类人推理能力动态调用外部工具、处理多步骤任务、产出可验证的结果。DeepRare6401 个病例上的 100% 准确率怎么来的罕见病 AI 诊断的难点在于信息散落在三种模态里——自由文本、HPO 术语人类表型术语集临床表型的标准化词表和 VCF 文件基因变异数据格式而临床场景又要求推理链可追溯。DeepRare 同样采用 MCP 架构分三层中央 LLM 主机、专业智能体服务器表型提取、变异优先级排序等、以及 40 医疗工具和网络资源访问。数据面覆盖 2919 种罕见病的 6401 个病例上系统对 1013 种疾病实现 100% 准确率Recall1首位推荐即正确答案的比例57.18%较 Claude-3.7-Sonnet-thinking 提升 23.79%在 HPO基因的多模态输入下109 个全外显子测序病例的 Recall1 达 70.60%超过 Exomiser 工具的 53.20%180 条诊断推理链经专家评审一致性 95.4%。把两篇放在一起看AI Search 展示的是通用信息合成的形态DeepRare 证明同一套 MCP 模块化骨架能扛住高风险垂直领域——通用范式和垂直落地在这批工作里已经共用一个骨架。垂直边界与人机关系从 100 万碱基到 450 万次对话AlphaGenome单碱基分辨率的 100 万碱基对调控预测基因组建模一直有个经典权衡序列窗口拉得越长单碱基分辨率越难保住。谷歌 DeepMind 的 AlphaGenome 用卷积与 Transformer 层结合绕开了这个权衡在单碱基分辨率下预测最长 100 万个 DNA 碱基对的基因调控效果输出覆盖基因起止点、RNA 表达、剪接、染色质可及性和蛋白质结合。两个机制值得点名多模态变异感知——把野生型序列与突变序列直接对比来评估遗传突变的调控效应剪接连接建模——这是首个显式预测 RNA 剪接位置及其表达水平的序列模型。算力上只需 Enformer 的一半计算资源24/26 个变异效应基准测试中领先。对非编码变异解释、罕见病研究和合成生物学来说这是一条此前不存在的路径。Claude 情感支持研究450 万次对话里 2.9% 的真相AI 的情感陪伴使用此前基本停留在个案报道缺一个大规模实证样本。Anthropic 的分析对象是 450 万次 Claude 对话按用途分类后人际建议、辅导、咨询或陪伴类的情感支持对话占 2.9%其中浪漫/性角色扮演不足 0.1%。使用形态比想象中宽从求职、关系导航这类日常指导一直到存在主义反思安全对齐方面仅 10% 的情感对话中 Claude 需要拒绝请求主要涉及伤害风险或专业限制情绪走向上情感分析显示用户会话结束时表达的情绪比开始时更积极。这是负责任的 AI 情感交互设计拿到的首个大规模实证基础支持性和安全性要在同一个分布里同时校准而不是二选一。横向趋势三条贯穿 7 篇论文的主线趋势线支撑证据参数效率取代参数量成为竞争主轴MEM1 的 7B 赢 14B 的 Qwen2.5-14B-InstructRLT 的 7B 赢 320 亿 蒸馏管道MCP 正在成为多智能体系统的默认通信层AI Search Paradigm 与 DeepRare 均基于 MCP 做工具接入与角色拆分延迟与内存从副产物变成一级评价指标Mercury 的 1109 tokens/sec 与 25ms FIM 延迟MEM1 的 1.78 倍提速与 3.7 倍内存下降项目资源指引DAIR.AI 团队维护这个论文库可以整体拉下来离线翻阅git clone https://gitcode.com/GitHub_Trending/ml/ML-Papers-of-the-WeekREADME.md与years/2023–2026按年份和周次组织每周精选SUMMARY.md提供全局概览pics/存每周论文图表research/存ml-potw-10232023.csv这类历史论文数据标题、描述、链接。官方 Discord 社区和 NLP News 周报会跟进每周精选的更新。7 篇论文可以浓缩成一句话速度、内存和协作形态正在被同时重排垂直领域是价值落地的地方。如果你在做代码生成产品Mercury 的 25ms FIM 补全延迟值得本周就跑一遍 benchmark如果你在评估智能体框架先问一句它的内存会不会随步数一起涨。【免费下载链接】AI-Papers-of-the-WeekHighlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表