ML-Papers-of-the-Week 一周 7 篇 AI 论文速览:3 条主线看懂 2025 年 6 月底的研究热点
【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week
ML-Papers-of-the-Week 是 DAIR.AI 维护的每周精选机器学习论文项目,按年份与周次归档,方便快速检索一周内的重点研究。本文覆盖 2025 年 6 月 23 日至 29 日这一周收录的 7 篇论文,按 3 条主线分组:推理效率、多智能体系统与搜索、垂直领域应用。
| 论文 | 一句话亮点 | 关键数据 |
|---|---|---|
| Mercury(扩散语言模型) | 并行多 token 生成,把代码模型推理做到超高速 | H100 上 1109 / 737 tokens/sec,比速度优化型前沿模型快至 10 倍 |
| MEM1 | 把记忆与推理压进单一内部状态,内存恒定 | 内存减 3.7 倍、推理快 1.78 倍,7B 胜过 14B 基线 |
| Towards AI Search Paradigm | 四个智能体分工 + DAG 规划 + MCP 工具调用 | Master/Planner/Executor/Writer 协作,支持动态重规划 |
| RLT(测试时扩展的强化学习教师) | 教师只负责“讲解”不负责“解题”,学生学得更好 | 7B 教师,训练 125 步、1 个 epoch,胜过 32B+ 蒸馏管道 |
| AlphaGenome | 单碱基分辨率预测最长 100 万碱基对的基因调控效应 | 计算量仅为 Enformer 一半,24/26 项变异效应基准领先 |
| DeepRare | 罕见病诊断的多智能体系统,输出可追溯推理链 | 6401 病例、2919 种罕见病,Recall@1 达 57.18% |
| Claude for Affective Use | 450 万次对话里量化用户的情感支持需求 | 2.9% 对话属情感支持类,拒绝率不足 10% |
图1:本周收录论文相关图表拼贴(数据来源:pics/Week-2.png)
🚀 推理效率:扩散语言模型与恒定内存智能体
这组工作的共同目标只有一个:同样质量的输出,更低的延迟与内存。
🏎️ 扩散语言模型 Mercury 的推理速度
看点:Mercury 是首批把扩散生成作为主线、且面向代码生产场景的大规模 dLLM,并行出词让它以高吞吐跑在现有 LLM 基础设施上。
要解决的问题是传统自回归语言模型逐 token 串行解码带来的吞吐瓶颈:每次只能生成一个 token,生成速度天然受限。
关键做法:用 Transformer 架构改造出的扩散式生成流程,通过粗到精的迭代同时生成多个 token(diffusion language model,dLLM),架构保持与现有 LLM 基础设施兼容,无需改造部署栈。
代表性数据:Mercury Coder Mini 与 Small 在 NVIDIA H100 上分别达到 1109 和 737 tokens/sec,比速度优化型前沿模型快至 10 倍,质量同时持平或更好;HumanEval、MBPP、MultiPL-E 等基准上可对标 Claude 3.5 Haiku 与 Gemini 2.0 Flash Lite;填充中间(FIM,fill-in-the-middle)代码补全上超过 Codestral 2501 和 GPT-4o Mini;Copilot Arena 人类评估中 Coder Mini 以 25ms 延迟取得第二高 Elo 评分。
🧠 MEM1 恒定内存推理框架
为什么值得读:这是少见的用强化学习(RL)训练“记忆整合”能力的框架,直接命中长任务智能体的内存爆炸痛点。
要解决的问题:传统智能体把每轮思考、动作、观察全部追加进上下文,多轮任务中内存持续增长、性能随之衰减。
关键做法:每轮只维护一个共享内部状态 ,新旧信息合并后丢弃过期上下文;用 PPO 风格 RL 端到端训练,配合掩码轨迹(masked trajectory)技巧处理动态上下文更新,无需任何外部记忆模块。
代表性数据:MEM1-7B 在 16 目标多跳问答上超过 Qwen2.5-14B-Instruct,内存占用少 3.7 倍、推理速度快 1.78 倍,且能泛化到超过训练时长的任务;内部状态分析还观察到结构化记忆管理、选择性注意、查询重构等类人策略。
🤖 多智能体系统与搜索:从 DAG 任务规划到“解释式”教学
智能体研究这周出现两条不同路线:一条把复杂搜索拆给多个专职智能体,另一条反过来教小模型怎么当老师。
🧩 DAG 任务规划与多智能体搜索工具调用
一句话亮点:用 Master、Planner、Executor、Writer 四个 LLM 智能体分工协作,把搜索任务变成一张可重规划的任务图。
要解决的问题:传统文档检索或 RAG(检索增强生成)管道处理不了多步推理、需要调外部工具的复杂搜索任务,也缺乏执行失败后的恢复机制。
关键做法:Planner 把查询拆成有向无环图(DAG)子任务,Master 负责监控并支持局部重规划;工具选型通过 MCP(Model Context Protocol,模型上下文协议)服务器抽象 + 动态能力边界完成,按查询语义挑选工具子集,再用 DRAFT 方法迭代优化工具文档;Executor 用 RankGPT 与 TourRank 让结果排序对齐 LLM 偏好而非仅相关度;Writer 经对抗性调优(ATM)抵抗噪声检索。
代表性数据:在复杂信息合成任务上,系统展现出类似人类的分解—调用工具—综合作答流程,最终答案可追溯到中间步骤;执行失败时可触发局部 DAG 重规划而不是整体重来。
🎓 RLT:测试时扩展的强化学习教师模型
一句话亮点:不教模型解题,而是教模型“写讲解”——7B 教师产出的解释比 32B+ 模型蒸馏管道更管用。
要解决的问题:推理模型的 RL 训练长期受稀疏奖励与探索难题拖累,蒸馏大模型又成本高、管线重。
关键做法:RLT(Reinforcement-Learned Teachers)把问题和答案同时给教师模型,训练目标变成生成能让学生模型复现解法的高质量解释;奖励由两项构成:学生能否据此复现正确解法,以及解释本身逻辑是否自洽。
代表性数据:仅 7B 参数的 RLT 训练只需 125 步、1 个 epoch,无需后处理或验证器;其原始解释在 AIME、MATH、GPQA 上超过 DeepSeek R1、QwQ 等 32B+ 蒸馏管道;还能零样本迁移到新领域(如 countdown 算术游戏),产出的蒸馏数据训练出的学生强于直接 RL。
🧬 医疗与基因组:垂直领域的 AI 应用
应用侧两篇工作一个指向基因,一个指向罕见病诊断,共同点是都把“可解释、可追溯”当成硬指标。
🧬 基因调控预测模型 AlphaGenome
看点:在单碱基分辨率下建模最长 100 万个碱基对的 DNA,计算量只要 Enformer 的一半。
要解决的问题:此前基因调控预测模型在序列覆盖长度与预测分辨率之间只能二选一,且非编码区(占基因组 98%)基本无法解释。
关键做法:卷积层与 Transformer 层组合,同时输出基因起止、RNA 表达、剪接、染色质可及性、蛋白结合等多种调控模态;通过对比野生型与突变序列的预测差异来评估单个变异的调控效应。
代表性数据:22/24 项单序列基准、24/26 项变异效应基准领先现有模型;还是首个显式预测 RNA 剪接位点及其表达水平的序列模型,对脊髓性肌萎缩症、囊性纤维化这类剪接相关疾病有直接意义。
🩺 罕见病诊断多智能体系统 DeepRare
一句话亮点:给罕见病诊断生成排序假设之外,还给出每一步都挂得上医学来源的推理链。
要解决的问题:临床 AI 只输出排序结果不够用,医生需要知道每个结论是从哪些表型、哪些变异、哪些文献推出来的。
关键做法:三层 MCP 风格架构——中央 LLM 主机(带记忆)、专职智能体服务器(表型提取、变异优先级排序等)、40 多个工具与网络级医学数据源,多模态输入覆盖文本、HPO 术语与 VCF 文件。
代表性数据:6401 个病例、2919 种罕见病、8 个数据集上,对 1013 种疾病达到 100% 准确率,Recall@1 为 57.18%,HPO 单项评估比 Claude-3.7-Sonnet-thinking 高 23.79 个百分点;109 个全外显子测序病例上 Recall@1 达 70.60%(Exomiser 为 53.20%);180 条诊断推理链的专家评审一致性 95.4%。
💬 Claude 情感支持使用模式研究
为什么值得读:450 万次对话级别的统计,是目前少有的关于 AI 助手情感使用的大规模实证,对 AI 伦理设计有直接参考价值。
要解决的问题:AI 陪伴类用法增长很快,但用户到底在哪些场景寻求情感支持、助手应如何把握安全边界,一直缺乏数据。
关键做法:Anthropic 用匿名化工具 Clio 分析 450 多万次对话,筛出 131k 条有意义的情感类会话(剔除短对话与纯任务型交互),再分类统计使用模式与拒绝行为。
代表性数据:仅 2.9% 的对话属于情感支持类(人际建议、辅导、咨询、陪伴),浪漫/性角色扮演不足 0.1%;Claude 在不足 10% 的情感对话中拒绝请求,主要针对自伤风险、极端节食或专业边界;情感分析显示用户在会话结尾表达的情绪普遍更积极。
📈 横向趋势:这 7 篇放在一起说明了什么
一周内同时出现 10 倍推理提速、恒定内存智能体、多智能体搜索与两篇垂直领域落地工作,说明工程侧的焦点正从“模型能不能做”转向“做得多快、多省、多可追溯”。RLT 与 MEM1 共同指向:7B 级别的模型只要训练目标设计得当,就能逼近更大的模型;垂直领域则把可解释性从加分项变成了准入门槛。
📌 持续跟踪
- 仓库:
git clone https://gitcode.com/GitHub_Trending/ml/ML-Papers-of-the-Week,周度索引见 README.md - 各年论文列表在 years/ 目录(如 years/2025.md),历史论文数据见 research/ml-potw-10232023.csv
- 社区入口:DAIR.AI 官方 Discord
下期将解读 2025 年 6 月 30 日至 7 月 6 日这一周的论文;如果某篇论文你希望展开更细的拆解,欢迎在评论区点名。
【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考