AI Papers of the Week|1840 篇周报速览:10 分钟看懂推理加速与内存优化
2026/9/12 3:15:38 网站建设 项目流程

AI Papers of the Week|1840 篇周报速览:10 分钟看懂推理加速与内存优化

【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week

每周几百篇 AI 论文涌出,这个项目把它们做成一张 10 条的周报精选表。四年 1840 篇精选,告诉你哪些方向值得追。读完你将拿到一张周报导航图和一套读关键数字的能力。

30 秒速览

  • 定位:每周精选最重要的机器学习论文,每期一张 10 行表格,每篇附一段要点和原文链接。
  • 维护方:DAIR.AI 团队,按周更新,覆盖 2023 年 1 月到 2026 年 7 月共 184 周。
  • 核心交付物:README.md 是总索引,各年周表存在 years/,合计 1840 条论文条目。
  • 数据资产:📊 research/ml-potw-10232023.csv 收录 420 条论文,含标题、描述、链接、摘要四列,可直接导入表格分析。

git clone https://gitcode.com/GitHub_Trending/ml/ML-Papers-of-the-Week

2025 年 6 月周报里的四条主线

用并行生成把代码提速一个量级

解决自回归(逐个词元生成)模型推理慢的问题。

Mercury 是一族扩散式语言模型(dLLM)。它不逐字往后写,而是先对整段内容做粗填充,再多轮精修到位。相当于先写出整篇文章大纲,再逐段润色,而不是一个字一个字敲。生成过程天然并行,吞吐量因此暴涨。

硬数据:NVIDIA H100 上 Mini 版达到 1109 tokens/sec,Small 版 737 tokens/sec,比速度优化后的前沿模型快最多 10 倍。HumanEval 等代码基准与 Claude 3.5 Haiku 同档,FIM(填充中间补全)任务超过全部参评模型。Copilot Arena 人类评估中,它以 25ms 延迟拿到并列第二的 Elo 分。

用单一内部状态把智能体内存压成常数

解决智能体记忆随对话轮次膨胀、长任务内存爆炸的问题。

传统智能体把每句对话、每个动作都追加到历史里,相当于会议纪要越记越厚。MEM1 每步推理后丢弃旧上下文,把新观察和旧记忆压缩进一个共享内部状态(IS),相当于开会只留结论、不留过程。它用 PPO 风格强化学习端到端训练,不需要任何外部记忆模块。

结果不是"小而妥协":16 目标多跳问答任务上,7B 模型胜过 14B 的 Qwen2.5-14B-Instruct,内存少 3.7 倍,推理快 1.78 倍。内部状态分析还显示它长出了选择性注意、查询重构等类人的记忆管理策略。

把复杂搜索拆给四个分工智能体

解决单一模型难以完成多步检索、综合与作答的问题。

AI Search Paradigm 系统给四个角色分工:Master 拆解问题,Planner 画出一张 DAG(有向无环图,即不含环的任务流程图),Executor 调用工具执行,Writer 合成最终答案。相当于一个项目经理加架构师、开发、写手的四人项目组。MCP(Model Context Protocol)服务器动态挑选一小撮相关工具,避免把几十个工具一次性塞给模型。执行失败时 Master 还能触发局部重规划。

同一条主线还出现在 RLT 里:它不训练模型"解题",而是训练模型"讲解题",奖励来自学生模型能否靠解释复现答案。7B 教师模型的原始解释在 AIME、MATH、GPQA 上超过 32B+ 蒸馏管线(DeepSeek R1、QwQ),训练只需 125 步、1 个 epoch。

把 AI 放进诊所与基因组的可解释诊断

解决垂直领域落地难与 AI 伦理设计缺实证的问题。

DeepRare 是三层 MCP 架构的智能体系统:中央 LLM 主机调度表型提取、变异优先级排序等专业智能体,背后接 40+ 医疗工具。AlphaGenome 以单碱基分辨率建模最长 100 万个 DNA 碱基对,相当于把整段染色体的邻区逐个读一遍,再对照突变前后的调控效应,还是首个显式预测 RNA 剪接位点的序列模型。Anthropic 对 450 万次对话的情感支持研究,则给 AI 情感交互设计提供了首个大规模实证基础。

硬数据:DeepRare 覆盖 6401 例、2919 种罕见病,对 1013 种病达到 100% 准确率,Recall@1 57.18%,比 Claude-3.7-Sonnet-thinking 高 23.79%;109 个全外显子测序病例上 70.60% 对 Exomiser 的 53.20%;180 条诊断推理链的专家评审一致率 95.4%。AlphaGenome 在 24/26 个变异效应基准领先,算力只花 Enformer 的一半。Claude 对话中仅 2.9% 属情感支持类,需要拒绝的比例不足 10%。

横向对比:参数不再是唯一货币

模型核心指标对比对象优势
Mercury Coder Mini1109 tokens/sec(H100)速度优化的前沿模型快最多 10 倍,FIM 第一
MEM1-7B16 目标多跳问答Qwen2.5-14B-Instruct内存少 3.7 倍,推理快 1.78 倍
RLT-7BAIME/MATH/GPQA 蒸馏32B+ 管线(R1、QwQ)原始解释更优,125 步训完
DeepRareRecall@1 57.18%Claude-3.7-Sonnet-thinking高 23.79%(仅 HPO 输入)
AlphaGenome24/26 变异效应基准Enformer一半算力,百万碱基对单碱基分辨率

五行的共同点是"大而不强"的反例。差异的本质在算力花法:并行生成、内存压缩、讲解蒸馏,都在把成本从参数规模挪向架构与流程。只看参数量对比,会错过这一周的主线。

落地指引

  • 如果你是追前沿的研究者:从 README.md 的索引入手,主索引按年组织,点周条目锚点直达;2025 全年周表在 years/2025.md,最新一期在 years/2026.md 顶部。
  • 如果你做数据分析或课题研究:看 research/,CSV 里 420 条历史论文带摘要字段,目录还提供数据集构建与模型训练两个 Colab 笔记本入口。
  • 如果你不想本地维护仓库:团队另有 newsletter 订阅和 Discord 社区,入口都列在 README.md 末尾,克隆后定期拉取更新即可保持同步。

每期一张 10 行的表、每年一档、420 条数据的 CSV,这个项目不追热点,只提供一个稳定的跟踪方式。看到感兴趣的论文,欢迎留言聊聊它的核心想法;也可以等下一期更新,再从周报里挑一组新数字。

【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询