Radar Trends to Watch:2026年9月(O’Reilly)
每个月中旬,我总会想:"这次的 Trends 应该没什么大新闻。"这次终于说对了。八月大家都在休假吗?还是我自己变得麻木了?虽然这个月发布了不少新模型,但真正称得上"重大突破"的却不多。也许现在该放下对头部厂商之间"谁更强"的执念,转而多关注那些体量更小、开放权重的模型了。因为每个月,最好的"笔记本级"模型(30B 参数及以下)都在与顶尖前沿模型的差距上更进一步——越来越多机构开始意识到,为最新的前沿模型支付高昂的按 token 计费,换来的优势其实相当有限。
一、AI 模型
模型能力与体量正在"脱钩":这里提到的不少模型可以在普通笔记本电脑或单张加速卡上流畅运行,性能却号称接近体量大得多的前沿系统。用小模型工作时很容易产生"我选的是次优方案"的心理落差,但事实未必如此——最大的模型不总是最合适的选择。除了几款重要发布,八月最值得关注的消息或许是 Anthropic 为文本部署了水印技术:如果这套水印机制真的有效,未来我们将能判断一篇文章(比如本文)中哪些段落是 AI 撰写的。
OpenAI 与 Cursor 分道扬镳:OpenAI 宣布,自 2026 年 11 月 12 日起,Cursor 将不再能调用其模型。这背后的直接背景是 Cursor 被 SpaceX 收购,反映出模型厂商与下游应用之间的商业博弈正在加剧。
神秘模型"Ox Alpha":这个匿名模型迅速登上 OpenRouter 使用量榜首。Z.ai 随后确认,它其实是 GLM-5.3-Flash——一个 320B 参数的开放权重模型,号称性能接近 Opus 4.8,并且完全运行在中国自研芯片上。这一"匿名测试—揭晓身份"的营销手法在模型发布中已不罕见,也侧面说明了国产芯片生态的成熟度在提升。
IBM Granite 4.2:这是一款小型开放权重推理模型,专门针对多步骤任务做了调优,提供 3B、8B、30B 三种规格。它再次印证了一个趋势:本地小模型完全可以与前沿模型掰手腕。
Ornith-1.5 的"自我改进"尝试:开发团队声称 Ornith-1.5 在自我改进方面迈出了关键一步——模型能够自主提出新任务、生成解决方案,再通过强化学习把结果反馈到自身训练中,形成一个闭环。这类"自我生成训练数据"的思路值得持续关注,但也需要警惕数据质量与"自我强化偏差"的风险。
DeepSeek-V4-Flash-Vision:为 DeepSeek V4 新增了视觉能力,支持图文混合输入,可以描述图片内容、从图片中提取文字,具备当下主流大模型该有的多模态基本功。
Anthropic 的文本水印:Anthropic 现在会为其模型生成或编辑的所有文本嵌入水印(相关报道)。原理据称是"改变选词时所用的随机性来源",也就是通过对词汇选择做微妙的统计学干预来留下可追溯的痕迹。目前还没有已知的检测工具,但已经出现了号称能去除水印的工具——不过这些工具是否真的有效,尚无定论。这可以说是 AI 内容溯源领域一次颇具实验性的尝试。
新基准 SWE-Bench ProMax:这个新基准(论文地址)专门测试大模型进行"大规模代码重构"的能力,覆盖七种编程语言的真实代码场景,是一个多语言基准。这类基准的出现说明业界评测重心正从"写代码"转向更贴近工程实践的"改代码"。
Qwen3.8-27B:一款小型开放权重模型,号称性能接近 Opus 4.6 max,普通配置的笔记本电脑就能轻松运行(Hugging Face 页面)。
Gemini 3.7 Flash:谷歌发布的新版本,主打编码与调试能力的提升。
GLM-5.3:Z.ai 发布,与 GLM-5.2 相比架构上几乎没有变化,主要区别在于追加了训练后调优(post-training),据称在代码生成和长时间运行任务上表现更好——这也说明"后训练调优"正成为模型迭代的一种低成本高回报手段。
NVIDIA Nemotron 3.5 Lightning:一款开放权重的混合专家(MoE)模型,总参数 30B、激活参数仅 3B(官方博客)。与近期不少模型一样,它专为像 OpenClaw 这样的长时间运行智能体(agent)场景做了优化。
Cactus Compute 的 Needle 2:这是又一款值得关注的小模型(官网),45B 参数,专门为"工具调用、设备操作、结构化信息提取"而设计。最惊人的是它只需要 28 MB 内存,几乎可以塞进任何笔记本、小型设备甚至微控制器里运行。
Meta 的 Muse 系列:Meta 开源了 Muse Glimmer,一款 30B 参数、面向智能体应用、可在消费级硬件上运行的模型;同时发布了 Muse Code(专注代码生成,内置智能体循环和本地事件日志,支持精确回放与重启)以及 Muse Spark 1.2(一款通用模型,性能接近前沿水平,Meta 自称是"迈向前沿的一步")。
二、软件开发
我们通常认为属于"智能体框架/操作平台"的功能——比如生成子智能体、把任务分派给更便宜的模型——正在被直接内置进模型本身。与此同时也存在一股反向潮流:个人和组织正在打造与自身工作环境深度绑定的定制智能体。我们是在走向由头部厂商掌控的"围墙花园",还是会迎来"百花齐放"、各自反映独特工作方式的局面?不要排斥像 Claude Code、Codex 这类大厂工具,但也别把自己锁死在"只有它们可选"的思维里。
DeepSeek 开源 Harness:DeepSeek 开源了自己的智能体框架 Harness,其特色在于"几乎一切都是插件",因此极其灵活——可以搭配多种模型使用,甚至能把任务分派给 Claude Code、Codex 执行。
TrueForge:一个开源智能体框架,兼容任意模型,并附带在生产环境中调试和治理智能体的工具。
Computer History(计算机历史记录):这是 ChatGPT Work 和 Codex 的新功能(相关报道),会记录你使用计算机的操作过程。它和微软颇具争议的 Windows Recall 类似,但依据的是按键点击等操作记录,而非截图;数据存储在本地而非上传给 OpenAI,且默认关闭。这一设计在功能与隐私之间做出了相对谨慎的取舍。
Zed 的 Delta:官方称之为"一个用于与智能体协作编程、并审阅其成果的多人协作环境"(介绍)。它是对 Git/GitHub 模式的一次重新设计,专门为 AI 协作场景打造——其核心洞见在于:围绕代码展开的"对话"本身和代码一样重要,二者都必须被完整记录下来。
企业自建智能体框架成为趋势:越来越多企业开始自己打造智能体框架(harness)。尽管它们仍在使用 Anthropic、OpenAI 等厂商的模型服务,但许多组织发现,定制化框架是把自身工作流程融入 AI 驱动开发流程的有效方式。
Claude Code 的跨会话通信(Cross-Session Messaging):Anthropic 新增了这项功能,让一个智能体可以把自己的操作告知其他智能体,从而减少程序员在多个智能体之间充当"传话人"的负担。
Agent Plugins 标准:这是一套面向智能体扩展的标准,允许通过可复用组件构建插件,目前得到了 OpenAI、微软、Cursor、AWS 的支持,但谷歌和 Anthropic 尚未加入——这也暗示了行业标准化进程中厂商之间的博弈。
OpenAI 的硬件新品——Codex Micro:OpenAI 竟然推出了硬件产品:一个用于远程 AI 工作的小型终端("终端"这个词其实也不太准确),配有 13 个按键、一个旋转编码器、一个触摸传感器、一个摇杆和若干状态指示灯,还暗示支持语音控制(不过文中并未提及麦克风)。它的用途是让用户能够远程操控 Codex 的工作流程。
“好用"不代表"值得做”:一篇关于如何有效使用 AI 的建议文章提出了一个朴素但重要的观点——“仅仅因为某个功能容易实现,并不意味着它值得上线”。
MCP 协议更新:Model Context Protocol(模型上下文协议,简称 MCP)的一次更新,通过让协议变为"无状态",解决了阻碍其被企业广泛采用的一大障碍。
重新发现命令行的魅力:不是从 Linux 环境成长起来的开发者,往往从未真正体会过命令行的乐趣。Atomic Object 推荐了四款终端工具:Ghostty(终端模拟器)、tmux(终端多路复用工具)、lazygit(Git 的可视化终端界面)和 lazydocker(Docker 的可视化终端界面)。不妨挑一个试试——或者四个都试试。
三、基础设施与运营
优化 AI 的使用方式已经发展成了一门独立的学科,有时被称为"Token 经济学"(tokenomics)。它无法与安全问题割裂开来看,而安全恰恰也是近来的热点话题。为智能体设计的一次性容器、把加速卡当作异构资源池来调度的 GPU 调度系统,以及基础设施服务商公开自己如何大规模部署开放模型——这些举措的共同目标,都是让工作负载与硬件精准匹配,不浪费资源、不留安全隐患。AI 的性能表现不只取决于模型本身,更取决于运行它的基础设施;理解"模型是怎么被运行的",将比单纯关注模型参数和跑分更加重要。
Taalas 的"单模型芯片":Taalas 打造了一块直接把 Llama 3.1 8B 烧录进芯片的硬件——所有权重都固化在芯片上,无法切换到其他模型,但运行速度极快。在新模型几乎每天都在发布的当下,这种"单模型专用芯片"是否真的有意义,值得打个问号。
Docker Sandboxes:Docker Sandboxes 是专为安全运行 AI 智能体设计的隔离式一次性容器。
Kubernetes 的 DRA(设备资源分配):DRA 让在异构 GPU 集群上调度任务变得更容易——也就是说,即便集群里的加速卡型号、性能各不相同,调度系统也能更聪明地分配任务。
Cloudflare 公开大规模模型部署经验:Cloudflare 发文介绍了自己是如何大规模运行 Kimi 和 GLM 系列模型的,值得一读——这类"厂商自曝工程细节"的文章通常信息量很大。
WARP(原名 Waste):这是一个推理引擎,唯一目的就是让 Kimi K3 能在笔记本电脑上跑起来。K3 是一个 2.8T 参数、104B 激活参数的超大模型,通常需要一个小型 GPU 集群才能运行;而 WARP 只需要一台 64 GB 内存的 MacBook Pro,外加几个 TB 的磁盘空间。速度确实很慢(大约每秒 0.5 个 token),但——它真的能跑起来。
四、安全
安全工作与 AI 开发是天然绑定的,不是事后补上的一层——不过安全从业者对传统软件说这句话已经好多年了。人工智能既在催生新的攻击手段,也在催生新的防御手段。虽然新型攻击手法总是格外吸人眼球,但这个领域最重大的转变其实发生在防御端:把安全的判断依据从"用户身份"转向"具体行为与资源",这一转变我们也曾在Radar 博客上探讨过。
AI 公司联合呼吁加强网络防御:Anthropic、OpenAI、谷歌等多家 AI 公司联合签署了一份公开信,呼吁将网络攻击防御作为政府的优先事项,并强调政府和各类组织需要协同合作、共同构建防御体系。
Chrome 的账户防盗新机制:Chrome 浏览器采用了设备绑定服务凭证(Device-Bound Service Credentials,简称 DBSC),用来防止会话 Cookie 被盗——这正是账户被盗的关键环节之一。DBSC 会把加密密钥存放在安全隔离区(secure enclave)或其他受信任的存储介质中,使密钥难以被窃取转移。
Python 迎来后量子密码学支持:现在已经出现了支持 ML-KEM(密钥封装机制)和 ML-DSA(数字签名算法)这两种 NIST 标准后量子密码算法的 Python 库——这为应对"量子计算破解现有加密体系"的长期风险提前做了准备。
OpenAI 对 Hugging Face 的误伤事件:Simon Willison 整理发布了一份时间线,还原了 OpenAI 一次针对 Hugging Face 的"无意攻击"事件,内容基于 OpenAI 在 Black Hat 大会上公开的复盘报告;OpenAI 也发布了完整的事故报告。这类"自曝家丑"式的透明复盘,在行业内其实颇为难得。
ChainDrop 供应链攻击:ChainDrop 凭证窃取恶意软件已经感染了 npm(Node 包管理器)上超过 1300 个软件包。这个恶意软件具备自我传播能力,而且被感染的包看起来依然拥有合法的来源证明——这意味着传统的"包来源可信度"验证方式已经不足以防范此类攻击。
OpenAI 开源 Codex Security:OpenAI 开源了 Codex Security,一个借助 ChatGPT 分析代码漏洞的命令行工具及 API。官方文档注明该 CLI 和 API 目前均处于"限量测试"(limited beta)阶段,或许是因为其背后所用的分析模型本身还不够成熟稳定。
Context Collapse 系列研究:这是一个三部分组成的系列文章,探讨了针对 Copilot 记忆功能的上下文投毒攻击,最终演变为针对 Word 的自我传播式攻击。微软参与了这项分析及应对措施的研究——这提示我们,AI 的"长期记忆"功能一旦被恶意利用,攻击面会比想象中更大。
谷歌的 Beyond Zero:谷歌推出了 Beyond Zero,一种在"零信任"基础上更进一步的安全模型。它的决策依据不再是"用户是谁"或"用了哪个应用",而是具体的行为和资源本身;同时,安全决策既受静态策略约束,也会依据环境变化进行动态调整。这与本节导语中提到的"从身份转向行为"的趋势正好呼应。
五、人与组织
人们究竟是怎么使用 AI 的?使用 AI 真的能带来更高的生产力吗?我们对这两个问题的了解都出乎意料地少。我们仍在摸索如何有效使用 AI;衡量效果的最佳标准,或许不是简单的生产力指标,而是"你能否做到过去做不到的事"。
AI Observatory(AI 观测站):这个项目专门收集人们如何使用 AI 的数据。目前我们对"人们到底怎么用 AI"的认知其实相当有限——我们知道不同模型之间的使用模式存在差异,但模型厂商往往只公布他们希望公众看到的那部分数据,整体图景依然模糊。
AI 生产力该如何衡量:一篇题为"为什么 AI 生产力是一个有缺陷的指标"的文章提出了一些颇有见地的想法:与其单纯统计代码行数,更应该围绕代码质量以及 AI 生成的代码能否通过评审来构建衡量指标。
六、网络
现在有了专为青少年设计的 ChatGPT 版本;有网站针对爬虫和真人展示不同内容;还有 AI 生成的《魔戒》开篇动画。互联网正在证明,它能适应任何冲击。它依旧是我们学习和娱乐的地方,AI 并未改变这一点。
ChatGPT for Teens(青少年版):OpenAI 推出的专属模式,面向 13 到 17 岁用户。这个产品更强调学习和研究本身,而非直接给出答案;内容安全防护更严格,也刻意避免让 AI 成为人际交往的替代品。
浏览器里的电子琴(Theremin):一个能在浏览器里玩的电子琴——用鼠标或摄像头就能操控,属于那种"少见但有趣"的小玩意儿。
《TIME》杂志的"双重网站"策略:《TIME》杂志开始针对 AI 爬虫展示一个附带额外广告的极简 Markdown 版本文章。网站的具体行为取决于 HTTP 请求头中的 User-Agent 字段:部分爬虫身份直接被拒绝访问,而真人用户则能看到带图文排版的完整 HTML 页面。这是内容平台应对 AI 爬虫抓取的一种新策略。
AI 生成的《魔戒》动画:厌倦了"骑自行车的鹈鹕"这类经典测试案例?Andrej Karpathy 让 Claude Opus 用 Three.js 制作了一段动画,还原了《魔戒》开篇第一段文字描述的场景。效果谈不上出色,但相当有意思,也恰好暴露了当前最强模型在某些方面仍存在的能力短板。
七、生物
人脑细胞服务器:新加坡国立大学生命科学研究所建造了一台计算能力来自 1600 万个实验室培养的人脑神经元的服务器机架。维持这些神经元存活的"生命支持系统"是个挑战,但其能耗相比 GPU 集群来说只是一个极小的零头。
Claude 完成完整的蛋白质设计流程:Claude 成功执行了一套完整的蛋白质设计工作流,其设计出的新蛋白质已被送往实验室完成合成与测试——这标志着 AI 辅助生物设计正在从"辅助分析"走向"端到端流程执行"。
桌面上的苍蝇:你的桌面上可能真的会出现一只苍蝇。这个项目基于对果蝇连接组(connectome)中超过 23000 个神经元的仿真,行为表现十分接近真实苍蝇(目前仅支持 macOS)。
简要解读
整篇文章延续了 O’Reilly Radar Trends 系列一贯的"月度技术雷达扫描"风格,核心观察其实可以归纳为三条主线:
第一,“小而强"正在取代"大而全”。从 IBM Granite 4.2、Qwen3.8-27B 到 Cactus 的 Needle 2,大量新模型都在用更小的参数量逼近前沿模型的表现,这直接冲击了"只有顶级大模型才值得付费"的固有认知,也解释了作者开篇那句"每个月最好的笔记本级模型都离前沿模型更近一步"的判断依据。
第二,智能体基础设施正在经历"内置化"与"去中心化"的双向拉扯。一方面 Claude Code、Codex 这类平台把跨会话通信、安全审计等能力直接做进产品本身;另一方面 DeepSeek Harness、TrueForge 等开源框架,以及企业自建 harness 的趋势,又在把控制权拉回使用者手中。这与安全部分提到的"从身份到行为"的判断逻辑转变形成了有趣的呼应——无论是模型层还是安全层,判断维度都在从"是谁"转向"做什么"。
第三,水印、供应链攻击、上下文投毒这几件事放在一起看,其实指向同一个更深的问题:随着 AI 生成内容和 AI 驱动的自动化流程越来越普及,"如何确认一段内容/一次操作的真实来源和可信程度"正在成为贯穿模型、软件供应链和网络安全的共同挑战。
如果你对其中某个具体条目(比如 MCP 协议更新、Beyond Zero 安全模型,或者某个具体模型的技术细节)感兴趣,我可以针对性地展开讲解或做进一步的资料查证。