paperclip 摸到约 94K 星的那天,我意识到一件事:Agent 已经不是"工具"了。
94K 星是什么概念?在 AI 这个卷得离谱的赛道里,能冲到这个量级的,都是戳中了真实痛点的项目。paperclip 干的事说出来有点像科幻——给 AI Agent 建组织架构图、定预算、做绩效评估。一句话:让 AI 运营一家公司。
同样这周,OpenAI DevDay 上亮了 ChatGPT Work——他们叫它 “dots”。每个 dot 有自己的云端计算机,能自己连应用、自己干活,多个 dot 还能组队。Codex 负责人 Tibo 紧跟着宣布了"疯狂 28 天",每天要么交付改进要么重置额度。Day 1 就放了个大招:GPT-6 Astra 和 6.1 Sol 推理速度提 50%。
还有 hindsight,一周涨了约 17,000 星,做的是 Agent 长期记忆。
把这几条线串起来看,一个方向已经很清楚了:Agent 正在从"工具"变成"员工"。
OpenAI dots:闭源路线的"成品化"
先讲 dots,因为它目前最接近"拿过来就能用"的状态——当然,也还是新产品,实际表现如何还需要时间验证。
它的核心设计不是聊天机器人加了几个工具。是给每个 Agent 一个独立的云端计算机——你给目标、给权限边界,它自己连应用、查数据、写代码、发消息。
几个值得拎出来说的设计细节:
独立运行环境。每个 dot 有自己的云端计算机,不是共享的。这意味着隔离——一个出问题不会波及另一个,数据也不会串。这和我之前聊的 Agent 运行时隔离是一个思路,只不过 OpenAI 把它做进了产品里。
Auto-review 层。高风险动作执行之前,先由另一个 frontier model 审核一遍,不是全靠执行模型自己判断。这个设计很关键——它等于承认了"单个模型的安全判断不可靠",用双模型交叉审核来降低风险。
团队协作。OpenAI 自己说的:"未来多个 dot 将组成团队,协同工作。"不是一个超级 Agent 干所有事,是一群 Agent 各司其职。这和人类组织的逻辑一样——专业分工比全能型选手效率高。
企业版和教育版还有 Compliance API,管理员能控制插件和工具的访问权限、设置浏览器和网络限制。说白了就是给企业管理员一套"管住 AI 员工"的工具。
dots 的路线很清晰:闭源、托管、一站式、企业级管控。适合不想自己折腾基础设施、直接想用上 AI 员工的团队。
代价也很明显——数据在 OpenAI 那边,定制化空间有限,价格不便宜。
paperclip:开源路线的"操作系统"
paperclip 走的是完全相反的路:开源、自托管、基础设施。
输入一个公司目标——比如"做一个最好的 AI 笔记应用"——然后"招聘"你的 AI 团队。产品经理 Agent、工程师 Agent、设计师 Agent,各自有职责、有预算、有汇报关系。
听起来像个游戏?94K 星(截至 10 月初,第三方统计)说明很多人不觉得这是个玩笑。
它有两大支柱:
第一根支柱叫 Agent Employee Training。不是写 prompt,是"培训"AI 员工。Skill Studio 做技能培训,evals 做测试评估,还有主动学习循环、质量指标、甚至 Agent 的绩效评估和技能版本历史。
这不是"给 AI 一个任务让它干"的逻辑,是"像培养员工一样培养 AI"的逻辑。
第二根支柱叫 Agentic OS。底层基础设施——跨模型运行时、沙箱、集成、MCP 服务器、SSO、RBAC、成本控制、数据隐私、运行历史追踪。
paperclip 想做的是"AI 公司的操作系统"。你不用自己搭 Agent 运行环境、不用自己管权限、不用自己做监控,这些基础设施它都包了。你只需要定义组织架构和目标。
优势是开源、可控、可定制。劣势也很——太复杂了。它不是开箱即用的产品,是一套基础设施。你得有技术团队去部署、去配置、去维护。
而且说实话,"AI 运营一家公司"这个目标,目前更像愿景而不是现实。paperclip 更适合开发者做技术探索和原型验证,离真的用它跑业务还有距离。
长期记忆:AI 员工的"转正"前提
不管是 dots 还是 paperclip,有一个问题绕不开:记忆。
现在的 Agent 最大的问题之一是"做完就忘"。这次会话聊了什么、上次做了什么决策、为什么那么做——下一次对话就全忘了。在需要持续协作的场景下,这样的 Agent 永远是"临时工",干一单是一单,没法积累经验、没法成长。
hindsight 一周涨了约 17,000 星,说明这个痛点有多痛。
长期记忆系统干的事:把 Agent 的会话记忆、工具调用记录、决策轨迹全部持久化存下来,下次对话的时候能检索出来。这样 Agent 就能"记住"上次干了什么、踩过什么坑、用户偏好是什么。
听起来不复杂,但它是 Agent 从"工具"变"员工"的关键拼图。
一个员工为什么比一个工具值钱?因为他有经验、有上下文、有积累。你不用每次都从头交代背景,他知道你是谁、知道项目的来龙去脉、知道上次为什么那么决策。
Agent 也是一样。没有长期记忆的 Agent,每次都是从零开始——你得反复解释背景、反复说偏好、反复纠正同样的错误。有了长期记忆,它才能真正"跟你一起工作",而不是"被你调用一下"。
hindsight 只是这个方向的一个项目。长期记忆的技术路线还很多——向量数据库存 embedding、图数据库存关系、知识图谱存结构,各有优劣。这个领域还远没到定型的时候。
但方向是确定的:在需要持续协作的场景下,没有记忆的 Agent 走不远。
不是三个项目,是同一个趋势
看起来是三个不同的东西,其实指向同一个方向——Agent 团队化。
不是一个超级 Agent 搞定一切,而是一群 Agent 分工协作。不是干一单忘一单,而是持续积累、越用越顺手。不是人盯着每一步,而是给目标、给权限、让 Agent 自己跑。
打个比方可能更容易理解:
- dots 是品牌整机。开箱即用,体验好,但贵、封闭、不能自己拆了改。
- paperclip 是兼容机主板。开源、灵活、你想怎么配就怎么配,但得自己装、自己调。
- hindsight 是内存条。通用组件,不管你用整机还是兼容机,加内存都能提升体验。
而且它们之间不是互斥的——paperclip 可以集成 hindsight 做记忆,dots 未来也可能内置类似的记忆功能。paperclip 也能调用 OpenAI 的模型,dots 也能接第三方 MCP 工具。
| 路线 | 代表 | 定位 | 成熟度 | 适合谁 |
|---|---|---|---|---|
| 闭源托管型 | OpenAI dots | 一站式 AI 员工 | 较高(官方产品) | 不想折腾基础设施的团队 |
| 开源基建型 | paperclip | AI 公司操作系统 | 中等(快速迭代中) | 有技术团队、想自建的开发者 |
| 基础设施型 | hindsight | Agent 长期记忆 | 早期 | 所有用 Agent 的团队都需要 |
对做开发的人来说,这件事的影响在哪里?
编码 Agent 的竞争维度在变。以前比的是"谁写代码写得好",以后比的是"谁的 Agent 团队协作效率高"。单个模型的能力差距会越来越小,团队编排、记忆系统、治理能力的差距会越来越大。
至少从 GitHub 星数来看,基础设施项目的增长速度比应用层快。paperclip 94K 星、hindsight 一周 17K 星——大家都在"卖铲子"。真正用 AI 员工跑业务的案例还不多,但给 AI 员工搭基础设施的项目已经火了。
治理和安全会变成核心竞争力。OpenAI dots 的 Auto-review 层、企业版的 Compliance API、paperclip 的 RBAC 和预算控制——所有头部玩家都在砸治理。原因很简单:Agent 越能干,出问题的后果越严重。没有治理的 AI 员工,谁敢用?
最后
现在很多人对"AI 员工"这个概念还将信将疑。觉得现在的 Agent 连个简单的 bug 都修不利索,谈什么团队协作、什么运营公司。
这种怀疑很合理。今天的 Agent 确实还很初级——经常犯低级错误、经常跑偏、经常需要人盯着。
但不要用今天的能力去判断明天的趋势。
一年前,编码 Agent 还只能写写简单函数。现在据 BenchLM 10 月排行,SWE-bench Pro 上 Claude Opus 5.5 已经 89.9% 了。
一年后呢?
AI 员工不会一夜之间取代所有人。它会先从最简单、最重复的工作开始,慢慢往上走。先做数据录入,再做简单分析,再做基础编码,再做复杂任务——一步一步来。
你的工作里,哪部分可以先交给 AI 员工?
想清楚这个问题,就走在了大部分人前面。