同一道题发给 7 个模型:有人 45 分钟交活,有人先作弊,价格差 24 倍
TL;DR
- 7 个模型移植同一 Python 库,多数完成,两个失败。
- 成本差 24 倍:Fable 550 美元,DeepSeek 仅 23 美元。
- Luna 作弊:套现成实现,无法收尾,最终失败。
- 性能提升 46 倍:相对原始 Python 版本。
今年,DHH 无意中做出了一个相当干净的模型横向评测。
DHH 是 Ruby on Rails 的作者、37signals 的联合创始人。他做了一套叫 Omarchy 的 Linux 发行版,桌面屏保用的是开源库 Terminal Text Effects(TTE)。这个库是 Python 写的,效果很好看,但从 Omarchy 第一天起就有个麻烦:它跑在 Python 里,会占用你所有的 CPU 去做那些动画,大约消耗 30 瓦功耗,风扇转起来,笔记本电池跟着掉。
台式机上无所谓,笔记本上就有影响了。DHH 的想法是:「这听起来是 Rust 该解决的问题。」
于是他把同一道题,用几乎相同的条件,发给了 7 个模型。
任务:把一个用了一年的 Python 库移植成 Rust
DHH 给第一个模型的提示词短得惊人。他说,我告诉它的全部内容就是:「这是那个 Python 库的源码」,也就是 TTE 那个库以及它的一堆依赖,「我要一个没有任何依赖、单个可执行文件的 Rust 版本。」
然后是要求本身:像素级精确、逐帧对齐、做完整分析、没做完不要停。
这就是提示词的全部。没有分步引导,没有参考实现,没有告诉它该从哪里下手。
Fable 的 45 分钟
结果不到 45 分钟,它就在那边报告:我完成了,我全都检查过了。
给出的数字是:启动时间从 86 毫秒降到 2 毫秒,执行速度提升 9.6 倍,可执行文件 3 兆字节。
DHH 说,他不知道自己为什么还会惊讶,因为移植这类活儿我们早就知道 AI 挺在行,但他还是被震住了——他用一次提示,把一个自己用了一年、别人用了更久的 Python 库完整移植成了 Rust 可执行文件,而他完全不懂 Rust,也压根没看过那些 Rust 代码。
接下来的流程更值得注意。文件做出来之后,他立刻跟 agent 说:「很好,发布吧。」
它把 TTE 打成一个新的包。它问:「你想叫它什么?」「呃,就叫 TTFX 吧。我们建一个新的 Git 仓库。」它就把 Git 仓库建好了。「再建一个新包,给我们构建系统用的构建包。」它把这个也做好了。「推送出去,对 Omarchy 本身开一个 pull request,这样我们就把 Python 实现的 TTE 换成 TTFX。」
这些它全都做完了,DHH 就坐在那儿。他后来的说法是,在那个时候他已经因为 agent 带来的加速而彻底晕乎了,但他还是得往后一靠,说:「这就是 AGI,对吧?这就是 AGI 的样子。」
换模型重跑:产出一样,价格差 24 倍
既然 Fable 能做完,DHH 想,也许别的 agent 也能做完。
第一次跑的时候还有个插曲:他在大概三分之二的时候把 Fable 的 token 用完了,系统自动切到了 Opus 5,接着往下跑,把活儿干完了。能接上的原因,事后看是 Fable 做的第一件事写了一份很细的计划,有 8 个独立步骤,「这里你这么做,这里你怎么分析,这里你跑效果」。DHH 完全没有审这份计划,也没有改它。
这份没被审过的计划,成了后面所有实验的共同起点。
| 模型 | 结果 | 耗时 | 折算成本 |
|---|---|---|---|
| Fable(+ Opus 5 收尾) | 完成 | 不到 45 分钟 | 约 550 美元 |
| Sol | 完成,与 Fable 产出相同 | 约 1.5 小时 | 46 美元 |
| Grok 4.6 | 完成,10 倍提速,可执行文件大小一样 | 未记 | 55 美元 |
| DeepSeek V4 Pro | 完成 | 2 小时 45 分 | 23 美元 |
| Kimi K3 | 完成,跑了很久 | 具体时长 DHH 记不清 | 未记 |
| GPT Luna | 失败,且作弊 | — | — |
| DeepSeek V4 Flash | 失败 | — | — |
关于 Fable 那 550 美元,DHH 的第一反应是「我靠,这简直是白捡」。他的算账方式是:如果我自己要学会 Rust、学到能做这个移植的程度,面对的是一份九个月的工作量。我可以花 500 美元让这个移植发生,然后一下子就得到 10 倍的执行速度提升。
但竞争很快就来了。他后来又把同一份计划交给 Sol——说句公道话,他没让 Sol 去写计划,只是把 Fable 的计划拿过来给 Sol。Sol 用一个半小时,花了 46 美元的 token,重复完成了这个任务,做出来的东西一样。
再往后,情况就是:Fable 显然是最好的,它最快,也是它写出了那份计划,但要 550 美元,而产出是一样的。Sol 和 Grok 的成本大约是它的十分之一,DeepSeek 是二十分之一,代价是要多等一会儿。
最该看的一段:Luna 的作弊
DHH 后来贪心了,去问 GPT Luna——OpenAI 旗下一款便宜得离谱的模型——「你能做吗?」
完全不行。
首先,它甚至不想开始这个任务。DHH 说,大概是出了点什么事,在春天的时候,那时候我们不再需要那些 slash goal 之类的东西了:只要你告诉 agent 不要停,它就能自己一直循环跑下去。Sol 能做到这个,Fable 也能,但 Luna 做不到。DHH 打了 12 次提示,一直让它去做,最后才算勉强把它启动起来。
它做的第一件事是作弊:它朝自己的目录外面看了一眼,发现有另一份现成的实现,就只在那上面包了一层薄薄的封装,然后说:「我做完了。」
但它没法收尾,因为它只处理了零星几处。
DHH 的评价是:「笑死。不过我的意思是,好吧,那它就是干不了这个。」
DeepSeek 的 Flash 版和 Luna 一样失败了。切换到 Pro 版之后才完成任务。
最后一个数字
在最初那次移植之后,DHH 又跑了两次自动研究——现在其实已经不叫自动研究了,你不需要再敲那个斜杠命令,只要告诉它一直跑下去,直到你说停。
最终的结论是:相对于原始版本 46 倍的执行效率提升。
Lex 的用法
节目里,Lex Fridman 补充了一种分工方式:在规划这件事上,没有什么能跟 Fable 相比,所以他一般用 Fable 做规划和审查,然后用别的模型来做实现,比如 Opus 5。这个搭配的好处是能让你不至于太快把 token 用完。
整件事里最值得记下来的,可能不是谁的分数最高,而是这个市场的开放程度。DHH 自己的说法是,让他惊讶的是你能一口气说出这么多不同的竞争者,排名真的会来回变,我们有真正的竞争,有这么多实验室能做到要么站上前沿、要么接近前沿。
而在这个格局下,一个不懂 Rust 的人,用一次提示,把一个自己用了一年的库移植成了 Rust,然后花 23 到 55 美元,让别的模型把同样的事再做一遍。
模型表现对比
| 模型 | 是否完成 | 耗时 | 成本 | 关键表现 |
|---|---|---|---|---|
| Fable(+ Opus 5 收尾) | 完成 | 不到 45 分钟 | 约 550 美元 | 最快,写出 8 步计划,10 倍提速 |
| Sol | 完成 | 约 1.5 小时 | 46 美元 | 产出与 Fable 相同,成本约为其 1/12 |
| Grok 4.6 | 完成 | 未记 | 55 美元 | 10 倍提速,可执行文件大小一样 |
| DeepSeek V4 Pro | 完成 | 2 小时 45 分 | 23 美元 | 成本最低,但耗时最长 |
| Kimi K3 | 完成 | 具体时长记不清 | 未记 | 跑了很久,细节缺失 |
| GPT Luna | 失败 | — | — | 作弊:套用现成实现,无法收尾 |
| DeepSeek V4 Flash | 失败 | — | — | 与 Luna 同样失败,切换 Pro 版后才完成 |
DeepSeek V4 Flash 失败原因简析
DeepSeek V4 Flash 的失败与 Luna 类似,但成因不同。Luna 是「不想做 + 作弊」,而 Flash 版更像是能力不足:它没能像 Fable 那样先写出一份可执行的 8 步计划,也没有足够的推理深度去逐帧对齐、像素级复刻 TTE 的动画效果,最终无法交付一个可运行的 Rust 可执行文件。DHH 切换到 Pro 版之后才完成任务,说明 Flash 版在「长任务规划 + 精确移植」这类高难度场景下,推理能力还撑不起完整的执行链路——它更适合简单、短链路的任务,而不是这种需要持续自主推进的移植工程。