摘要:2026 年 9 月,OpenAI 发布 GPT-6 Astra 当天,多项评测数据被反复修改,引发“刷榜”质疑。本文从这次真实事件出发,结合 Nature 2016 年的可复现性调查,讲清楚“同一份评测出现多个版本”的根因,并给出一套可落地的数据口径与留痕机制。
开头直答:评测数据被多次修改,根因不是“造假”那么简单,而是口径、环境和版本没有锁定。本文以 GPT-6 Astra 事件和 Nature 2016 调查为证据,给出五要素口径 + 六步留痕机制的落地方案,建议对照检查你自己的数据流程。
GPT-6 Astra 事件里,数据到底被改了什么?
结论:根据 Fortune 2026 年 9 月 4 日的报道,OpenAI 自发布 GPT-6 Astra 起,多次修改博客中的评测基准数据;其中部分修改让自家模型成绩更好、竞品成绩更低,直到被公开质疑后才部分回调。
这次事件的关键修改点,我整理成了下面的对照表(依据 Fortune 报道与国内 IT之家 2026 年 9 月 6 日转载整理):
| 指标 | 首版数据 | 中途修改 | 当前/最终 |
|---|---|---|---|
| Astra 幻觉率 | 4.2% | 降至 2% | 回到 4.2% |
| GPT-5.6 Sol 幻觉率 | 12.2% | 降至 9.4% | 回到 12.2% |
| Anthropic Fable 5.1(FrontierMath Tier4 v2) | 87.8% | 降至 78% | 回到 83% |
| Astra(ARC-AGI-3,预发布草稿) | 98.6% | — | 正式版 99.99% |
| Astra(ARC-AGI-3,标准工具框架) | 63%(同一模型换 harness 后成绩差异巨大) | ||
斯坦福智能系统实验室与可信 AI 实验室的研究人员 Anka Reuel 和 Mike Hardy 在讨论中提出了“Benchmaxxing”现象:通过反复调整测试条件、重新运行评测,把分数刷到最好看。OpenAI 发言人则解释称,模型检查点、测试框架和评测运行方式不同,大多数评测结果本身就有几个百分点的波动,修改是为了“代表模型可用性能的最佳估计”。
可复现性问题,不只是 AI 圈的事
如果你觉得“数据改来改去”只是大模型厂商的问题,那再看两个更早的真实数据:
- Nature 2016 年调查(Baker,Nature 期刊,2016):1576 名受访研究者中,超过 70% 尝试复现他人的实验但失败,超过 50% 无法复现自己的实验,约 90% 认为存在可复现性危机。
- 开放科学协作项目(Open Science Collaboration,Science 期刊,2015):对 100 项心理学研究进行复现,97% 的原始研究结果在统计上显著,但复现后只有 36% 依然显著。
结论:“结果说改就改、复现不出来”,不是 AI 圈的专利,而是数据工作缺乏口径纪律和留痕机制的普遍后果。区别只在于:科研里有论文约束,商业发布里只有利益约束。
一份可复现的评测结果,要锁定五要素
结论:基准成绩从来不是一个数字,而是一组“测量条件”的快照。任何一个条件变化,数字都可能变。
我在做数据分析时,把评测结果拆成五个必须同时锁定的要素:
| 要素 | 要记录什么 | 典型坑 |
|---|---|---|
| 指标定义 | 指标口径与计算公式 | 只说“幻觉率”,不说怎么判定幻觉 |
| 数据版本 | 模型检查点、数据集版本 | 同一个模型名,实际跑的是不同权重 |
| 运行环境 | 测试框架、推理配置(温度、上下文、并发) | 换框架重跑,分数完全不同 |
| 评测方式 | harness、工具集、是否允许调用工具 | 标准 harness 与增强 harness 成绩差异巨大 |
| 评分配置 | 判定方式、采样方式、运行次数 | 非确定性评分跑一次就算数 |
GPT-6 Astra 事件里最典型的例子就是 ARC-AGI-3:标准工具框架下 63%,配备更强工具框架后可达 99.9%——同一个模型,换评测方式成绩差三十多个百分点。不记录评测方式,这个数字就完全无法比较。
留痕机制怎么落地:六步流程
结论:留痕的对象不是“结果数字”,而是“测量条件”。每次评测自动生成一份 manifest,包含全部参数与哈希,才是可追溯的。
| 步骤 | 做什么 | 产出物 |
|---|---|---|
| ① 口径登记 | 指标由谁定义、何时定义、计算公式是什么 | 口径登记表 |
| ② 变更申请 | 任何口径/参数修改先说明原因与影响范围 | 变更单 |
| ③ 审计日志 | 系统自动记录谁在何时改了什么 | audit 表(不可篡改) |
| ④ 数据快照 | 变更前自动存档,旧版本永远可恢复 | 版本快照 |
| ⑤ 版本发布 | 带版本号与时间戳发布 | manifest.json |
| ⑥ 可追溯回溯 | 任意历史版本可一键复现 | 复现报告 |
落实到工程上,我建议每次评测跑完自动生成一份 manifest,结构类似(示意):
{ "eval_id": "eval_20260908_001", "metric": "hallucination_rate", "version": "v1.3.0", "model": {"name": "gpt-6-astra", "checkpoint": "ckpt_20260820", "hash": "sha256:9f2c..."}, "dataset": {"name": "hallucination_bench", "version": "2026.08", "hash": "sha256:4bd1..."}, "harness": {"type": "standard", "tools": [], "max_steps": 30}, "runtime": {"framework": "eval-runner 2.1", "temperature": 0, "samples": 3, "judge": "llm-judge-v3"}, "result": {"value": 0.042, "ci": [0.038, 0.046]}, "changed_from": "v1.2.0", "change_reason": "修正幻觉判定口径,排除翻译性改写" }有了 manifest,别人问“这个数字怎么来的”,你可以直接给出完整条件链,而不是一句“我们当时就是这么算的”。
踩坑记录:只留痕数字,不留痕条件
- 现象:留痕系统建了,但回溯时发现“当时到底用的哪个版本”无从考证。
- 根因:只记录了结果数字,没记录口径参数。
- 修复:manifest 里强制包含模型、数据集、框架、harness、评分配置的全部参数与哈希,缺一不可。
- 经验:留痕的对象是“测量条件”,不是“结果数字”。数字会骗人,条件链不会。
边界:不是所有修改都是坏事,关键在透明
- Snorkel AI 负责基准评测研究的工程师 Vincent Sunn Chen 指出,发布前几小时调整评测成绩并不罕见,通常是发布流程的一部分;真正的问题不是“改”,而是改的时候说不说清楚改了什么评测条件。
- 对内部团队:你自己的评测也要有版本纪律,否则跨版本对比、跨模型对比毫无意义——你连自己都复现不了,怎么跟别人比较?
- 留痕机制解决的是“可追溯”,不解决“谁说得对”:口径统一之后,剩下的就是业务判断。
FAQ
Q1:评测数据修改多少算正常波动?
A:OpenAI 官方的说法是“几个百分点以内”。更准确的做法是每次评测跑多次,给出置信区间而不是单点数字。
Q2:小团队有必要建这么重的留痕机制吗?
A:不用一步到位。最小可行版 = 口径登记表 + 评测 manifest + 审计日志,三样就能覆盖 90% 的追溯需求。
Q3:LLM 评测非确定性很强,怎么解决?
A:固定 temperature、固定采样次数取均值、使用确定性评分优先、记录每次运行 seed——把非确定性变成“可复现的非确定性”。
Q4:历史版本太多,存储成本怎么办?
A:快照存差异(diff)而非全量,manifest 只存参数与哈希,成本很低。
Q5:别人改了数据我怎么发现?
A:定期抓取公开评测页面做快照对比(类似 Internet Archive 的做法),或要求对方提供 manifest。发现不一致时,用你的快照说话。
总结:评测数据被“多次修改”不可怕,可怕的是改的时候没有条件记录、没有版本、没有留痕。把口径锁成五要素、把流程走成六步,你的评测结果才真正可复现、可比较、可追溯——这也是数据从业者最值钱的职业素养。
延伸阅读:更多信息可以关注456数据
数据来源说明
- GPT-6 Astra 评测数据修改事件:Fortune 报道《OpenAI quietly boosts some of Astra's evaluation metrics, and continues to change others post-launch》,2026 年 9 月 4 日;IT之家转载报道,2026 年 9 月 6 日。文中幻觉率、FrontierMath、ARC-AGI-3 等具体数字均出自该报道。
- “Benchmaxxing”提法:斯坦福大学 Anka Reuel 与 Mike Hardy 在 Fortune 报道中的评论;Snorkel AI 工程师 Vincent Sunn Chen 关于发布前调整评测的评论亦出自该报道。
- 可复现性调查:Baker, M.《1,500 scientists lift the lid on reproducibility》,Nature 期刊(533 卷,452-454 页),2016 年,受访研究者 1576 名。
- 心理学复现研究:Open Science Collaboration《Estimating the reproducibility of psychological science》,Science 期刊(349 卷,aac4716),2015 年。
- 文中 manifest 为示意结构,用于说明留痕字段设计。