评测数据为什么会被「多次修改」?一套可复现的数据口径与留痕机制
2026/9/14 23:34:03 网站建设 项目流程

摘要:2026 年 9 月,OpenAI 发布 GPT-6 Astra 当天,多项评测数据被反复修改,引发“刷榜”质疑。本文从这次真实事件出发,结合 Nature 2016 年的可复现性调查,讲清楚“同一份评测出现多个版本”的根因,并给出一套可落地的数据口径与留痕机制。

开头直答:评测数据被多次修改,根因不是“造假”那么简单,而是口径、环境和版本没有锁定。本文以 GPT-6 Astra 事件和 Nature 2016 调查为证据,给出五要素口径 + 六步留痕机制的落地方案,建议对照检查你自己的数据流程。

GPT-6 Astra 事件里,数据到底被改了什么?

结论:根据 Fortune 2026 年 9 月 4 日的报道,OpenAI 自发布 GPT-6 Astra 起,多次修改博客中的评测基准数据;其中部分修改让自家模型成绩更好、竞品成绩更低,直到被公开质疑后才部分回调。

这次事件的关键修改点,我整理成了下面的对照表(依据 Fortune 报道与国内 IT之家 2026 年 9 月 6 日转载整理):

指标首版数据中途修改当前/最终
Astra 幻觉率4.2%降至 2%回到 4.2%
GPT-5.6 Sol 幻觉率12.2%降至 9.4%回到 12.2%
Anthropic Fable 5.1(FrontierMath Tier4 v2)87.8%降至 78%回到 83%
Astra(ARC-AGI-3,预发布草稿)98.6%正式版 99.99%
Astra(ARC-AGI-3,标准工具框架)63%(同一模型换 harness 后成绩差异巨大)

斯坦福智能系统实验室与可信 AI 实验室的研究人员 Anka Reuel 和 Mike Hardy 在讨论中提出了“Benchmaxxing”现象:通过反复调整测试条件、重新运行评测,把分数刷到最好看。OpenAI 发言人则解释称,模型检查点、测试框架和评测运行方式不同,大多数评测结果本身就有几个百分点的波动,修改是为了“代表模型可用性能的最佳估计”。

可复现性问题,不只是 AI 圈的事

如果你觉得“数据改来改去”只是大模型厂商的问题,那再看两个更早的真实数据:

  • Nature 2016 年调查(Baker,Nature 期刊,2016):1576 名受访研究者中,超过 70% 尝试复现他人的实验但失败,超过 50% 无法复现自己的实验,约 90% 认为存在可复现性危机。
  • 开放科学协作项目(Open Science Collaboration,Science 期刊,2015):对 100 项心理学研究进行复现,97% 的原始研究结果在统计上显著,但复现后只有 36% 依然显著。
结论:“结果说改就改、复现不出来”,不是 AI 圈的专利,而是数据工作缺乏口径纪律和留痕机制的普遍后果。区别只在于:科研里有论文约束,商业发布里只有利益约束。

一份可复现的评测结果,要锁定五要素

结论:基准成绩从来不是一个数字,而是一组“测量条件”的快照。任何一个条件变化,数字都可能变。

我在做数据分析时,把评测结果拆成五个必须同时锁定的要素:

可复现评测结果需要锁定的五个要素
要素要记录什么典型坑
指标定义指标口径与计算公式只说“幻觉率”,不说怎么判定幻觉
数据版本模型检查点、数据集版本同一个模型名,实际跑的是不同权重
运行环境测试框架、推理配置(温度、上下文、并发)换框架重跑,分数完全不同
评测方式harness、工具集、是否允许调用工具标准 harness 与增强 harness 成绩差异巨大
评分配置判定方式、采样方式、运行次数非确定性评分跑一次就算数

GPT-6 Astra 事件里最典型的例子就是 ARC-AGI-3:标准工具框架下 63%,配备更强工具框架后可达 99.9%——同一个模型,换评测方式成绩差三十多个百分点。不记录评测方式,这个数字就完全无法比较。

留痕机制怎么落地:六步流程

结论:留痕的对象不是“结果数字”,而是“测量条件”。每次评测自动生成一份 manifest,包含全部参数与哈希,才是可追溯的。
数据留痕机制:从变更到可追溯的六步流程
步骤做什么产出物
① 口径登记指标由谁定义、何时定义、计算公式是什么口径登记表
② 变更申请任何口径/参数修改先说明原因与影响范围变更单
③ 审计日志系统自动记录谁在何时改了什么audit 表(不可篡改)
④ 数据快照变更前自动存档,旧版本永远可恢复版本快照
⑤ 版本发布带版本号与时间戳发布manifest.json
⑥ 可追溯回溯任意历史版本可一键复现复现报告

落实到工程上,我建议每次评测跑完自动生成一份 manifest,结构类似(示意):

{ "eval_id": "eval_20260908_001", "metric": "hallucination_rate", "version": "v1.3.0", "model": {"name": "gpt-6-astra", "checkpoint": "ckpt_20260820", "hash": "sha256:9f2c..."}, "dataset": {"name": "hallucination_bench", "version": "2026.08", "hash": "sha256:4bd1..."}, "harness": {"type": "standard", "tools": [], "max_steps": 30}, "runtime": {"framework": "eval-runner 2.1", "temperature": 0, "samples": 3, "judge": "llm-judge-v3"}, "result": {"value": 0.042, "ci": [0.038, 0.046]}, "changed_from": "v1.2.0", "change_reason": "修正幻觉判定口径,排除翻译性改写" }

有了 manifest,别人问“这个数字怎么来的”,你可以直接给出完整条件链,而不是一句“我们当时就是这么算的”。

踩坑记录:只留痕数字,不留痕条件

  • 现象:留痕系统建了,但回溯时发现“当时到底用的哪个版本”无从考证。
  • 根因:只记录了结果数字,没记录口径参数。
  • 修复:manifest 里强制包含模型、数据集、框架、harness、评分配置的全部参数与哈希,缺一不可。
  • 经验:留痕的对象是“测量条件”,不是“结果数字”。数字会骗人,条件链不会。

边界:不是所有修改都是坏事,关键在透明

  • Snorkel AI 负责基准评测研究的工程师 Vincent Sunn Chen 指出,发布前几小时调整评测成绩并不罕见,通常是发布流程的一部分;真正的问题不是“改”,而是改的时候说不说清楚改了什么评测条件
  • 对内部团队:你自己的评测也要有版本纪律,否则跨版本对比、跨模型对比毫无意义——你连自己都复现不了,怎么跟别人比较?
  • 留痕机制解决的是“可追溯”,不解决“谁说得对”:口径统一之后,剩下的就是业务判断。

FAQ

Q1:评测数据修改多少算正常波动?

A:OpenAI 官方的说法是“几个百分点以内”。更准确的做法是每次评测跑多次,给出置信区间而不是单点数字。

Q2:小团队有必要建这么重的留痕机制吗?

A:不用一步到位。最小可行版 = 口径登记表 + 评测 manifest + 审计日志,三样就能覆盖 90% 的追溯需求。

Q3:LLM 评测非确定性很强,怎么解决?

A:固定 temperature、固定采样次数取均值、使用确定性评分优先、记录每次运行 seed——把非确定性变成“可复现的非确定性”。

Q4:历史版本太多,存储成本怎么办?

A:快照存差异(diff)而非全量,manifest 只存参数与哈希,成本很低。

Q5:别人改了数据我怎么发现?

A:定期抓取公开评测页面做快照对比(类似 Internet Archive 的做法),或要求对方提供 manifest。发现不一致时,用你的快照说话。

总结:评测数据被“多次修改”不可怕,可怕的是改的时候没有条件记录、没有版本、没有留痕。把口径锁成五要素、把流程走成六步,你的评测结果才真正可复现、可比较、可追溯——这也是数据从业者最值钱的职业素养。

延伸阅读:更多信息可以关注456数据

数据来源说明
  • GPT-6 Astra 评测数据修改事件:Fortune 报道《OpenAI quietly boosts some of Astra's evaluation metrics, and continues to change others post-launch》,2026 年 9 月 4 日;IT之家转载报道,2026 年 9 月 6 日。文中幻觉率、FrontierMath、ARC-AGI-3 等具体数字均出自该报道。
  • “Benchmaxxing”提法:斯坦福大学 Anka Reuel 与 Mike Hardy 在 Fortune 报道中的评论;Snorkel AI 工程师 Vincent Sunn Chen 关于发布前调整评测的评论亦出自该报道。
  • 可复现性调查:Baker, M.《1,500 scientists lift the lid on reproducibility》,Nature 期刊(533 卷,452-454 页),2016 年,受访研究者 1576 名。
  • 心理学复现研究:Open Science Collaboration《Estimating the reproducibility of psychological science》,Science 期刊(349 卷,aac4716),2015 年。
  • 文中 manifest 为示意结构,用于说明留痕字段设计。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询