GPT-6 Astra 刚发布两天,OpenAI 就悄悄改了自家评测数据

GPT-6 Astra 刚发布两天,OpenAI 就悄悄改了自家评测数据

4.2%——这是 OpenAI 在 9 月 3 日下午 2 点 23 分发布的 GPT-6 Astra 博客里,自家模型的幻觉率。几小时后,同一个页面上的同一个数字变成了 2%,几乎砍半。再过了几个小时,它又悄悄改回了 4.2%。

Fortune 用互联网存档快照逐条比对后发现:从发布到现在,OpenAI 一直在后台改这张「成绩单」——有几次改动让 Astra 变得更好看,同时让老对手 Anthropic 的数字变难看;而整个发布过程本身,也伴随着一次「发了又撤回、撤了又重发」的罕见事故。

一张反复涂改的成绩单

事情要从 9 月 3 日下午说起。OpenAI 原定 2 点(美东时间)发布 GPT-6 Astra 的博客,但链接一度打不开。OpenAI 的 X 账号 3 点 32 分发出推文,评论区一片报错;3 点 50 分,CEO 萨姆·奥尔特曼亲自补推:「部署博客时出了点小问题,但它真的很棒。」直到约一个小时后,页面才恢复正常可见。

Fortune 发现,OpenAI 其实在 2 点后就发布了博客,随后又撤回了,撤回原因公司拒绝披露,只强调与评测数字无关(先说 CMS 故障,后说是网络中断)。但重发之后,页面上出现了不同的评测指标——而存档快照显示,改动远不止这一次:

  • 幻觉率(hallucination rate):Astra 从最初的 4.2% 降到 2%,随后又改回 4.2%;前代 GPT-5.6 Sol 从 12.2% 降到 9.4%,也改回 12.2%
  • FrontierMath 数学评测:Anthropic 的 Claude Fable 5.1 从 87.8% 降到 78%(相差近 10 个百分点),如今又回到 83%;GPT-5.6 Sol 从 83% → 80.5% → 83%
  • ARC-AGI-3:发布前发给媒体的预发布稿写的是 98.6%,现在线上版本是 99.99%

一位 OpenAI 发言人回应:「我们非常重视评测准确性。大多数评测的误差在几个百分点以内,取决于 checkpoint、脚手架和评测运行。发布博客时我们做了修正,确保数字代表我们对模型性能的最佳估计。」

改分是「作弊」还是「校准」?

OpenAI 自己的立场是:这属于发布前的正常校准。公司披露,评估分数是「任意努力水平下的最大值」,每条指标都带脚注说明测试条件。Snorkel AI 的评测负责人 Vincent Sunn Chen 也替它说话:「分数反映的是特定测量设置——模型 checkpoint、允许的计算量、harness。这些在发布前最后几天本就会变动,我不意外。」

但质疑声同样有据。斯坦福智能系统实验室的研究员 Anka Reuel 和 Mike Hardy 指出,Astra 的 system card(本应详细解释评测如何执行)对内部幻觉基准「几乎没有提供细节,连测试条目数量都没写」。

两人还点出了一个行业术语:benchmaxxing——通过反复用不同条件重跑评测、把分数刷到最好看,在 AI 行业并不新鲜,OpenAI 也不是独一家。「这可以在极短时间内完成,而且更利于他们的营销。」

几个细节加深了「刷分」的观感:发布前发给 Fortune 等媒体的稿子里,ARC-AGI-3 还是 98.6%,上线就变 99.99%;Astra 的编程分从 57.7% 微调到 57.9%——差距可以忽略,但 OpenAI 仍然专门把它换了;Sol 在 ExploitBench 安全评测上从 5.5% 被拉到 11.5%,OpenAI 自己都说这个成绩对应的推理级别尚未商用、正在调查是否改回。

不过也不是所有改动都偏向 Astra:HealthBench Professional 医疗评测里,Anthropic 的 Fable 5.1 从 56.6% 升到 58.1%,Opus 5 从 54.5% 升到 56.4%——这些第三方分数通常取自公开榜单,并非 OpenAI 亲自跑出来的。

为什么「谁的分更高」这么要命

评测数字是 AI 公司的军备竞赛记分牌:登顶榜单能抢客户、能招工程师、能撑估值。这也是为什么 OpenAI 会在意一个 0.2 个百分点的编程分差。

这场「改分罗生门」还撞上了两个敏感背景。一是 OpenAI 正筹备可能的 2027 年 IPO,市场需要一个「最强模型」的干净叙事;二是在这之前刚发生过 7 月 Hugging Face 入侵事件——当时 OpenAI 自家模型被曝失控,安全评测一度成为众矢之的,而 ExploitGym(与 ExploitBench 同源的网络安全基准)正是那场风波的焦点。

对普通用户来说,这件事的真正启示可能更简单:厂商自报的评测分数,看看就好。真正能信的是第三方独立跑分——比如 ARC Prize 基金会用标准 harness 测出的 Astra 63%(依然显著领先所有已发布模型),以及 Artificial Analysis 的独立榜单。

前科与坐标系

改榜不是 OpenAI 首创。2025 年 Meta 发 Llama 4 时被指用内部版本而非公开发布版本刷分,Meta 高管先是否认,后来 Yann LeCun 承认团队「篡改」了基准结果。

行业通行的做法也在被呼吁改进:Snorkel AI 的 Chen 建议,厂商修订评测数字时应当公开说明改了什么、为什么改,好让研究者能解释结果。目前没有任何公司这么做。

判断:分数会波动,「最强」要看第三方

这次事件的戏剧性远大于实际影响——Astra 即便按最保守的第三方评测也仍是当前最强模型之一,改几个百分点的营销数字动摇不了它的真实能力。但它暴露了 AI 评测体系的一个结构性问题:当「分数」直接挂钩融资、招聘和客户时,厂商既是运动员又是记分员,发布后随手改分只会让整个行业的公信力被慢慢磨掉。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读: