ithome
国际
科技
采集 2026-09-06T10:14:21+00:00
OpenAI多次修改GPT-6 Astra基准测试数据引争议
原始标题:OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩一度大幅变化
来源
ithome
发布时间
2026-09-06T06:46:16
采集批次
2026-09-06-10
字数
1273
URL 指纹
9f4086aad2511f2b
📌 AI 总结(267 字)
OpenAI在发布GPT-6 Astra模型公告过程中多次修改基准测试数据,包括将幻觉率从4.2%临时降至2%后又恢复,数学评测中Anthropic Fable 5.1成绩一度下调近10个百分点,编码评分微调提升等。部分调整发生在博客正式发布前数小时,原因涉及模型检查点、推理等级、测试工具框架等差异。OpenAI称这是正常发布流程,但行业专家担忧存在「Benchmaxxing」(刷分)现象,且系统卡对评测方法披露不足。此事引发对AI行业基准测试可信度与透明度的广泛质疑,对OpenAI可能于2027年进行的IPO计划构成潜在影响。
📄 正文(1273 字)
OpenAI自当地时间9月3日下午首次发布GPT-6 Astra模型公告以来,已经多次修改其中的评测基准数据。部分更新后的数据显示Astra表现有所提升,而竞争对手Anthropic旗下模型的部分成绩则出现下调。 据报道,OpenAI最初计划在美国东部时间9月3日下午2点发布博客文章,但页面发布后一度无法正常访问,CEO萨姆·奥尔特曼随后在X上发文称「我们在部署博客文章时遇到了一点小问题」。事实上,OpenAI在下午2点过后不久就发布了博客,但又将其撤下,随后解释为内容管理系统故障或互联网中断所致。 当博客重新上线后,多项评测数据已经发生变化,部分数据此后仍在继续调整。最引人关注的变化是Astra的幻觉率:在下午2点23分的最初版本中为4.2%,到下午5点20分降至2%,几乎减半;此后又恢复至4.2%。前代模型GPT-5.6 Sol的幻觉率也从12.2%降至9.4%,最终恢复原值。 OpenAI还大幅提高了GPT-5.6 Sol在内部ExploitBench网络安全评测中的成绩,从5.5%提高至11.5%,但表示11.5%对应的是未向商业用户开放的推理能力等级,正在研究是否恢复原值。在FrontierMath Tier 4评测中,Anthropic Fable 5.1的成绩从87.8%一度降至78%,后回升至83%;GPT-5.6 Sol的成绩也从83%降至80.5%再恢复原值。 值得注意的是,部分调整甚至早于下午2点首次发布前。OpenAI向媒体提供的预发布草稿显示Astra在ARC-AGI-3评测中成绩为98.6%,而公开版本已变为99.99%。OpenAI回应称正式发布前验证数据属于正常流程,并表示若配备强大工具框架,Astra成绩可达99.9%,标准框架下则为63%。 OpenAI发言人表示,公司非常重视评测结果准确性,承认由于模型检查点、测试框架和评测运行方式不同,结果会存在波动,公告中的数据已修正以代表最佳估计。但斯坦福大学研究人员Anka Reuel和Mike Hardy指出,OpenAI的系统卡「几乎没有提供任何有关评测方法的细节」,甚至「连测试项目的数量都没有列出」,并担忧存在反复调整测试条件以提高成绩的「Benchmaxxing」现象。 此前,Meta也曾因人为提高Llama 4测试成绩的争议而引发关注,前首席AI科学家Yann LeCun承认公司对基准测试结果进行了「修饰」。业内人士Vincent Sunn Chen表示,发布前调整数据通常是最终流程的一部分,因为测量设置涉及多种可变因素。但他呼吁行业应建立规范,在修改成绩时明确说明评测条件变化,以便研究人员准确理解结果。 基准测试成绩对AI公司而言既是衡量技术进步的工具,也是与竞争对手比拼的「记分牌」,但评测数据频繁变动以及外界对企业诚实展示测试结果的质疑,可能让客户和投资者越来越难判断哪款模型最适合特定任务。这一争议也可能削弱OpenAI希望传递的核心叙事,对一家可能计划在2027年进行IPO的公司来说尤为敏感。