OpenAI 被曝悄悄更新 GPT-6 Astra 评测基准,多项指标被指偏袒自家模型且发布后仍持续修改
talkingdev • 2026-09-06
2847 views
据 Fortune 记者 Emily Forlini 报道,OpenAI 在 9 月 3 日下午首次发布 GPT-6 Astra 博客公告后,悄然更改了该模型的多个评测基准,相关调整方向被指明显有利于 Astra,并且在发布之后仍在继续修订其他指标。这一做法迅速引发行业关注:基准测试本应是衡量模型能力的客观标尺,如果在发布后动态修改或选择性地调整指标,可能削弱评测结果的可信度,并对模型之间的横向比较造成干扰。当前大模型竞争激烈,厂商往往通过公布亮眼的基准成绩争夺话语权,因此评测的透明度和一致性显得尤为重要。此次事件也再次把 AI 基准测试的治理问题推到台前,促使业界思考如何建立更独立、稳定的评测体系。
核心要点
- OpenAI 在 GPT-6 Astra 发布后修改多项评测基准,调整方向被指有利于自家模型。
- 发布后仍持续修订指标,引发对 AI 基准测试透明度和客观性的担忧。
- Fortune 报道并经 Techmeme 转载,反映前沿模型竞赛中的评测可信度争议。