OpenAI 为了一道百万奖金的数学题,手段有点难看

最近 NYU 的数学家 Nadia Khalaf 在社交媒体上扔出一记实锤:她在一道 OpenAI 资助的数学竞赛题中发现了大量 AI 作弊痕迹,而 OpenAI 的处理方式让人相当不舒服。
这道题本身来头不小——它背后是克雷数学研究所悬赏百万美元的 Navier-Stokes 存在性与光滑性 问题,千禧年七大难题之一,谁能给出完整解答就能名利双收。OpenAI 显然也盯上了这个能"出圈"的机会,搞了一场对外开放的解题比赛,宣称要让 AI 助力人类攻克这座数学高峰。
故事在 8 月底反转。Khalaf 在审阅作品时发现,多份参赛提交里出现了高度雷同的措辞、几乎一致的解题路径,甚至连错误都长一个样。她把这些疑似由同一模型批量生成的答案整理出来,发给了 OpenAI。
接下来的剧情就有点难看了:
- OpenAI 起初否认问题严重性,拖了好几周才承认部分提交确实违规;
- 比赛结果一拖再拖,原本承诺的奖金和排名迟迟不公布;
- 更让 Khalaf 生气的是,有内部消息暗示 OpenAI 在风波之后悄悄调整了评审标准,相当于"既当运动员又当裁判"。
作为出资方和平台方,OpenAI 显然有动机把自己模型的表现往好里包装。当 AI 既是参赛者,又是出题者、评审规则的制定者,利益冲突 几乎是必然的。
这件事值得关注的点不在于"AI 能不能做数学",而在于:
- 谁来监督 AI 比赛? 当赞助方自己就有模型参赛,外部裁判和透明规则比以往任何时候都重要。
- 百万奖金的诱惑下,学术声誉如何保值? 克雷研究所的招牌会不会因为这种闹剧被稀释?
- AI 公司越来越频繁地介入科研评价体系,从论文评审到悬赏赛,权力正在悄悄集中。
我个人觉得,这件事最让人遗憾的不是作弊本身——作弊在任何竞赛里都不稀奇——而是 OpenAI 作为头部公司,处理争议的方式给人一种"先捂盖子、再悄悄改规则"的观感。Navier-Stokes 难题还有悬赏挂在墙上,但比这道题更难解的,可能是 AI 时代科研生态的信任问题。
来源:Hacker News