OpenAI 声称解出 NS 千禧年难题,数学家的指控比证明本身更炸:1 万个 AI 智能体、3000 亿 token,和一场没人见过的证明

9 月 8 日,数学圈炸了,不是因为证明本身,而是因为一场没人见过的证明引发的指控。
OpenAI 官宣:内部模型(能力远超 GPT-6 Astra)解出了纳维-斯托克斯(Navier–Stokes)千禧年难题——证明三维流体可以在有限时间内产生"奇点"(爆破),并附上了 Lean 形式化验证。规模惊人:约 1 万个并发智能体、88 小时、3000 亿输出 token。
但同一天,纽约大学数学家 Tristan Buckmaster 公开四页声明,指控 OpenAI “学术掠夺”:得知他团队(含 Anthropic 的 Levent Alpöge)的突破后,OpenAI 抢跑发布、施压署名、甚至说出"你为什么要毁掉自己的职业生涯"。
证明没公开,指控没实锤,但这场戏已经把 AI 数学竞赛的规则问题摆上了台面。
先分清:欧拉方程 ≠ 纳维-斯托克斯方程
整个争议的起点是这两个方程被混为一谈。它们是不同的东西,含金量差着一个百万美元大奖:
- 欧拉方程:忽略黏性(理想流体)。Buckmaster 团队解的是它——证明了无黏性流体可以爆破。但克雷数学研究所的官方说明明确:欧拉方程不在千禧年大奖悬赏范围内
- 纳维-斯托克斯方程:含黏性(真实流体)。黏性会耗散动能、抑制剧烈扰动,所以"有黏性还能爆破"才是那个 90 年没解开的千禧年难题
一句话:Buckmaster 证明的是"理想流体能炸",OpenAI 声称的是"真实流体能炸"——后者才是百万美元问题。黏性那一项,就是天堑。

OpenAI 的"10,000 个智能体军团"
官方公告透露的工程细节,比证明本身更值得关注:
- 9 月 1 日启动(听到"两个千禧年问题被解决"的传言后),9 月 5 日出结果:88 小时
- 约 10,000 个并发 agent,分成小组,组内可通信,每组用不同的问题变体(A/B 版本求证明、C/D 版本求反证)
- 先让近 100 个 agent 花 50 小时解出欧拉方程无外力爆破(unforced Euler),再以此为跳板攻 NS
- 用 Codex 做"交叉授粉":整合各 agent 组的洞察,再喂回各组
- 总计 4.9M 条消息、3000 亿输出 token;其中 NS 本身 2.7M 消息、1300 亿 token
- 证明 + Lean 形式化验证又花 17 小时(GPT-6 Astra 做验证)
对比一下:Buckmaster 和 Alpöge 两个人、一年时间、自费科研经费。OpenAI 是 1 万个 agent、88 小时、3000 亿 token。 这不是"AI 比人快",这是工业化的数学研究——用算力把数学家一年的活压到 3 天半。
争议的核心:抢跑、署名、和一句"毁掉你的职业生涯"
Buckmaster 声明里的时间线(单方陈述,无录音,Bubeck 已否认):
- 9 月 3 日:外传"Anthropic 解决重大数学难题",Buckmaster 致信 OpenAI 数学家澄清
- 9 月 6 日(周日):两次通话。OpenAI 方告知"内部模型已生成约 100 页证明,宣称解出光滑外力的 NS 爆破"——但 Buckmaster 从未见过这份证明
- 让他警觉的是:OpenAI 走的技术路径,和他团队一直推进的路线完全一致(前人 Córdoba–Martínez-Zoroa 开辟的路线)
- OpenAI 提出两套发布方案,核心都是"把 Alpöge 排除出 NS 论文署名"(因为他是 Anthropic 员工)
- 他拒绝后,对方说:“你为什么要毁掉自己的职业生涯?”
- 他质问自己的 Codex 草稿是否被模型调阅/用于训练——对方否认主动检索,但未正面回答是否用于训练
Bubeck 公开否认:“始终恪守学术规范”,但没对署名要求、通话措辞逐条反驳。截至 9 月 8 日,OpenAI 声称的证明从未公开,学术界无法核验。
整件事的时间线,一张图看全:

一个更冷的问题:不可核验的证明,算证明吗
抛开狗血剧情,这场风波把三个本质问题摆上台面:
① 证明的"首发权"在 AI 时代怎么算? 以前是"谁先投稿谁先发表"。现在 OpenAI 用 3000 亿 token 的算力 88 小时跑完——它需要"首发权"吗?还是说,当证明的生产成本从"人年"变成"token 小时",数学界的荣誉体系整个失效?
② 数据边界:用户的草稿是不是训练数据? Buckmaster 的草稿存在 Codex 环境里。OpenAI 说"没主动检索",但"是否用于训练"没正面回答。你用 AI 工具写的未发表论文,会不会变成它的训练数据,然后它用它超越你? 这对每个用 AI 写代码、写论文的人是切身问题。
③ 机器证明和人类理解之间的鸿沟 陶哲轩评价 Buckmaster 团队的工作时强调:数学的核心价值不只是"命题成立",更是**“为什么成立”**。Lean 能验证逻辑链,但 1300 万行(费马)或 100 页(NS)的证明,人类读得懂吗?如果 AI 生成一个人类无法理解的正确证明,它还算数学吗?
和昨天费马大定理的区别,值得细品
昨天刚写了 Anthropic 的费马大定理(1300 万行 Lean、双内核验证、代码公开可核验)。对比今天这出戏:
| Anthropic 费马 | OpenAI NS | |
|---|---|---|
| 证明对象 | 已有证明的形式化(转写) | 声称的新证明(构造反例) |
| 公开性 | 代码全公开(Apache-2.0) | 证明未公开 |
| 争议 | 无 | 学术掠夺指控 |
| 验证 | 双内核(Lean + Rust nanoda) | 官方称 Lean 验证,未公开 |
同样是"AI 解数学题",一个开源透明、一个藏着掖着还卷进争议。这对比本身就是文章最好的注脚:AI 数学能力的上限不重要了,重要的是谁愿意让同行核验。
明天能做什么
- 读 Buckmaster 的声明原文:cims.nyu.edu/~tristanb/statement.pdf(四页,比任何二手报道都全)
- 看欧拉方程论文:cims.nyu.edu/~tristanb/euler.pdf(他公开的三篇之一)
- 盯 OpenAI 仓库:官方说证明在
github.com/openai/NavierStokesAndEuler——如果真公开了,第一时间核验它是不是"完整的证明"
一句话:OpenAI 说它用 1 万个 agent 和 3000 亿 token 解开了 90 年的难题,但全世界都没见过那份证明。数学史上第一次,“AI 证明"的可信度危机不是来自逻辑,而是来自发布机制。而当你能用 3000 亿 token 买到"首发权"时,数学界的规则可能真的需要重写了。
搬砖程序员带你飞,专注 Golang / AI / 后端。每天一篇,讲清楚一个技术真相。