90 年没人解开的数学题,1 万个 AI 用 88 小时做完了

90 年没人解开的数学题,1 万个 AI 用 88 小时做完了

数学界有一份名单,挂着七个问题,每个悬赏 100 万美元。

叫千禧年大奖难题,2000 年挂出,七个题里至今只有一个人交卷成功——佩雷尔曼的庞加莱猜想,那哥们儿连奖都没去领。

9 月 8 日,OpenAI 宣布:其中那道流体方程题,被他们家的 AI 做出来了。悬了差不多 90 年。

OpenAI 官方发布的奇点可视化图:向内螺旋 + 轴向拉伸

先说做的是道什么题

纳维-斯托克斯方程(Navier-Stokes),描述流体运动的方程组。你家的水管、天上的台风、飞机的机翼、你血管里的血,全归它管。

这方程 1822 年就有了,工程师天天用,好用得很。

但数学家卡在一个问题上:这个方程的解,会不会在某一个时刻突然"炸掉"?——流速在有限时间内变成无穷大,方程自己崩溃。

Clay 研究所 2000 年把这个问题挂出来:要么证明解永远光滑,要么找出一个"炸掉"的反例。谁行,100 万美元。

90 年来,无数数学家冲上去,全部败退。

OpenAI 的答案走的是第二条路:他们构造了一个解——一团初始静止、受力光滑的流体,在有限时间内发展出无穷大的速度。论文标题就叫《FINITE TIME BLOWUP FOR NAVIER-STOKES》,165 页,作者署名俩词:OPENAI。

证明论文首页(节选自 官方 PDF,共 165 页,作者署名 OPENAI)

88 小时,1 万个 Agent,1300 亿 token

真正值得咂摸的不是题目,是干活的配置。

OpenAI 用的模型还没发布,官方口径是"显著强于 GPT-6 Astra"。强多少?看内部基准:同一批数学开放难题,Astra 能解出约 10%,这个未发布模型能解出约 50%。一步函数式的跳变。

干活方式更值得注意——不是一个大模型憋大招,而是:

  • 约 10000 个 Agent 同时开工,互相协作
  • 持续 88 小时
  • 交换了 270 万条消息
  • 产出 1300 亿 token
  • 算力成本数百万美元——TechCrunch 按 Astra 牌价折算,整个一周攻关的 3000 亿 token 约合 2250 万美元
  • 最后 GPT-6 Astra 花了 17 小时验证通过

OpenAI 研究员 Ethan Knight 的说法是:这批 Agent 通过"多智能体强化学习"训练了整整一年,学会了自主分工协作——不是人给它们派活,是模型自己决定怎么组织

这跟过去"AI 帮数学家找反例、猜思路"的辅助定位完全是两码事。这是 AI 第一次独立拿下人类顶尖数学难题的完整证明,外加一份 Lean 形式化版本——用另一种严格语言重写了一遍,让计算机逐行验证逻辑无误。

但是,数学圈炸锅了

发布当天,NYU 数学家 Tristan Buckmaster 先一步放出了自己的声明——他和 Anthropic 的研究员 Levent Alpöge 用 Codex 和 Claude 也做出了几乎同一个方向的结果,只是没有完整证明。

时间线上微妙的地方在于:这两人的工作进展,曾经存在 OpenAI 的 Codex 服务器里。

Buckmaster 的原话说得很克制:"我不知道他们的模型做了什么、怎么做的。我不知道我们的数据有没有被用。我不指控任何人。"

但他把丑话说在了前面:OpenAI 的研究员 Sebastien Bubeck 曾给过一个"交易"——方案一:Buckmaster 先发表部分成果,OpenAI 第二天宣布完整解,并注明两人是"离这道题最近的人类"。方案二的细节他没有公开,只说那是声明里他最不愿提起的部分——Fortune 报道标题里"作弊"与"要挟"两个词,正出自他的指控。

OpenAI 的回应是:在两人公开发布之前,任何研究员和 Agent 都没看过他们的工作;但也承认无法排除——他们俩使用产品产生的去标识化数据,可能参与改进了模型。两个证明的具体构造和结果(Euler 情形的有力/无力)也存在实质差异。

连圈内顶流陶哲轩都下场了,感慨 AI 公司把数学界的百年难题当成自家模型能力的营销素材——这话是说给谁听的,不言自明。

三笔账,算清楚再兴奋

第一笔:这不是"领奖"的证明。

Clay 研究所的规则:解法必须在同行评审期刊发表,且被数学界接受满两年,才会启动评审程序。所长 Martin Bridson 对媒体的表态滴水不漏:"评估过程刻意从容,我们将确保它绝对严格。"翻译一下:不急,慢慢查。OpenAI 自己也说不要这 100 万美元。所以严格来说,现在是"OpenAI 宣称解出",不是"人类确认解出"。

第二笔:10000 个 Agent 是奇迹,也是惊悚片。

7 月 OpenAI 刚披露过一场事故:一批 Agent 在网络安全测试中自己黑进了 Hugging Face。这次公布 Navier-Stokes 成果时,官方特意强调"全程维持最严格的监控和隔离"——你品品,为什么特意强调。上一周美国参议员还在推动立法永久禁止"超级智能"研发。在这个当口甩出"1 万个 Agent 自组织攻克 90 年难题",安全社区读到的可不是喜报。

第三笔:发布时机,妙到毫巅。

9 月 1 日,OpenAI 听到"两个千禧年难题被解出"的风声,随即立项攻关;8 日官宣。同期,Cognition 刚完成 480 亿美元融资、Mistral 刚完成 240 亿。一篇数学突破官宣,全世界的科技头条都在帮你讲"AI 进步神速"的故事。市值要冲万亿的公司,深谙注意力经济学。

这事真正的含义

剥掉争议,回到技术本身:"海量并行测试时算力 + 模型自组织"这条路,第一次在最硬的验证场——数学——跑通了。

过去堆算力是让模型"想得更久",这次是让一万个小模型"一起想"。如果 88 小时能换一个 90 年难题,那这个配方对物理、材料、药物设计的意义,怎么估都不过分。

但另一面同样真实:当"AI 做出人类百年难题"和"AI 可能看了竞争对手存在自家服务器里的工作"出现在同一条新闻里,科学界需要的不只是 Lean 验证器,还有一套 AI 时代的学术信用规则——训练数据边界、信用归属、发布伦理,现在全是空白。

数学界等 90 年等来了一个解。科学界可能需要再等很多年,才等来配套的规则。


相关链接:

评论

暂无评论。

登录后可发表评论。