关于 Navier–Stokes 千禧年大奖难题
On the Navier–Stokes Millennium Prize Problem
OpenAI 称解开 Navier–Stokes 千禧难题并附 Lean 证明,也讲了它眼中的优先权之争。
数学两边都经过 Lean 验证,可以独立复核。OpenAI 自己的叙述反而证实了对方的两点事实,在数据问题上措辞留有余地,对操守指控完全没提。分歧恰恰在操守,而这一层仍是一方陈述、另一方沉默。
怎么读这篇 OpenAI 官方发布,动机有两层:秀能力(「明显比 GPT-6 Astra 更强的内部模型」「已进入 AI 进步的下一阶段」),也在管理声誉。数学主张附了论文和 Lean 形式化,可以独立复核;争议部分是 OpenAI 自己的说法,对另一方声明里的具体操守指控只字未提。
需要记住的几件事
- OpenAI 称解开千禧难题并附 Lean 证明:约 1 万个 agent 跑了 88 小时,再用 17 小时验证。
- 争议在人不在数学。Euler 方程上 OpenAI 做无外力版本,对方做有外力版本,OpenAI 以此证明独立完成。
- 解是一个向内螺旋、被拉长成面条状的涡;难点在于加速度、压力梯度、动量输运、黏性同时变大,却要精确抵消。
- 两边都用 Lean 做最终裁判:有机器终审的领域,生成过程可以是黑箱,验证交给 Lean。
拆解 · 4 步
- 01
一个内部模型解开了 90 年的悬案
用了一个明显强于 GPT-6 Astra 的内部模型,同时公开证明文稿和 Lean 形式化。 读这一段原文 →
- 02
流体能在有限时间内自己「崩掉」
一开始光滑、静止的流体,施加光滑外力、能量始终有限,也能在有限时间内出现奇点,证明了 Clay 官方表述里的 C 和 D。 读这一段原文 →
- 03
听到传言起跑,上万个 agent 协同
9 月 1 日听到传言后启动,主攻的那组约 1 万个 agent 同时运行,用 Codex 汇总各组思路;88 小时出解,Astra 再用 17 小时完成验证。 读这一段原文 →
- 04
OpenAI 的说法:主动联系,承认对方优先
9 月 6 日完成后才得知对方做的是有外力的 Euler 方程,承认其优先权;数据问题上留了「不能排除去标识化数据」的余地。 读这一段原文 →
对 Rewired Index 意味着什么
两条读法:一是 AI 攻下千禧级数学难题的能力实证,指向 AI 做科研和形式化验证工具这条主题;二是 OpenAI 的声誉信号:它承认听到传言后才起跑,数据问题措辞留有余地,对操守指控保持沉默,既非全负,也不清白。
什么会让我改口
数学界判定证明 Clay 表述里的 C 和 D 不等于解决千禧难题,那这一击的能力分量要大幅下调。
OpenAI 官方发布,动机有两层:秀能力(「明显比 GPT-6 Astra 更强的内部模型」「已进入 AI 进步的下一阶段」),也在管理声誉。数学主张附了论文和 Lean 形式化,可以独立复核;争议部分是 OpenAI 自己的说法,对另一方声明里的具体操守指控只字未提。
一个内部模型解开了 90 年的悬案
用了一个明显强于 GPT-6 Astra 的内部模型,同时公开证明文稿和 Lean 形式化。
阅读论文Lean 形式化证明链接
我们正在公开一份对 Navier–Stokes 存在性与光滑性问题的解答,这是千禧年大奖难题之一。这份由 OpenAI 内部系统给出的证明表明,描述流体运动的 Navier–Stokes 方程的动力学可以在有限时间内产生奇点。我们同时公开证明的文字稿和一份 Lean 形式化。
千禧年大奖难题代表着数学前沿最深刻的一些问题。三维光滑流体运动是否会崩溃,这个问题悬而未决已约 90 年。
我们工作的一个主要目标,是让科学家有能力推进造福全人类的研究与技术。为解决 Navier–Stokes 问题,我们使用了一个能力显著强于 GPT‑6 Astra 的内部模型。我们认为,让世界了解 AI 进展的速度、以及对即将到来的模型该有怎样的预期,是很重要的。
问题
Navier–Stokes 方程用牛顿第二运动定律(“F=ma”)来描述流体如何运动。重要的是,它们把流体当作连续介质处理,而不是追踪单个分子。这些方程被用于飞机设计、天气预报和血流研究。
对这些动力学方程而言,一个根本性的未解问题是:流体的连续介质近似是否会失效。具体而言,对于密度恒定的三维不可压缩流体,即便运动起始时是光滑的,Navier–Stokes 方程是否会产生“奇点”?这里的奇点是指,动力学导致流体中的速度在有限时间内无界增长。这种奇点的产生必须在黏性存在的情况下发生,而黏性本身倾向于抹平运动。由于真实流体不可能以无限快的速度运动,这将标志着方程对流体的建模方式出现崩溃。要继续对该系统建模,人们就得逐个追踪每个粒子的行为。
这些方程可追溯到十九世纪 Claude-Louis Navier 与 George Gabriel Stokes 的工作。1934 年,Jean Leray 证明了广义意义下解的存在性,但它们是否始终保持光滑,成了一个核心的悬而未决的问题。2000 年,Clay Mathematics Institute 将 Navier–Stokes 存在性与光滑性问题列为七个千禧年大奖难题之一。
流体能在有限时间内自己「崩掉」
一开始光滑、静止的流体,施加光滑外力、能量始终有限,也能在有限时间内出现奇点,证明了 Clay 官方表述里的 C 和 D。
结果
我们的系统给出了一份解析证明和一份 Lean 形式化,表明一个初始光滑且静止的流体可以在有限时间内产生奇点。该流体受到一个光滑的外力作用,且从静止到奇点形成的整个动力学过程中,其能量始终保持有限。这通过确立官方千禧年大奖表述中的命题“C”(同时也包括“D”),解决了 Navier–Stokes 千禧年大奖难题。
这个解是一个涡旋——一团旋转的流体漩涡——它向内盘旋并不断被拉长,像意大利面一样。这一中心区域在收缩的同时加速,其方式使得能量仍保持有限,符合物理定律的要求。技术难点在于,方程必须通过流体自身的运动来产生这种崩溃,而不是比如说由我们人为地施加一个无限大的力。用更数学的说法:Navier–Stokes 方程中描述运动的各项——加速度、压力梯度、动量输运、黏性——必须既变得很大,又以精确的方式相互抵消。这种精细的平衡使得即便流体速度无界增长,外力仍保持光滑。
局部不可压缩运动的一个快照。橙色标示角向旋转较快之处;青色标示旋转较慢之处。环流速度还取决于半径。轨迹显示了向内的盘旋与沿轴向的拉伸。
听到传言起跑,上万个 agent 协同
9 月 1 日听到传言后启动,主攻的那组约 1 万个 agent 同时运行,用 Codex 汇总各组思路;88 小时出解,Astra 再用 17 小时完成验证。
我们如何找到这份证明
自 8 月 28 日起,我们一直在训练一个新的内部模型,它在我们的基准测试中(包括数学)展现出前所未有的表现。该模型的训练仍在进行,性能也在持续提升。
9 月 1 日星期二,我们听到传言称有两个千禧年大奖难题已被解决。受这些传言以及我们内部模型性能阶跃式提升的启发,我们启动了一项工作,用它来评测所有尚未解决的千禧年大奖难题以及另外几个高影响力问题。
我们使用了一套由内部模型驱动的协同智能体系统。这些智能体可以使用一些工具,比如读取互联网的缓存版本,以及运行代码。智能体被划分为若干组,组内可以互相通信。各组规模不一,产出 Navier–Stokes 解答的那一组涉及约 10,000 个并发智能体。在整个过程中,我们始终维持着与所有前沿模型评测相同的严格防护措施,包括监控与隔离。
对每个问题,我们用问题表述的不同变体去提示不同的智能体组,覆盖该问题的所有变体。对于 Navier–Stokes 问题,我们向不同的智能体组分别提出了版本“A”和“B”(Navier–Stokes 问题的特定形式,会导向一个证明)以及版本“C”和“D”(会导向一个否证)。
除了完整的千禧年大奖难题之外,我们还让多智能体系统尝试了一组“更容易”的问题。其中之一是去掉黏性项后 Navier–Stokes 问题极限情形下的类似爆破问题。这被称为 Euler 方程的正则性问题,而我们的智能体解决了这个问题,令我们颇为意外。它们解决的具体变体是无外力版本,即不对流体施加任何外力。近 100 个智能体协同工作了约 50 小时,产出了我们的 Euler 正则性否证。1
一看到 Euler 的解答,我们就认为 Navier–Stokes 是最有希望攻克的问题。于是,我们决定把资源投入到 Navier–Stokes 上。为此,我们把智能体从其他千禧年难题上撤下来,并用 Euler 的解答去提示这些智能体。当内部模型的进一步训练版本在这项工作过程中可用时,我们把智能体更新到了该模型。
我们鼓励不同的智能体组去探索多样化的路径。过了一段时间后,我们用 Codex 整合各智能体组中最有价值的洞见,实现了组间的交叉授粉。这些后续提示取材于智能体自身的中间结果。找到 Navier–Stokes 解答的那一组,正是以这种方式被引导的。
智能体在 9 月 5 日星期六得出了解答,距首批智能体启动约 88 小时。Lean 形式化与验证又经由 GPT‑6 Astra 花费了 17 小时。
在所有尝试过的问题上,智能体共发送了 490 万条消息,使用了约 3000 亿个输出 token。在解决 Navier–Stokes 问题的过程中,智能体发送了 270 万条消息,使用了约 1300 亿个输出 token。
OpenAI 的说法:主动联系,承认对方优先
9 月 6 日完成后才得知对方做的是有外力的 Euler 方程,承认其优先权;数据问题上留了「不能排除去标识化数据」的余地。
并行工作
我们的工作始于 9 月 1 日,起因是听到一则传言,后来我们才意识到它与 Anthropic 员工 Levent Alpöge 以及 NYU 数学教授 Tristan Buckmaster 有关。在整个项目和 Lean 验证完成之后(9 月 6 日),由于从传言中相信他们也有一份 Navier–Stokes 的解答,我们主动联系了他们,提出同步发布我们的结果,并在联合公告中承认他们的优先权。那时我们才得知,他们得到的是有外力 Euler 问题的解答。在这些交流中,我们提出让他们看到我们使用的全部提示,随后也可以看到证明本身。我们承认他们在有外力 Euler 问题上的工作优先权,并祝贺他们取得了这一非凡的数学成就。
在他们公开发布之前,我们(研究人员与智能体)没有通过任何途径看到他们的任何工作——特别是,为解决这个问题没有访问任何特定的用户数据。虽然可能性不大,但我们无法排除:源自他们使用我们产品的去标识化数据,可能帮助改进了我们的模型。不过,我们的证明差异显著,而且在 Euler 这一情形下,所证明的确切结果本身也不同(有外力对无外力)。
进展与责任
我们发布这一结果的目的,是报告我们 AI 模型的重大进展。我们无意为此结果申领千禧年大奖。
这一里程碑代表着数学家与 AI 研究人员的大量工作。然而,这并非终点,而只是 AI 发展进程中的一个时间切片。
我们相信,我们现在正处于 AI 进展的下一个阶段,而今天的结果为此提供了进一步的证据。我们正专注于理解这个模型,并用所学来帮助我们引导和把控进一步追求能力提升的节奏。我们的关键目标之一,是构建可引导、可问责、与人相连的 AI 系统,这可能需要在进展节奏上做出更审慎的选择,同时我们将继续践行确保 AGI 造福全人类的使命。
Indigo 的结论
数学两边都经过 Lean 验证,可以独立复核。OpenAI 自己的叙述反而证实了对方的两点事实,在数据问题上措辞留有余地,对操守指控完全没提。分歧恰恰在操守,而这一层仍是一方陈述、另一方沉默。
需要记住的几件事
- OpenAI 称解开千禧难题并附 Lean 证明:约 1 万个 agent 跑了 88 小时,再用 17 小时验证。
- 争议在人不在数学。Euler 方程上 OpenAI 做无外力版本,对方做有外力版本,OpenAI 以此证明独立完成。
- 解是一个向内螺旋、被拉长成面条状的涡;难点在于加速度、压力梯度、动量输运、黏性同时变大,却要精确抵消。
- 两边都用 Lean 做最终裁判:有机器终审的领域,生成过程可以是黑箱,验证交给 Lean。
放回主线
可验证域能否泛化 攻下千禧难题和无外力 Euler,是这条判断在数学上的最高点;但「算不算公认解决」本身就是边界测试。
验证不可压缩:瓶颈·护城河·断点 有机器终审时,验证由 Lean 承担,生成可以是黑箱;接上费马大定理那篇的结论。
人事就是路线图:Anthropic 在收窄下注 优先权和叙事之争、抢发节奏、对操守指控的沉默:前沿竞赛强度和行业规范的又一个数据点,争议未解。
Buckmaster 声明:LLM 助推流体 PDE 新 blowup,含 3D Euler 同一事件的两面:那篇是学者一方的一手陈述,这篇是 OpenAI 的官方版本,必须对照读。
Anthropic:Claude 把费马大定理形式化进 Lean 三篇同期出现,一起证实:在有 Lean 的数学领域,生成和验证两头都被 AI 拿下了。
Jakub Pachocki《An Alien Mind》 同一周、同一家公司的两篇,放在一起读,才看得出节奏上的矛盾。
对 Rewired Index 意味着什么
两条读法:一是 AI 攻下千禧级数学难题的能力实证,指向 AI 做科研和形式化验证工具这条主题;二是 OpenAI 的声誉信号:它承认听到传言后才起跑,数据问题措辞留有余地,对操守指控保持沉默,既非全负,也不清白。
什么会让我改口
数学界判定证明 Clay 表述里的 C 和 D 不等于解决千禧难题,那这一击的能力分量要大幅下调。
读完了。Indigo 对这篇的判断在这两处: