AI Price MemoryAI Price Memory
经验博文

722 篇数学手稿、3 个千禧年难题:OpenAI 内部模型的“数学大跃进”,数学家却在呼吁抵制

内部模型被曝显著强于未发布的 GPT-6 Astra,但只有约 42% 的证明经过机器验证——AI 会做数学了,却还没学会让人相信。

原作者: AI Price Memory
11 次浏览
0 次复制
适用模型: GPT-6 Astra / OpenAI 内部前沿模型

先说结论

  • OpenAI 在 GitHub 公开了 722 篇 AI 生成的数学手稿,覆盖 372 个开放问题家族,号称在黎曼猜想等多个千禧年难题方向上取得进展——这是 AI 史上最大规模的一次数学成果倾倒。
  • 幕后是一个从未公开的内部前沿模型,OpenAI 官方称它"显著强于 GPT-6 Astra"(就是 9 月底因安全问题被搁置发布的那款)。
  • 每篇成果背后约 4000 道题的评估、每题相当于 ChatGPT Pro 思考 3 小时的算力——科研级 AI 推理的成本尺度第一次被摆上台面。
  • 但数学界炸了:菲尔兹奖得主联署声明、数学家协会呼吁抵制,3 篇论文上线一天就被撤回,只有约 42% 的证明经过 Lean 机器验证。
  • 对模型用户来说,真正的看点不是"AI 证明了什么",而是可验证性正在成为 AI 科研能力的唯一信任锚——以及 OpenAI 下一代模型的真实水位线。

OpenAI

一周到底发生了什么:一份时间线

这场风波不是一天爆发的。从 9 月初 OpenAI 宣称攻克千禧年难题,到 10 月初 722 篇手稿倾泻而出,再到数学家组织公开呼吁抵制,整整一个月,AI 与数学的关系被彻底改写。

日期事件来源
2026-09-08OpenAI 宣称约 1 万个协作智能体在 88 小时内解决了 Navier-Stokes 存在性与光滑性问题(七大千禧年难题之一)BBC、Nature、Science 等多家报道
2026-09-08数学家 Tristan Buckmaster 称,他与 Levent Alpöge 关于 Euler 方程的进展在 OpenAI 宣布前约 12 小时已公开,质疑成果来源Wikipedia 引 Mastodon 公开记录
2026-09-1128 位菲尔兹奖得主联署声明《A Severe Misalignment of AI in Mathematics》,警告 AI 公司把未解难题当 benchmark 会损害数学本身Zenodo 公开文档
2026-09-29普林斯顿高等研究院的数学与 AI 咨询组(AGMAI,成员包括 Timothy Gowers、Edward Witten)发布负责任披露建议tech-insider 整理
2026-10-06OpenAI 在 GitHub 仓库 openai/math 公开 722 篇手稿、372 个问题家族The Verge、NYT、New Scientist
2026-10-09Association for Human Mathematics(人类数学协会)呼吁研究者停止与 OpenAI 合作,抵制其科研方式madhyamamonline 报道

722 篇手稿里到底有什么

先看硬数字(综合多家媒体报道交叉核对):

  • 722 篇手稿,归入 372 个"问题家族":每个家族包含主要发现,外加推论、替代证明策略等配套论证。领域横跨代数、数论、理论计算机科学、数理逻辑、拓扑学。
  • 约 4000 道数学题的评估规模:平均每项成果消耗的算力,相当于 ChatGPT Pro 连续"思考"约 3 小时。粗算一下:4000 × 3 小时 Pro 级推理——这是科研级模型评估第一次以"Pro 小时"为单位被公开讨论。
  • 只有约 42% 的证明完成了 Lean 形式化:Lean 是一种能让计算机逐行验证证明的语言。OpenAI 承认未形式化的结果可能包含错误。另据报道,仅约 10 篇手稿附带了模型的推理过程摘要。
  • 3 篇论文在上线一天内被撤回:OpenAI 的研究人员自己承认,发布时根本没读完所有论文。

具体宣称的进展包括 Unique Games 猜想、有理数域上的 Hilbert 第十问题、Hadwiger 猜想、Landau–Siegel 零点(与素数分布相关)、Penrose 不等式(黑洞质量与视界面积的关系)、Bose-Einstein 凝聚的数学解释、二维纠缠面积律,以及代数几何中的丰沛猜想。有报道称其中涉及三个尚未解决的千禧年难题方向,包括大名鼎鼎的黎曼猜想。

Navier-Stokes 方程与流体模拟

那个"内部模型"到底有多强

OpenAI 在文档中把生成这些成果的模型描述为**"显著强于 GPT-6 Astra"**,且训练仍在继续。这个细节值得玩味:

  1. GPT-6 Astra 是什么:OpenAI 原计划 2026 年 10 月发布的下一代旗舰,9 月 28 日路透社报道称因内部安全评审未达标被搁置。也就是说,用户至今还没用上 Astra,而 OpenAI 已经拿出了一个"比 Astra 更强"的内部模型在内部跑数学。
  2. 基准测试已经不够用了:公开推理榜单(如 LMArena)测试的是有标准答案的题目,而开放数学研究没有答案可对。OpenAI 这次等于宣布:前沿模型的竞技场正在从"刷榜"转向"做科研"。
  3. 算力即门槛:4000 道题 × 3 小时 Pro 级思考,这种量级的评估只有顶级实验室玩得起。数学家协会的批评之一正是:先进 AI 与算力的不平等获取,正在加剧学术界的分化——大公司的研究者天然占优。

对订阅用户来说,这释放了一个信号:OpenAI 的模型管线里憋着比 Astra 更强的东西。当 Astra 最终(如果)发布时,它的推理能力上限可能远超我们现在的预期。

为什么数学家愤怒:信任危机比成果更大

成果规模越大,学术界的反弹越激烈。批评集中在四个层面:

第一,署名与优先权争议。 Navier-Stokes 声明前约 12 小时,Buckmaster 就公开了他与 Alpöge 的相关进展,并质疑自己的工作是否"启发"了 OpenAI 智能体的提示词。OpenAI 则称 9 月 1 日就已启动对所有千禧年难题的大规模攻关——时间线至今说不清。

第二,发布方式。 28 位菲尔兹奖得主 9 月 11 日的联署声明措辞严厉:AI 公司把未解难题当作 benchmark 来刷,却没有增进人类的理解。哈佛数学家 Michael Douglas 倒是持乐观态度,称这是"数学与数学物理新纪元开始的一天"——学界内部本身也是分裂的。

第三,可验证性赤字。 MIT 的 Andrew Sutherland 直言:在模型公开、可复现之前,任何"单智能体一次搞定难题"的说法都应视为未经证实。Terence Tao 的批评更扎心:这些问题是被"对更广阔领域毫无兴趣的 AI 提示者"解决的——解出来了,但没人能讲课、没人能回答追问。

第四,流程合规性质疑。 数学家协会指责 OpenAI 无视了 AGMAI 的建议(该建议第一条就是"停止在专有模型上测试前沿数学问题"),且发布规模本身更像"秀肌肉"而非学术贡献。OpenAI 则辩称已咨询该委员会并遵循了建议。

Lean 定理证明器

关键变量:Lean 形式化是唯一的"信任锚"

在这场争议里,有一个技术细节决定了整件事的含金量:Lean 形式化。

Lean 是一种定理证明语言,能把数学论证变成计算机可逐行验证的形式代码。没有形式化,AI 的数学断言就和普通大模型的"一本正经胡说八道"处于同一信任等级——接近于零。有形式化,至少"证明链条机器可查"。

OpenAI 这次约 42% 的形式化率,恰恰说明了现状:AI 生成证明的速度,已经超过了人类(和机器)验证的速度。这对所有想用 AI 做科研、做代码验证、做金融建模的用户都是一个提醒:

提示词 / 指令
AI 输出的可信度 = 生成能力 × 可验证性
生成能力 ↑↑↑(722 篇手稿)
可验证性 →(42% Lean 覆盖,3 篇一日撤回)

以后评估一个"科研型 AI 模型",先问它的输出能不能被机器独立验证,再问它解出了多少难题。这个公式同样适用于代码生成:能跑过测试的 AI 代码,和"看起来对"的 AI 代码,是两种完全不同的资产。

对 AI 模型用户意味着什么

  1. 下一代模型的能力水位:内部模型显著强于未发布的 GPT-6 Astra,意味着 OpenAI 的推理上限还在快速抬升。等 Astra(或其继任者)真正发布时,"Pro 级思考 3 小时"这种量级的推理可能变成可购买的商品。
  2. 科研助手进入"可验证"时代:如果你用 AI 辅助数学、物理、算法研究,从现在起要养成习惯——要求 AI 给出 Lean/机器可检的证明,或至少可执行的验证脚本。不可验证的 AI 结论,引用前请三思。
  3. 成本视角:4000 题 × 3 Pro 小时的评估账单,暗示了前沿推理能力的真实成本。当这类能力产品化时,定价大概率向"按思考量计费"倾斜——订阅制"包月随便用"的终结(本站 10 月 6 日晚间文章已分析过 ChatGPT Pro 额度调整)正在被技术趋势印证。
  4. 学术合作的摩擦:数学家协会的抵制呼吁短期内影响有限,但它标志着 AI 实验室与学术共同体的蜜月期结束。做 AI for Science 的团队,提前规划"人类可理解的成果交付"(推理摘要、可讲、可复现),会比单纯堆 benchmark 分数更重要。

一句话总结

OpenAI 用 722 篇手稿证明了 AI 已经能"做数学",却还没证明它能"让人相信"——在形式化验证追上生成速度之前,最强的模型也只是最会出题的考生,而不是能发证的考官。


来源链接

  • Wikipedia: OpenAI bulk release of mathematical papers — https://en.wikipedia.org/wiki/OpenAI_bulk_release_of_mathematical_papers
  • tech-insider: OpenAI Releases 722 Math Manuscripts From Secret Model — https://tech-insider.org/openai-722-math-manuscripts-unreleased-model-2026/
  • techjuice.pk: OpenAI Publishes Biggest AI Math Dump to Date — https://www.techjuice.pk/openai-722-math-manuscripts-frontier-model/
  • madhyamamonline: ChatGPT solves 377 math problems; Mathematicians call for boycott — https://madhyamamonline.com/technology/chatgpt-solves-377-math-problems-mathematicians-call-for-boycott-1561931
  • theoutpost.ai: OpenAI AI-Generated Math Proofs Face Scrutiny from Experts — https://theoutpost.ai/news-story/openai-releases-377-ai-generated-mathematical-results-tackles-unsolved-problems-31910/
  • Reuters: Anthropic launches third Claude 5.5 model(价格交叉参考)— https://www.reuters.com/business/anthropic-launches-third-claude-55-model-expanding-ai-lineup-before-planned-ipo-2026-10-07/