OpenAI 于 2026 年 8 月 1 日投下一枚重磅消息:其未公开的下一代模型家族 Astra,声称解决了数学与理论计算机科学领域 10 项长期开放问题,并同步发布 249 页技术手稿与可通过 Lean 形式化验证的机器可检查证明。这是继 2026 年 5 月由未发布模型推翻 Erdős 单位距离猜想之后,OpenAI 在数学推理赛道上的又一次高调出击——而这一次,它把“可验证性”直接写进了发布物的核心。
一、事件速览:一次带证明的“论文式发布”
与以往“模型刷榜”式的公告不同,Astra 的这次发布带有完整的学术载体:249 页技术手稿、62 页解题思路说明,以及一个公开的 Lean 4 证书仓库(Apache 2.0 许可)。报告称所有 Lean 文件中的 sorry 计数为 0——即形式化证明中没有“承诺稍后填补”的占位空缺。按照 GPT-5.6 Sol API 费率估算,找到这些解的推理 token 成本约为 2000 美元。
十项成果横跨多个领域,既有对命名猜想的彻底解决或反驳,也有对已知界限的显著改进。群论方面,模型显式构造了非 sofic 群,否定了 Gromov 1999 年提出的“所有可数群都是 sofic 群”猜想;算子代数方面,它推翻了 Connes 刚性猜想,构造出无限多彼此不同构却共享同一冯·诺依曼代数的群。高维几何方面,球体堆积密度的新上界逼近 Cohn–Elkies 阈值,被认为是 1978 年以来对一般堆积指数的首次改进;拉姆齐理论方面,多色三角形拉姆齐数的超指数下界解决了 Erdős 第 183 号问题;量子复杂度方面,一般双人量子博弈的指数级并行重复定理让人眼前一亮。此外,编码理论、算术电路复杂性、格密码学、凸几何与极值图论也各有斩获,其中 Ehrhart 体积猜想的证明与 Erdős 第 146、180 号问题的解决,让这份成绩单显得分量十足。
二、Lean 形式化验证:与以往 AI 数学成果的真正分水岭
为什么这次发布被数学界视为“真正的不同”?关键在于 Lean。Lean 是证明辅助器,其内核对每一步逻辑做严格检查,要么接受、要么拒绝,不依赖对人的信任。sorry 计数为 0,意味着形式化证明中没有未填补的逻辑空缺;任何人安装 Lean 编译器与 mathlib,即可独立重编译全部证书,无需信任 OpenAI 的任何说辞。
这带来一个此前 AI 数学成果从未具备的特性:把“证明是否有逻辑漏洞”这一类质疑,从口头争辩变成了可机器判定的问题。过去一个 AI 声称解出的定理,人类数学家需要逐行审阅、反复推敲;而现在,Astra 的形式化证书可以被任何第三方快速重编译验证,争议焦点被精准收窄到“形式化陈述是否等价于原命题”“结果是否新颖且重要”这两个层面。
三、冷静审视:光环之下的五个边界
然而,数学界与业界的反应在兴奋中保留了明显的克制。第一,Astra 是内部研究系统,模型本身未公开发布,外界无法复现发现流程,控制着模型、评测与叙事的仍是 OpenAI 一方。第二,截至发布时,十项结果均未经独立专家正式评审,数学意义仍需专业判断。第三,“2000 美元”只是成功案例的推理成本,不含训练、人类整理与失败尝试的花费——没有分母的成本不能代表研究总成本。第四,十项成果中约一半是“解决或反驳命名猜想”,另一半则是“改进已知界限”,后者是真实贡献,但并非完全解决;球体堆积并未给出最优密度,积和式下界也未触及 P 与 NP 的核心问题。第五,Lean 只证明“写在 Lean 里的陈述在其公理下成立”,并不保证与手稿中的自然语言定理逐字对应——决定性的一步仍需外部团队独立重建并核对定义。
尤其值得留意的是历史先例的阴影:2025 年 10 月,OpenAI 高管曾虚假声称 GPT-5 解决 10 个 Erdős 问题,被数据库维护者驳斥后删除。本次各方反应明显谨慎,但也提醒我们:对单一来源的重大宣称,保持审视永远必要。
四、可验证推理对 AI 可靠性的深远意义
抛开具体成果不论,Astra 事件最大的行业价值,是把“可验证推理”从学术概念推到了产业前台。长期以来,大模型的可靠性短板集中在“幻觉”——模型给出自信满满的错误答案,却无法自我识别。可验证推理提供了一条截然不同的路径:让模型在形式化系统内推理,使每一步结论都能被机器严格检查。在数学与程序验证这类规则完备的领域,这相当于给 AI 装上了一台“正确性检测仪”,从根本上压缩幻觉的生存空间。
更重要的是,它重塑了“信任”的获取方式。传统上,用户信任 AI 要么依赖厂商声誉,要么依赖人工抽查;而 Lean 证书让信任变成了“可独立重编译”的工程事实——任何人都能验证,无需信任任何一方。这种“不信任前提下的可验证”模式,正是可靠 AI 基础设施的应有形态。当然,边界同样清晰:数学与形式系统的规则是封闭的,而现实世界的开放性问题没有这种完备公理;可验证推理解决的是“在规则内保证正确”,而非“对复杂现实做出正确判断”。因此,务实的判断是:Astra 证明了可验证推理可以让 AI 在严谨领域做到“可审计的正确”,但要让它惠及医疗、法律、金融等现实场景,还需要把现实约束形式化,这条路依然漫长。
五、结语
Astra 的十项成果、249 页手稿与零 sorry 的 Lean 证书,无论最终通过多少项独立验证,都已经完成了一次方法论示范:AI 的数学能力可以以机器可检查的形式呈现,AI 的宣称可以不必依赖厂商的自证。对于 AI 行业而言,这比任何 benchmark 数字都更有分量——当“正确”可以被验证,AI 才真正开始配得上“可靠”二字。下一步值得关注的是:外部团队能否独立重建仓库、逐项核对形式化定义与原创问题的一致性,以及任一结果能否通过期刊接受。那将是把“突破”二字坐实的真正里程碑。
本文仅代表作者个人观点(仅供参考) 来源:创客OPC原创整理