首页 > 资讯 > OpenAI一夜甩出722篇数学论文!黎曼霍奇BSD全上阵,数学家:读不过来

OpenAI一夜甩出722篇数学论文!黎曼霍奇BSD全上阵,数学家:读不过来

量子位 2026-10-07 09:05 4 阅读 查看原文

听雨 发自 凹非寺
量子位 | 公众号 QbitAI

刚刚,OpenAI往数学界扔了颗重磅炸弹——

一口气公开722篇数学手稿,全部出自一个还没发布的内部模型。

这些手稿归成372组结果。据OpenAI介绍,模型此前一共尝试了约4000个研究问题,平均每项结果消耗的算力,约相当于ChatGPT Pro思考3小时。

论文、源码、部分Lean证明,被一股脑传上了GitHub。

翻开目录,准黎曼猜想、霍奇猜想、BSD猜想、π的无理性指数……一个比一个名头大。

光是千禧难题,就沾上了三道。

再往下翻,还有自旋玻璃、量子磁性、自由群因子、相对论性弗拉索夫—麦克斯韦方程……数论、代数几何、理论计算机、统计力学,17个方向铺得满满当当。

一夜之间,数学论文堆成了山。

数学家们看了直呼:这谁读得完啊……

722篇手稿里,究竟写了什么?

点开GitHub仓库,先看到一份巨巨巨长的目录。

有的组只有一篇主论文,有的还附了另一种证明、相关推论。除了论文PDF和源码,仓库里还有10份模型推理摘要。

最抢眼的,恐怕是第003组:「准黎曼猜想」。

黎曼猜想要证明,黎曼ζ函数的非平凡零点全都落在实部为1/2的直线上。

OpenAI给出的结论是:ζ函数和所有狄利克雷L函数,在实部大于7/8的区域都没有零点。

这个结论有多猛?

此前,数学家连「实部大于0.99的一整条竖带里没有零点」都证不出来,已知的无零点区域,只是贴着实部=1的边缘越收越窄。

也就是说,它声称一口气把零点可能出现的范围往中间推了一大截。当然,离黎曼猜想要求的那条1/2直线,还有距离。

而且同组里还不止一份证明。另一份独立证明给出的是实部大于11/12的版本,范围稍窄,但多带了一个结论:一致排除「西格尔零点」。

西格尔零点,指的是某些L函数可能藏在实数1附近的“捣乱零点”。它们是否存在,困扰了数论学家近百年,许多关于素数分布的结果,都得绕开它们写。

紧接着是第004组,有理数域上的希尔伯特第十问题:

拿到一个整数系数的多项式,能否写出一套通用算法,判断它有没有有理数解?

OpenAI给出的结论是,这样的算法不存在。

这道题的整数版本,1970年就由苏联数学家马季亚谢维奇最终解决;有理数版本却悬了半个多世纪。

再来是另一道千禧难题:伯奇和斯温纳顿-戴尔猜想,也就是BSD猜想。

它把椭圆曲线上有理点的情况,和一个相关函数在特定位置的表现联系起来。

OpenAI声称,针对满足Selmer余秩为0或1等条件的椭圆曲线,得到了完整公式;再结合仓库里的另一组结果,按密度统计,可覆盖每条有理数域上椭圆曲线的绝大多数二次扭曲。

第三道千禧难题,是霍奇猜想。

这道题关心的是,一类复杂几何空间里看得见的「形状信息」,能否由代数方程定义出的几何对象来解释。

OpenAI这组手稿处理的是两类对象:具有特殊复乘结构的阿贝尔簇,以及K3曲面的乘积。

其中关于复乘阿贝尔簇的论文,声称覆盖了这一类对象的所有维度和余维。不过霍奇猜想涉及的几何空间要广得多,这批论文目前只覆盖上述范围。

另外,还有两个看着像中学数学、实际困扰了许多年的常数问题。

一篇论文声称证明,π的无理性指数恰好是2。

问题在于:用分数逼近π,到底能逼近得多准?

此前最好的结果,只能把这个指数压到7.1左右,现在直接压到了理论最优值2。

另一篇声称证明,卡塔兰常数是无理数。π是无理数早有定论;卡塔兰常数究竟是不是无理数,此前一直没有公认的证明。

理论计算机科学那边,还有第102组的唯一游戏猜想。

这道题牵着一串问题:有些复杂的优化任务,算法究竟能把答案逼近到什么程度?

这个猜想2002年由Khot提出,2018年数学家证明了它的一个弱化版本,完整版一直没拿下。

OpenAI在目录中声称证明了这一猜想,还给出了最大割、顶点覆盖等问题的近似难度结论。

再往下翻,画风越来越稀奇古怪……

稀疏自旋玻璃的梅扎尔—帕里西公式、量子海森堡铁磁体的自发磁化、自由群因子同构,以及三维单种粒子相对论性弗拉索夫—麦克斯韦方程的整体光滑解,都出现在结果目录里。

值得注意的是,OpenAI表示,平均每项结果消耗的算力约相当于ChatGPT Pro思考3小时。

仓库也交代了:绝大多数结果,都是同一个未发布的内部模型按同一套固定流程跑出来的。

但有两项是例外——黎曼ζ函数的无零点区域,以及复乘阿贝尔簇上的霍奇猜想,没有完全走这套固定流程。

其中,黎曼ζ函数实部大于11/12的那篇证明,文稿还经过了人工编辑,以便读者阅读。

仓库也写明了,这些手稿的核验进度各不相同,部分成果还没有Lean形式化证明。

数学家:No No No!几百篇手稿谁来读啊…

OpenAI一口气发了几百篇数学论文,数学界看起来可不怎么买帐。

722篇手稿刚上线,由九位学者组成的独立数学与AI顾问组就发了声明。

这个顾问组来头不小,里面有三位菲尔兹奖得主:

Timothy Gowers、Martin Hairer,以及理论物理学家Edward Witten。

他们承认,这是数学界的一件大事。但他们同时表示:顾问组此前给OpenAI提过建议,不代表他们已经认可这些结果,也不代表他们认可OpenAI产出成果的过程。

证明是否成立、对后续研究有多大用处,要交给各领域的数学家慢慢消化。

手稿发布前,得克萨斯大学奥斯汀分校数学家Francesco Maggi就在社媒上发问:

9月那篇流体力学证明,专家们至今还在研究它究竟怎么起作用;

一下再来数百篇,谁有精力读?读完以后,又能从中发现什么新方法、新问题?

Maggi的态度很有代表性。他并不反对用AI做数学,但他担心的是,结果产出的速度已经远远超过了人类能理解的速度,数学家只能在后面追着AI跑。

其实,这批手稿发布前,OpenAI也找数学家专门喝过茶,试图做做工作。

据WIRED消息,8月,OpenAI召集约40名数学家,讨论成果该怎么发布。

西北大学数学家Bryna Kra等人希望看到写得清楚、能让同行阅读和引用的论文。

部分与会者称,他们当时以为OpenAI不会一次放出所有成果;OpenAI发言人则表示,公司不清楚有过这样的承诺。

9月的流体力学争议,又让气氛变得更紧张。

当时,NYU数学家Tristan Buckmaster与Anthropic研究员Levent Alpöge公开了三篇流体方程爆破证明,同样配有Lean形式化。

几乎同一时间,OpenAI发布了纳维–斯托克斯证明。

Buckmaster表示,原本想再花时间把证明写得好读一些,最终因外部压力提前发布。

随后,Buckmaster一方与OpenAI围绕研究进度和成果归属起了争执,双方拿出了相近/相同的结果,而OpenAI否认Buckmaster此前使用Codex时的提示词影响了自己的模型。

就连曾经最爱AI、逢人就安利AI工具的陶哲轩,也忍不住踩刹车了。

9月,他在加州理工的一场演讲中说,AI发展的速度「太疯狂了」,没有理由这么快!

AI公司简直就跟疯了一样。

菲尔兹奖得主Cédric Villani,在看到OpenAI拿下千禧难题之一的纳维–斯托克斯方程后,也直接瘫软了。。。

我大受震撼……

简直跟世界末日一样,这是数学界有史以来从未见过的浩劫。

到了这次发布,OpenAI把论文、部分Lean证明和推理摘要统统放进了仓库,还表示会出资办研讨会,帮助数学界研究这些成果。

顾问组的回应则是:材料公开了,接下来该由数学家检查、讲解,再决定哪些结果真正能进入数学研究。

OpenAI已经交卷了,但数学界的阅卷才刚开始…

One More Thing

与此同时,OpenAI的「28天挑战赛」也来到了Day 2。

此前赛博义父Tibo放话:

接下来28天,每天都要给Codex或Work用户带来一项明显改进;哪天没交出来,就重置用户的使用额度。

第二天总共发布了4项更新:

其中最容易感受到的是Auto-review:Codex执行长任务时,可以让另一个AI代理检查它准备采取的操作,替用户拦下高风险动作。

现在,通过ChatGPT账号登录的用户使用这一功能,不再消耗套餐额度。

另外三项分别面向开发和日常办公:

API付费档位从五档简化为三档;

Meetings插件可把会议整理成纪要和待办;

供开发者调用的Decisions API开放公测。

参考链接:
[1]https://openai.com/index/sharing-ai-progress-in-mathematics/
[2]https://github.com/openai/math
[3]https://agmai.org/
[4]https://x.com/thsottiaux/status/2107575657014468879