(本文作者为 字母AI,钛媒体经授权发布)
文 | 字母AI
2026年菲尔兹奖得主王虹,靠着三维挂谷集猜想的证明,拿下了数学界的最高荣誉。这道横跨百年的几何难题,在她手中实现了从二维到三维的历史性跨越,也成为近十年最重磅的数学突破。
而就在短短三个月后,OpenAI直接将这项研究往前推进了一大步:它不仅解决了难度更高的三维挂谷极大函数猜想,还首次证出四维挂谷集的豪斯多夫维数等于4,把人类此前卡在3.059维的最佳纪录推上了一个维度,达到了理论上限。
然而这还只是OpenAI挑战数学界的冰山一角。
这一次,OpenAI一口气放出722篇数学手稿,归为372个成果族,覆盖的领域远不止挂谷问题,还包括准黎曼假设、希尔伯特第十问题、卡塔兰常数相关问题等数十个困扰学界多年的经典难题,所有内容全部出自一个连名称都没有公开的内部模型,每个问题平均花费仅为3个小时。
OpenAI将这些手稿发布到了GitHub,上线不到24小时,就收获了1万颗星星。
人文数学协会(Association for Human Mathematics)称:“数学家没有要求OpenAI做这项工作”。并且表示,这些手稿缺乏验证,只是OpenAI的又一次“性能营销”。
074号手稿到底是什么?
挂谷问题的源头,是1917年日本数学家挂谷宗一提出的一个问题:假设你有一根细针,放在平面上,要把它原地调转方向,转完一圈(或者说,让它的指向走遍所有方向),针扫过的区域,最小能有多大的面积?
从直觉上来说,针有长度,转一圈总得扫出个圆盘吧?
其实不然。后来数学家贝西科维奇证明,只要转法足够“聪明”,针扫过的面积可以做到任意小,小到比你指定的任何一个正数都小。
在此基础上,数学家们构造出了“面积为零”的集合,里面却依然包含朝着每一个方向的线段,这类集合就叫“贝西科维奇集”(Besicovitch set),或者叫“挂谷集”。
既然面积可以小到0,那这个问题不就结束了吗?然而并没有。
因为“面积为零”只说明这个集合没有厚度、占不了地方,却没法表示它到底有多“复杂”。
一根线和一团线,它们在数学上的面积都可以是0,但显然这两者不是一回事。
所以数学家换了一个思路,这个集合虽然没有面积,但它到底像一条线、一个面,还是更接近一个实心的东西?于是就有了“维数”。
一条线是一维的,一张纸是二维的,一个箱子是三维的。但是一些特别“稀碎”的集合,它的维数甚至可以是小数,比如2.5维。
“豪斯多夫维数”就是其中最常用的一把尺子。它的逻辑是用很小很小的小球去盖住一个集合,需要多少个球?如果球的半径缩小一半,需要的球的数量变成了原来的二倍,那这个集合就是一维的,像线;如果变成四倍,就是二维的,像面;如果是八倍,就是三维的,像一个实心体。介于中间的,就是小数维。
在二维平面里,数学家早在1971年就证明了,任何包含所有方向线段的集合,维数必须是2,哪怕它的面积是0。
那么三维空间呢?四维呢?更高维呢?数学家猜测:在n维空间里,只要一个集合包含了所有方向的单位长度线段,它的豪斯多夫维数就必须等于n,哪怕它的体积是0。这就是著名的“挂谷集猜想”。
2026年,王虹获得菲尔兹奖。官方给出的获奖理由,是她在傅里叶限制问题和三维挂谷问题上的重大进展。其中最核心、也最广为人知的,就是前面讲的三维挂谷集猜想。
OpenAI这次解决的两个问题,则是王虹的“威力加强版”。
第一个,三维挂谷极大函数猜想。
名字里的“极大”,指的是一种“挑最大值”的做法。
假设空间里有一团雾,浓淡不均。拿一根细吸管,在不同的位置吸,吸管里装进的雾的平均浓度是不一样的。
把这个方向上所有可能的插法都试一遍,只记下其中浓度最高的那一次,这个“最高值”,就是这个方向的“极大值”。
再换一个方向,重复同样的事,又得到一个“最高值”。把所有方向的最高值收集起来,就得到了一个“方向与最高值”的对应关系,数学家把它叫作“挂谷极大函数”。
第二个,四维豪斯多夫维数猜想,也就是说,把前面的结论从三维搬到四维。

四维空间里的挂谷集,维数必须是4。目前人类在四维的最好成绩,是2021年用“平面刷”(planebrush)论证得到的3.059,也就是说,只能证明它至少是3.059维。从3.059到4,相当于直接提升了一个维度。
从二维到三维,问题的难度几乎是“质变”;从三维到四维,同样是质变。因为维数越高,那些“管子”能够互相穿插、堆叠的方式就越多,数学家需要处理的几何情形就越复杂。
因此,如果让数学家们亲自去完成这两个猜想,至少要花费几年时间。
然而按照OpenAI自己的说法,整个流程相当“朴素”。
用一个未发布的内部模型一个提示词,让一个Agent去跑,平均每个结果只消耗约3小时的ChatGPT Pro思考算力。
整个评估过程中,模型被扔进了大约4000个问题,经过归并、筛选,才留下了现在这722篇手稿。
OpenAI超过了菲尔兹奖?
如果吸管叠得不厉害,那么它们占的总地盘自然就小不了,所以极大函数猜想一旦成立,就能直接推出集合版猜想。
因此有网友表示,AI只花了三个小时,就超越了菲尔兹奖。不过这其实是一种偏见,既看扁了菲尔兹奖,更没有理解王虹的研究成果。
因为OpenAI的论证并不是从零开始的。074号成果族里明确表示,是建立在王虹研究成果的基础上,并非凭空得出结果。
这也符合数学研究的常态。人类历史上的每一个重大突破,几乎都是站在前人的肩膀上,而且王虹的证明本身,也是建立在她之前关于“黏性挂谷集”(sticky Kakeya sets)、以及过去三十年众多数学家成果之上的。
更巧的是,早在2025年3月,MIT的数学家拉瑞·古斯(Larry Guth)在接受采访时就预言,说从二维到三维是最难的一步,王虹的证明很可能被改造后用到更高维的问题上。
所以,如果OpenAI的四维结论成立,从某种意义上说,也是在验证这位数学家当年的判断。
那“超过了菲尔兹奖”这句话,又该怎么理解呢?
第一,菲尔兹奖是奖励一位数学家的整体贡献,不只是某一篇论文。只是说在颁给王虹的菲尔兹奖里,三维挂谷集猜想确实是最核心的成果。
第二,如果OpenAI的074号手稿真的成立,那么在数学“难度”这个单一维度上,它确实比王虹获奖的那道题难度更高:因为三维极大函数版蕴含集合版,而四维豪斯多夫维数问题,是人类在三维之后更进一步的、此前从未被解决过的目标。
可这句话有个关键词,那就是“如果”。
074号手稿目前没有Lean形式化证明,也没有经过同行评审。在被验证之前,它只是“一份声称解决了更难问题的论文”,而不是“已经被证明的更难问题”。数学史上,不乏被宣布又被撤回的“证明”。
而目前,仍然停留在“如果”二字上。
而王虹的菲尔兹奖,是经过了数月的检验和整个学界的审读,现如今已经成为这个领域的基石。不管OpenAI的手稿最终成立与否,其起点都离不开这块基石。
验证才是最难的
真正的难题是验证。数学的验证过程,是整个数学研究里最耗人的环节之一。
以王虹为例。
2025年2月,她把三维挂谷集猜想的证明挂到了学术预印本网站arXiv上,约127页。
论文放出来之后,并不是马上被认定为“正确”的。论文先后经历了作者自己的反复自查,陶哲轩等知名学者的长篇分析,《Quanta》杂志称之为“百年一遇”的证明。
验证工作从2025年2月,一直持续到了2026年7月菲尔兹奖揭晓,前后近一年半。即使到了今天,很多数学家还没有完全吸收和消化这套证明里的新想法。
这就意味着,一个由顶尖人类数学家写的、一百多页的证明,也要经过一年多的集体审读,才被广泛认可。
现在,一次性来了722篇。
不仅如此,OpenAI放出的722篇手稿,其中很多都是上百页的长篇论证。如果每一篇都要一位专家读上几个月,全世界能读懂其中某一篇的专家,可能只有几十个人,甚至更少。
而且,这些专家各有自己的研究,不可能放下手头所有工作来给OpenAI“当审稿人”。
更麻烦的是,OpenAI的发言人承认,这些结果里,有不少连OpenAI自己的数学家,也还没有完全理解,其中就包括前文提到的074号手稿。
所以数学界给出的反应里,更多的是质疑。
这种担忧,并不是今天才有的。
2026年9月8日,OpenAI宣布内部模型解决了纳维-斯托克斯方程这一千禧年难题,据称动用了约一万个Agent进行并行计算。
然而,布朗大学的数学家戈麦斯-塞拉诺(Gómez-Serrano)在哈佛的讲座里提到,相关的166页证明是“难以理解”的。
9月11日,25位菲尔兹奖得主(包括陶哲轩等人)联名发表公开声明《人工智能在数学中的严重错位》,批评AI公司把“攻克名题”当作展示模型能力的营销手段,仓促发布,不仅没有推动数学发展,反而还对数学界产生了负面影响。
9月21日,OpenAI宣布成立一个由数学家组成的独立顾问组(AGMAI,设在普林斯顿高等研究院)。9月29日,这个顾问组表示,发布AI生成的数学结果时,将同时公开所用的模型、具体的提示词和计算时间。
可这次OpenAI放出的722篇手稿里,却只公布了“平均计算时间”之类的整体数字,没有公布提示词,也没有公开模型。
MIT的数学家安德鲁·萨瑟兰(Andrew Sutherland)说到:“除非他们公布模型、让大家能够复现,否则对‘单个Agent一次提示就解决问题’这种说法,应当视为未经证实。我们应该要求看到‘收据’。”
言外之意就是,这722份手稿均为“假消息”。
10月7日,开头提到的人文数学协会,认为“一次放出七百多份文件,展示的不是学术,而是一种权力”。随后,该协会呼吁数学家停止与OpenAI合作。
当然,也有另一种声音。多伦多大学的丹尼尔·利特(Daniel Litt)说:“如果我们想知道这些数学问题的答案,我看不出有什么理由要求公司把它们藏起来……这对数学是件好事。”
数学家们无法在短时间内验证这722份手稿,所以指望能通过Lean来验证。
Lean是一种“证明助手”,同时也是一门编程语言。数学家需要把证明的每一步,翻译成Lean能看懂的严格语言,Lean系统再对其进行逐步检查,只要有任何一步含糊或者跳步,就会判不通过。一旦通过,这个证明在逻辑上就几乎可以确定没有错误。
据公开目录,722篇手稿归并的372个成果族中,有235个带有Lean形式化说明,大约占63%。
但是Lean也不是万能的。数学家吉尔·科莱(Gil Kalai)称,Lean的验证,也可能出问题。比如,把一个数学问题翻译成Lean语言的时候,翻译本身如果出了偏差,机器验证通过的,可能就不是原来那个问题。此外,Lean只能确认“逻辑上通不通”,却不能判断这个结果有没有新意、有没有价值。
所以,对于没有Lean形式化的074号手稿,也只能靠数学家们进行核查。
如果074号手稿最终被证明是对的,它必然是数学史上一个标志性事件。
挂谷问题推进到三维总共花费了100多年的时间,而AI只用三个小时,就往前走了好几步。
同样,到最后也有可能发现074号手稿其实是错的。
归根结底,一个人类无法在短时间内验证的“证明”,到底应不应该被称为证明?这才是这件事真正留给数学界的难题。
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App