首页 > 资讯 > GPT-6第1天直接攻破5道Erdős难题,Fable 5.1交了白卷

GPT-6第1天直接攻破5道Erdős难题,Fable 5.1交了白卷

36氪文章 2026-09-04 20:07 1 阅读 查看原文

刚出道的GPT-6 Astra,又解决了5道Erdős数学难题

成果来自Epoch AI和曼彻斯特大学发布的的FrontierMath Erdős(FME)基准测试论文。

68道人类至今未解的数学难题,5个顶级AI模型同场考试。

GPT-6 Astra获得“全场唯一成绩非0分模型”成就,得分率3%。

另外4个模型,GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1、Claude Fable 5都交了白卷,通通0分。

在放宽计算预算的追加测试中,GPT-6 Astra总共解开了5道。

其中一道是Erdős本人1931年提出的“也许是我第一个认真的问题”。另一道是1962年提出、被称为“极值图论中最诱人的问题之一”的Erdős-Sós猜想。

陶哲轩点名批评,催生了这场考试

近来AI攻克数学开放问题的消息不断传出。

2026年5月OpenAI宣布AI推翻了单位距离猜想,7月有数学家用Claude Fable 5发现了三维Jacobian猜想的反例,8月OpenAI又公布了AI在十个数学和理论计算机科学问题上取得的新成果,其中就包括若干Erdős问题。

陶哲轩在2026年国际数学家大会(ICM)的报告中直接指出,这些成果大多“不是在受控的科学条件下取得的”,存在五个方面的问题:

只报成功不报失败导致成功率未知,算力消耗不公开,人类引导程度不透明,训练数据可能已包含答案,以及不同模型之间从未做过系统比较。

FME就是对这些批评的直接回应。

它的核心设计逻辑是:

第一,用未解问题消除数据污染。既然没有人类解出过,模型就不可能从训练数据中”背答案”;

第二,要求AI用Lean证明助手提交形式化证明。由Lean内核做最终裁决,通过就是证明了,不通过就是没证明,没有模糊空间;

第三,所有模型在完全相同的条件下作答。每道题预算300美元、工作时限72小时、尝试一次。

此前也有过两个面向开放问题的数学基准,HorizonMath和FrontierMath: Open Problems(FM:OP)。

但它们都依赖“生成-验证”模式,只能覆盖那些解是可计算验证的具体对象(比如一个图、一个多项式、一个算法)的问题,绝大多数需要证明一般性命题的开放问题根本无法纳入。

而且验证环节并不完全可靠,HorizonMath自己承认接受的封闭形式”最好视为猜想直到被证明”,FM:OP在2026年7月还因验证器缺陷移除了两道题,并估计其10%到40%的问题可能本身就无解。

FME的形式化证明格式将覆盖范围大幅拓展:只要一个猜想的陈述能在Lean中形式化,就可以纳入基准。而且即使猜想为假,模型也可以通过证明其否命题来完成任务。

验证环节的安全性也经过精心设计。

每次尝试被分到两个互相隔离、均无网络访问权限的Docker容器中。Agent容器供AI工作并拥有完整Shell权限,Comparator容器放置干净的Lean工具链负责验证。

AI提交的Lean源代码由Comparator从头通过Lean内核重新编译验证,能防范篡改环境、恶意编译时代码、证明不同命题、重新定义依赖项、假设结论、绕过内核等多种作弊手段。

68道Erdős难题怎么选的

Paul Erdős是20世纪最多产的数学家之一,数论和组合学领域的领军人物,以提出大量难度各异、影响深远的问题而闻名。

这篇论文的第二作者Thomas F. Bloom来自曼彻斯特大学,是erdosproblems.com网站的维护者,该网站系统收集了Erdős生前提出的开放问题。FME的68道猜想就是Bloom从网站上652个开放问题中亲手挑选的。

他的选题标准只有一个:选最困难、最有数学意义的那些。

必要条件是,无论正面还是反面解决了其中任何一道题,如果出自人类之手,都值得在顶级期刊上发一篇论文,并且会引起相关领域许多研究者的兴趣。大多数入选问题在过去几十年中已经受到大量数学家的关注。

Bloom此前曾公开批评过用erdosproblems.com上的问题来衡量AI进展,原因是这些问题难度和重要性参差不齐。

此前被AI解决的许多Erdős问题其实比较冷门,是网站将它们重新推向公众视野后才受到关注的,解法也只是对已知技术的简单修改。

但单位距离猜想(第90号)、第146号和第183号属于例外,它们是各自领域的著名问题,此前已有大量论文和部分成果,被AI解决标志着AI数学研究能力到达了一个新的阶段。

FME就是尝试提前锁定那些同等级别的”硬骨头”。

68条猜想之间被特意选为相互独立,解开一道不应直接给出另一道的答案,如果发现了这样的蕴含关系,本身就是一个有意义的数学成果。

Erdős生前经常为自己的问题设定悬赏金额以反映其重要性和难度,FME中包含了许多高赏金问题,但也包含了不少没有悬赏的问题,同时排除了一些虽有高赏金但不够有趣的题目。

技术实现上,68条猜想中有50条的Lean 4陈述直接取自Google DeepMind维护的开源Formal Conjectures库,其余17个问题由论文作者通过自动形式化流水线补充完成,Bloom逐一审核确认其忠实于原始数学问题。

AI作答时配备了Lean 4工具链与Mathlib、SageMath计算代数系统、Python数学库,以及47.6万篇arXiv纯数学论文的离线LaTeX源码作为参考文献库。

GPT-6 Astra解开了哪五道

标准基准测试中,GPT-6 Astra在68道猜想上解出了2道。

第74号问题被反驳,花费218美元、耗时15小时;第126号问题被证明,花费247美元、耗时16小时。

其余66道全部跑满300美元预算上限,没有产出通过验证的提交。其他四个模型在全部68道题上均为零分。

在标准测试之外,研究团队又用同一预发布版本的GPT-6 Astra进行了多轮追加尝试,放宽了预算并调整了agent配置。这些不算正式基准成绩,但论文认为,任何一道题的解决本身就具有数学价值。

最后综合所有尝试,GPT-6 Astra总共解出了5道猜想。

第1号问题被反驳。

这是Erdős 1931年提出的问题,当时他才18岁,他自称这”也许是我第一个认真的问题”。

关于解离集(dissociated set)在区间{1,…,N}中能有多密集。此前最好的上界是Bohman给出的N ≤ 0.22002·2ⁿ,最好的下界是Erdős和Moser证明的N ≫ 2ⁿ/√n。

GPT-6 Astra构造了反例,证明对任意ε>0都存在满足N ≤ ε·2ⁿ的解离集,直接否定了Erdős的猜想。

AI的证明使用线性代数构造了一系列行列式趋于零的n×n有理矩阵。4次尝试中2次成功,费用分���为405美元和1384美元。Bloom在尝试理解这个证明时,用格(lattice)的语言重新诠释了它,认为这是一个更自然的视角。

第74号问题被反驳。

1982年Erdős、Hajnal和Szemerédi猜想:无论f(n)趋向无穷的速度多慢,都存在色数为无穷的图使得每个n顶点子图只需删除至多f(n)条边就能变成二部图。

GPT-6 Astra证明了恰恰相反的结论,如果f(n)增长得足够慢(大约log n / log log n的量级),那么满足条件的图色数至多为3。

证明通过归纳法构造一列子图逐步消除短奇圈,再用粘合论证将3-着色从二部子图逐步回传到原图。这道题6次尝试全部成功,最便宜一次仅47美元/5小时,研究者初步判断6次反驳中包含三种不同的论证方法。

第126号问题被证明。

1934年Erdős和Turán在他们的第一篇合作论文中证明了|S(A)| ≫ log n的下界,其中S(A)是集合A中所有两两之和a+b的素因子集合。Erdős后来多次追问能否改进为|S(A)|/log n → ∞。

GPT-6 Astra给出了|S(A)| ≫ n^{1/2}这一强得多的结果。4次尝试全部成功,而且提供了三种不同的证明(分别对应指数c=1/8、1/3和1/2),均使用初等方法。

第548号问题被证明。

这就是1962年Erdős和Sós提出的著名猜想:n个顶点、边数超过(k-2)n/2的图包含每棵k个顶点的树。此前虽然有许多特殊情形的证明,但完整猜想一直未获解决。

GPT-6 Astra给出的完整证明通过考察顶点排列与标记配对的计数,结合归纳论证完成。3次尝试中1次成功,花费363美元/20小时。

第571号问题被证明。

这是Erdős和Simonovits提出的关于Turán数增长阶的猜想:对于任意有理数α∈[1,2),是否存在二部图G使得ex(n;G)≍nᵅ,此前只有若干特殊α族被证明。

GPT-6 Astra给出了对任意有理α的完整证明。3次尝试中1次成功,花费617美元/41小时,是五道解中耗资最大的。Bloom表示这是五个解中难度最高的,“对这个证明的完整人类理解,包括它与已有大量相关工作的关系,还需要一些时间”。

获得这5个解的全部尝试总计花费超过22万美元,而标准基准测试本身只花了约2万美元。按300美元一次、3%成功率计算,解出一道重要开放问题的期望成本约为1万美元。

论文同时指出了几个局限:形式化成本可能导致分数低估了AI的真实数学能力,模型可能找到了正确的论证却无法将其转化为Lean证明,尤其当论证依赖的标准文献结果尚未被Mathlib收录时。

此外FME只衡量解题能力,而在数学研究中,提出正确的问题往往比证明它更难。

虽然OpenAI宣布“AGI时代到来了”,但68道精选的Erdős猜想中还有63道悬而未决。

本文来自微信公众号“量子位”,作者:关注前沿科技,36氪经授权发布。