← 返回 Blog

2000 美元,10 道菲尔兹奖级难题:OpenAI 未发布模型 Astra 一夜改写数学史

2026年8月1日,OpenAI研究员塞巴斯蒂安·布贝克在X平台公布:公司内部测试的下一代模型家族Astra,一次性攻克了10个横跨数学与理论计算机科学的长期开放难题。每道问题至少搁置十年,绝大多数已经历经数十年。OpenAI同步公开了249页研究长文、62页《思想是如何成型的》发现路径手稿,以及全部10项成果的Lean 4形式化证明证书——相关代码已在GitHub以Apache 2.0许可证开源,库中"sorry"计数为零,意味着形式化证明中没有任何步骤被遗漏或跳过。 更令学界震动的是成本口径:按照GPT-5.6 Sol API计费标准,寻找全部10项解法的成功推理Token,总成本约为2000美元。

OpenAI2000美元十道长期难题:Astra正在改写数学研究的成本结构

2000美元,十道长期难题:Astra正在改写数学研究的成本结构

2026年8月1日,OpenAI研究员塞巴斯蒂安·布贝克在X平台公布:公司内部测试的下一代模型家族Astra,一次性攻克了10个横跨数学与理论计算机科学的长期开放难题。每道问题至少搁置十年,绝大多数已经历经数十年。OpenAI同步公开了249页研究长文、62页《思想是如何成型的》发现路径手稿,以及全部10项成果的Lean 4形式化证明证书——相关代码已在GitHub以Apache 2.0许可证开源,库中"sorry"计数为零,意味着形式化证明中没有任何步骤被遗漏或跳过。

更令学界震动的是成本口径:按照GPT-5.6 Sol API计费标准,寻找全部10项解法的成功推理Token,总成本约为2000美元

横跨大半个数学版图的十项成果

这10道难题覆盖的领域广度,足以写进数学史:高维几何、编码理论、群论、算子代数、算术电路复杂度、量子复杂度、格密码学、极值组合学。

其中最重磅的一项,是非SOFIC群的显式构造。​ 1999年阿贝尔奖得主米哈伊尔·格罗莫夫引入SOFIC群概念,核心问题表述极简:所有可数群都是SOFIC群吗?27年间,无数顶尖数学家试图构造反例,全部失败。Astra借助性质-(T)扩张子与二元利瓦特代数,构造出首个非SOFIC群,一举终结这场长达四分之一世纪的追问。FrontierMath负责人埃利奥特·格雷泽直言,单是这一项成果,就足以登上数学界顶刊《数学年刊》。

1982年菲尔兹奖得主阿兰·孔涅提出的刚性猜想,也被Astra直接证伪。​ 孔涅曾断言:满足ICC与Kazhdan性质(T)的群,可由其冯·诺依曼代数唯一确定。Astra构造出一个可数无穷的群族——这些群彼此互不同构,但对应的冯·诺依曼代数却完全一致。

高维球堆积上界,自1978年KL界提出之后整整46年没有实质性突破。​ 2022年,维亚佐夫斯卡凭借求解8维与24维空间球体精确堆积密度斩获菲尔兹奖;但任意高维堆积密度的上界,自卡巴蒂扬斯基-莱文施泰因界之后就一直难以推进。Astra将指数从0.5991提升至0.6044005442916776954。

其余成果还包括:Ehrhart体积猜想的证明、Paul Erdős目录中的三道难题(含第183号多色Ramsey数问题)、二进制与球面码界限提升、积和式算术电路下界、量子双人游戏指数级并行重复定理、最近向量问题(GapCVP)的多项式因子近似硬度。

罗格斯大学杰出教授亚历克斯·康托罗维奇留下两个感叹号:"难道做数学现在真变成点一点鼠标就能完成的游戏了?"曼彻斯特大学数学家托马斯·布卢姆(正是2025年10月公开拆穿OpenAI虚假声明的人)评价:这十项成果的整体学术价值,超过五个月前证伪Erdős单位距离猜想的单次成果。

真正颠覆的,是"证明"本身的可信度机制

历次"AI做数学"的公告之所以难以服众,痛点在于:语言模型有充分的"自信、流畅、错误"历史记录。一份叙述性的"模型解决了猜想",必然招致"谁来核验"的合理质疑。

Astra这次的不同之处,正是Lean 4证书。

💡 Lean是一个带有形式化内核的证明助手,提交论证中的每一个逻辑步骤都必须通过内核校验,否则证明无法编译。公布.lean文件意味着外部数学家不必信任OpenAI对"模型做了什么"的散文式描述,他们可以直接运行验证器,读取编译器的输出结果。

这一点尤为重要——因为OpenAI有过"前科"。2025年10月,该公司曾作出类似的AI生成数学解声明,结果被布卢姆公开揭穿为不实结论。本次发布的Lean证书,正是对这一信用缺口的直接回应:从"实验室断言"转向"机器可核验保证"。

但需要客观指出的是,Lean证书只覆盖形式化陈述的逻辑有效性,它并不能自动证明一件事——形式化定理是否与数学界所理解的非形式化猜想完全对应。OpenAI在论文中也坦承:人类研究者负责准备论文文稿,并承担形式化验证正确性的责任;数学论证本身由系统生成。

与此同时,这10项成果均未经过同行评审。OpenAI形式化清单上的审阅状态标注为"agent-reviewed"(智能体审阅),而非peer-reviewed。2026年6月,国际数学联盟背书《莱顿人工智能与数学宣言》,批评AI企业绕过同行评审、通过新闻发布会宣布成果,侵蚀证明与署名的学术标准——Astra的发布方式,恰好踩在这份宣言所担忧的痛点上。

2000美元这个数字,到底意味着什么

2000美元的口径很快引发了学界讨论。OpenAI研究员诺姆·布朗明确指出:这仅仅是成功输出答案那一刻的边际推理成本

在这之外,还要计入:

  • Astra本身的训练研发投入

  • 大量尝试却失败的课题(布朗承认,团队尝试过其他重大问题,但千禧年七大难题一道也没拿下)

  • 研究人员把论证整理成249页论文的人力时间

  • 把每份证明做Lean形式化的开销

从这个角度看,2000美元不是"做数学的成本",而是"做数学成功那一刻的成本"。但即便如此,它依然具有标志性意义——AI解出一道前沿难题的边际成本,已被压到极低水平。数学成果的"生产模式",正从"手工作坊"转向"流水线作业"。

更具戏剧性的是24小时之后的"复现"。Anthropic研究员莱文特·阿尔珀厄格公开表示,使用公开可用的Claude Fable模型,在通用提示词、全程断网、完全自主的隔离条件下,成功复现了Astra清单中的5项成果。换言之,一款未对外发布的内部模型,仅守住24小时首发窗口;而完成复现的Fable,是任何人都可以调用的公开模型。

数学研究的成本结构,正在被重新定义

过去,数学成果的优先权之争以"年"为单位计算:谁最先构思、谁最先证明、谁率先发表,中间还要经历漫长的投稿、审稿、修订流程。而现在,一款尚未对外发布的内部模型,仅耗费约2000美元,便在一天之内攻克横跨十个子领域的数学难题;24小时之后,又被公开模型复现半数。

多位学者提出:2026年菲尔兹奖,或许会是最后一届完全授予人类智力成果的评奖。这听上去像预言,但Astra用2000美元证明——这已经不是预言,而是倒计时。

对企业与开发者而言,这场能力跃迁的另一重启示同样清晰:当头部模型在数学推理、形式化验证、长程任务规划上快速平权,稳定、低成本、多模型可切换的接入服务,已经成为智能化转型的新基础设施

在这方面,UseAIAPI提供了值得关注的一站式解决方案:平台聚合Gemini、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,开发者无需分别对接各家接口,通过一个统一入口即可灵活调用。面向企业用户,UseAIAPI支持企业级定制化部署服务,可结合Batch API机制叠加优惠,将长上下文、高并发、持续运行的智能体工作流的单位成本进一步下压。

在价格层面,平台优惠折扣最低可达官方定价的50%。以Gemini主力模型为例,通过UseAIAPI接入后的实际成本可降至:Gemini 3.6 Flash从官方价1.5/7.5美元降至0.75/3.75美元每百万Token;Gemini 3.1 Pro从官方价2/12美元降至1/6美元每百万Token。这意味着高强度内容生成、自动化智能体、大规模代码重构等重消耗场景,不再成为预算负担,真正实现"无忧接入、按需扩展"。

💡 Astra用2000美元击穿了数学研究的成本底线;而对每一个希望拥抱AI的开发者与企业而言,选对接入通道、锁定可持续的算力成本,往往比追逐单个模型的"首发"更为重要。

Astra事件的真正启示,或许不在"AI攻克了哪些难题",而在它揭示了一个趋势:当每一项前沿成果都可能在24小时内被独立复现、当形式化验证让"信任"不再依赖权威背书,科学发现的壁垒正在从"能不能做出来",转向"做出来之后,能不能以最低的成本、最快的速度让全世界核验"。在这个意义上,算力成本与接入效率,将是AI时代企业与开发者最底层的竞争力。