← 返回 Blog

AI数学家互相验货时代到来:Fable 与 Astra 殊途同归,24小时完成人类需要数月的同行评审

8月2日前后,Anthropic研究员莱文特·阿尔珀厄格在布贝克的推文下回复:"我用Fable完成了一半。"他复现了第4、5、6、7、8题,合计五道。 整套实验条件干净得无可指摘:完全自主运行、使用通用提示词、全程断网,还专门增设防护机制,杜绝Astra的解题结果泄露到上下文当中。

ClaudeFable 对 Astra 完成 24 小时压力测试

当同行评审变为"代码复现":Fable 对 Astra 完成 24 小时压力测试

2026年8月1日,OpenAI首次公开确认下一代模型系列的名称——Astra。这个在拉丁语中意为"群星"的模型,其内部测试版本一次性产出10项数学与理论计算机科学全新成果,同步发布249页研究手稿、62页模型推理说明,并将全部论证转化为Lean 4形式化证明文件上传至GitHub开源。按Sol API费率计算,寻找这些解法所消耗的Token总成本约为2000美元。

整个AI圈为之震动。罗格斯大学杰出教授亚历克斯·康托罗维奇难掩震惊,留下两个感叹号:"这是一个足以载入史册的分水岭时刻。"

但真正把这场"数学地震"从一场轰动事件,推向范式变革的,是24小时之后发生的事。

24小时之内,另一家AI巨头交出"复现答卷"

8月2日前后,Anthropic研究员莱文特·阿尔珀厄格在布贝克的推文下回复:"我用Fable完成了一半。"他复现了第4、5、6、7、8题,合计五道。

整套实验条件干净得无可指摘:完全自主运行、使用通用提示词、全程断网,还专门增设防护机制,杜绝Astra的解题结果泄露到上下文当中。

⚠️ 需要客观说明的是:截至目前,莱文特尚未公开这五道证明的PDF文档、提示词、完整运行日志与Lean证书,Anthropic方面也尚未发布正式的验证论文。网友的质疑声同样存在——为什么拿Fable去复现Astra的成果,而不是直接用它攻克全新的公开难题?但"复现"本身就具备独立价值,下文将展开分析。

如果这份复现得到最终证实,那么这件事的分量就变了:OpenAI用未发布的Astra抢到的首发先机,只保住了24小时。而追上来的Fable,是Anthropic早就公开、人人都能调用的模型。网友Chubby的调侃一针见血:"公开可用的Fable,就复现了Astra一半成果。"

从"人类审阅"到"机器复现":验证逻辑的范式切换

过去,一项数学成果的验证依靠同行评审。你撰写论文,期刊邀约数名审稿人,花费数周乃至数月研读证明、给出反馈。整套流程以月为周期运转,建立在信任之上:你必须相信审稿人足够专业、足够严谨,没有放过任何一处逻辑漏洞。

而Fable所做的,是把"验证"从人类阅读,转变成机器复现。

Fable重新求解Astra那批完全相同的题目,这和常规榜单跑分截然不同。刷排行榜是作答已知试题,题目与标准答案都摆在明面上,比拼谁得分更高。但在断网、严防信息泄露的条件下,两个模型各自独立推导出同一前沿结论,检验的是完全不同的命题:该结果是否可靠,能否被独立复现?

这更像是另一种同行评审,只不过评审周期从"数月"被压缩到"数小时"。

更进一步看,Astra的每一份证明都附带Lean 4形式化证书——机器可核验的数学证明,任何人都可以用Lean编译器独立校验,无需信任OpenAI,也无需信任Astra。Lean是一种交互式定理证明器,由微软研究院开发,将数学证明写成可被计算机逐行检查的代码。不同于传统学术论文依赖同行评议的主观判断,Lean验证是二进制的,要么编译通过,要么报错。Astra十项成果的GitHub仓库中"sorry"计数为零,意味着形式化证明中无任何步骤遗漏或未证。

Astra甚至放出那篇62页、由AI独立撰写、无OpenAI团队参与的手稿《思想是如何成型的》。这些举措,让Astra的成果拥有前所未有的"可核验性"。但Fable的24小时复现,又把验证标准抬升到新层级:不再只是"检查你的证明有没有错误",而是换另一套模型从零开始推导,看是否能得到相同结论。

这比任何形式的同行评审都更加严苛。同行评审检查你写下的证明内部逻辑是否自洽;而独立复现检验的是结论本身是否站得住脚:另一个完全独立的智能主体,能不能通过完全不同的路径抵达同一个终点。

"首发"这件事,保质期归零

评论区有人提出更为尖锐的疑问:"这么看,OpenAI就只抢到一个首发而已?"

但真正值得思考的是,"首发"这件事本身还剩下多少意义。

当AI产出成果的核验,不再依赖人类审稿人的时间精力,而是可以由另一套AI在24小时内独立完成,数学领域的"信任体系"正在被彻底重构。

过去,数学的可靠性建立在"人类专家阅读并认可"之上;如今,正转向"机器可以独立复现"。二者的差异不只是速度:核验主体由人类变成算法,核验方式由阅读理解变成程序执行。

有人将这一现象称为"AI数学家互审时代"的到来。OpenAI与Anthropic在数学前沿的激烈交锋,无意间为这个时代写下注脚:当任意公开模型都能在24小时内复现你的结果,"首发"依旧具备价值,但它的保质期已经归零。

多位学者提出:2026年菲尔兹奖,或许会是最后一届完全授予人类智力成果的评奖。这听上去像预言,但Astra事件用2000美元证明——这已经不是预言,而是倒计时。

Fable做到的,不只是"追平Astra一半成果"。它为整个数学界划出一条全新起跑线:未来,任何宣称解决数学难题的AI,成果发布的那一刻,或许就要迎接来自其他AI的同行评审。

算力平权时代,接入层成为新基础设施

Astra与Fable的这次"隔空对弈",揭示了一个更深层趋势:AI时代科学发现的壁垒,正在从"能不能做出来"转向"做出来之后,能不能以最低的成本、最快的速度让全世界核验"。当每一项成果都可能在24小时内被独立复现,真正稀缺的将不再是解题能力,而是提出正确问题的能力,以及让全世界相信"这是我率先发现"的叙事能力。

对于企业开发者而言,这场变革的另一重启示同样清晰:当前沿模型在数学推理、形式化验证、长程任务规划上快速平权,稳定、低成本、多模型可切换的接入服务,已经成为智能化转型的新基础设施

在这方面,UseAIAPI提供了值得关注的一站式解决方案:平台聚合Gemini、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,开发者无需分别对接各家接口,通过一个统一入口即可灵活调用。面向企业用户,UseAIAPI支持企业级定制化部署服务,可结合Batch API机制叠加优惠,将长上下文、高并发、持续运行的智能体工作流的单位成本进一步下压。

在价格层面,平台优惠折扣最低可达官方定价的50%。这意味着高强度内容生成、自动化智能体、大规模代码重构等重消耗场景,不再成为预算负担——以当前海外主流模型为例,GPT-5.5 Pro加权平均输入价格为30美元/百万Token、输出价格为180美元/百万Token,而DeepSeek-V4-Pro通过价格调整后,输入(缓存命中)价格为0.25元/百万Tokens、输出价格为6元/百万Tokens,二者输入价格相差超700倍。在这种价差格局下,通过UseAIAPI的统一接入与优惠叠加,企业能够在保证模型性能的同时,真正实现"无忧接入、按需扩展"。

💡 当每一项前沿成果都可能在24小时内被独立复现,真正稀缺的将不再是"能不能调用最强模型",而是"能否以合理的成本,灵活调用最合适的那一个"。在这个意义上,选对接入通道、锁定可持续的算力成本,往往比追逐单个模型的"首发"更为重要。

Astra用Lean 4撕掉了AI证明的"免责声明";Fable用24小时复现改写了"首发"的保质期;而企业智能化转型要撕掉的,是"算力成本不可控"的免责声明。当数学研究的成本结构被重新定义,企业与开发者最务实的回应,是为自己锁定一条稳定、低价、多模型开放的接入通道——这既是AI时代的生存基础设施,也是在"算力平权"浪潮中保持竞争力的底层筹码。