
《莱顿宣言》的警示,在 Astra 发布当日成为现实
2026年6月2日,由16位知名数学家组成的工作组在荷兰莱顿大学发布《人工智能与数学莱顿宣言》。这份历时八个月起草完成的文件,系统阐述了AI在学术规范、版权保护、学科自主性层面对数学研究带来的威胁。文件发布后迅速获得国际数学联盟(IMU)背书,24小时内签名超过千人,截至目前签署者已逾3000人,包括陶哲轩、彼得·舒尔策、凯文·巴扎德、斯科特·阿伦森等顶尖学者。
宣言明确指出了AI应用于数学研究面临的五大风险:不可靠的结果、缺失的引用、对封闭商业系统的依赖、夸大的宣传 Claims,以及科学自主性的丧失。其中最为核心的警示只有一句话——AI产出数学知识的速度,已经超出数学共同体的消化能力。
两个月之后,这一论断得到了应验。
24小时之内,验证速度追上了发现速度
2026年8月1日,OpenAI在官网宣布下一代模型系列命名为"Astra",其中一款内部测试模型一次性完成10道长期未解数学难题的证明,横跨高维几何、编码理论、群论、量子复杂性、格密码学和极值组合数学等多个领域。按GPT-5.6 Sol API计费标准,完成相关推理所需的词元成本约为2000美元。OpenAI表示,模型生成的证明已由人类整理成论文,并通过计算机证明系统逐步验证;该公司还计划公布模型针对每道问题给出的推理说明。
整个数学界一片哗然。
但真正让《莱顿宣言》起草者脊背发凉的,是24小时之后发生的事。
据Anthropic研究员莱文特·阿尔珀厄格在X平台发文称,他使用公开可用的Claude Fable模型,在完全自主、通用提示词、全程断网的条件下,独立复现了Astra成果中的5项。
⚠️ 需要客观说明的是:截至目前,阿尔珀厄格尚未公开这5项证明的完整PDF、提示词、运行日志与Lean证书,Anthropic方面也未发布正式的验证论文。因此"24小时复现5项"目前仍是研究者本人的声明,最终确认仍需等待完整材料的披露。但即便如此,这一事件已经足以触发《莱顿宣言》所预警的核心议题。
一款公开模型,只用一天时间,就对另一款未发布模型所宣称的数学发现完成了独立核验。 《莱顿宣言》所担忧的"AI发现速度超过人类评估速度",不再是理论推演,而是以小时为单位正在上演的现实。
技术核验可行,制度核验滞后
Astra的每一道题都附带Lean 4形式化证书。Lean是一个带有形式化内核的定理证明器——证明文件要么完整编译通过,要么报错,内核只给出二元裁决。OpenAI已将仓库以Apache 2.0许可开源,任何研究者、开发者或有技术能力的读者,都可以把证书拉到本地自行运行验证。
从技术层面来讲,证明的"逻辑正确性"可以瞬间核查完毕。
但需要冷静看待的是:Lean证书验证的是"形式化陈述内部的逻辑自洽",它并不能自动确认形式化定理与数学界所理解的非形式化猜想完全对应。形式化陈述与原问题的对齐,依然是人类的判断——对于这10项成果,数学界仍需逐一检视形式化陈述,确认它们问的是正确的问题。
换言之,形式核验只回答一个问题:"这份证明内部逻辑是否自洽?"却无法回答另一个问题:"这项定理是否真的值得载入数学史?"
后者必须由人类数学家做出判断。而人类阅读、理解、评估一份复杂证明的速度,远远跟不上AI生成证明的速度。
《莱顿宣言》明确要求,数学成果仍应当在同行评审平台发表,恪守开放科学原则。但当一个模型可以在24小时产出十项顶级成果,另一个模型又能在24小时复现其中半数,以月甚至以年为周期运转的传统同行评审体系,已经跟不上这样的节奏。牛津大学计算机科学系主任莱斯利·安·戈德堡直言:"不准确的AI生成草稿生产成本极低,存在用根本错误的所谓结果污染文献的风险。一旦这种情况发生,错误很可能随着新结果建立在错误基础之上而传播。"
当"发现"不再需要被人类理解
这早已不是个例。早在2026年2月,AxiomRover就已经在arXiv发布8篇覆盖硬核领域的AI生成论文;到5月,其中5篇已经通过同行评审。"上午出题、下午投稿"的节奏,让传统学术生产模式显得笨重迟缓。
陶哲轩等学者在多个场合表达过类似关切:AI把灵感的成本降到了零,人类正面临全新的科学核验瓶颈——同行评审体系正被AI投稿淹没。
《莱顿宣言》的签署者发出警示:在数学基准测试取得高分的模型,被大肆宣传为"达到人类数学家水平";AI生成的某一步推理,就被拿来当作AI发现新定理的证据。铺天盖地的宣传形成一种集体无意识:我们开始用AI的产出速度,去衡量人类的理解速度。
Astra事件暴露出一道更深的裂痕:AI不仅可以比人类更快发现数学真理,还可以更快完成核验——只要核验者是另一套AI。
Fable在24小时内复现Astra五项成果(若经最终证实),本质上完成了一件事:用机器核验替代人类评审。这套模式比任何同行评审都更快,也比人类所能调动的一切核验资源更廉价。但问题随之而来:倘若核验工作全权交给AI,"理解"在数学当中还有立足之地吗?
这正是《莱顿宣言》的核心忧虑:数学不只是一堆正确命题的集合,它属于人类的智力活动。当发现速度超过理解速度,当核验主体从人类变为算法,数学本身的意义正在被重新定义。
宣言发布两个月后,它所担忧的一切已然发生
Astra花费约2000美元拿下十道难题,加上Fable 24小时复现五项成果(待完整验证)——这两件事共同宣告新时代到来:AI的数学发现速度,已经永久性超越人类的评估速度。
《莱顿宣言》的本意并非禁止AI做数学,而是希望在AI时代守住数学作为人文学科的核心价值:严谨性、独立可核验、恰当的成果归属、过程透明。
可是当核验周期被压缩至24小时,当"同行"从人类变成另一套AI,这些价值又该以何种形式存续?
宣言发布时,它是一份警示;而Astra问世之后,它已然成为生效的预判。
算力平权时代,接入层成为新基础设施
Astra与Fable的这次"隔空对弈",揭示了一个更深层趋势:AI时代科学发现的壁垒,正在从"能不能做出来"转向"做出来之后,能不能以最低的成本、最快的速度让全世界核验"。当每一项成果都可能在24小时内被独立复现,真正稀缺的将不再是解题能力,而是提出正确问题的能力,以及让全世界相信"这是我率先发现"的叙事能力。
对于企业开发者而言,这场变革的另一重启示同样清晰:当前沿模型在数学推理、形式化验证、长程任务规划上快速平权,稳定、低成本、多模型可切换的接入服务,已经成为智能化转型的新基础设施。
在这方面,UseAIAPI提供了值得关注的一站式解决方案:平台聚合Gemini、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,开发者无需分别对接各家接口,通过一个统一入口即可灵活调用。面向企业用户,UseAIAPI支持企业级定制化部署服务,可结合Batch API机制叠加优惠,将长上下文、高并发、持续运行的智能体工作流的单位成本进一步下压。
在价格层面,平台优惠折扣最低可达官方定价的50%。这意味着高强度内容生成、自动化智能体、大规模代码重构等重消耗场景,不再成为预算负担——以当前海外主流模型为例,GPT-5.5 Pro加权平均输入价格为30美元/百万Token、输出价格为180美元/百万Token,而DeepSeek-V4-Pro通过价格调整后,输入(缓存命中)价格为0.25元/百万Tokens、输出价格为6元/百万Tokens,二者输入价格相差超700倍。在这种价差格局下,通过UseAIAPI的统一接入与优惠叠加,企业能够在保证模型性能的同时,真正实现"无忧接入、按需扩展"。
💡 当每一项前沿成果都可能在24小时内被独立复现,真正稀缺的将不再是"能不能调用最强模型",而是"能否以合理的成本,灵活调用最合适的那一个"。在这个意义上,选对接入通道、锁定可持续的算力成本,往往比追逐单个模型的"首发"更为重要。
《莱顿宣言》警示的是数学作为人类智力活动的本体价值;Astra与Fable用24小时改写了"首发"的保质期;而企业智能化转型要撕掉的,是"算力成本不可控"的免责声明。当数学研究的成本结构被重新定义,企业与开发者最务实的回应,是为自己锁定一条稳定、低价、多模型开放的接入通道——这既是AI时代的生存基础设施,也是在"算力平权"浪潮中保持竞争力的底层筹码。