
79.0%这个数值,需要放在正确标尺下衡量
2026年7月24日,Anthropic正式发布Claude Opus 5。同月,一套名为黎曼基准(Riemann Bench)的评测榜单完成更新:在允许调用工具的测试条件下,Claude Opus 5取得79.0%的得分。
乍看之下,79%仅仅是中等偏上的及格水准。但倘若把这个数值放回黎曼基准本身的设计初衷,它承载的意义将截然不同。
黎曼基准,不只是奥数考题
首先厘清这套基准评测的衡量目标。
黎曼基准由Surge AI于2026年4月推出。研发团队正是五年前打造GSM8K的原班人马——GSM8K是首个真正用来衡量大语言模型数学推理能力的基准测试。时隔五年,他们带来了黎曼基准。
该基准包含25道经过专家精挑细选的私密难题,全部由常春藤院校博士、数学教授、IMO奖牌得主执笔编写,作者往往需要耗费数周独立推演求解。所有试题执行双盲核验机制:两名独立领域专家从零开始演算,交叉确认标准答案。整套试题全程严格保密,杜绝模型依靠记忆训练数据"作弊"。
黎曼基准配套论文揭示了一个令人警醒的事实:在早期无工具条件下,所有前沿模型得分均低于10%。能够拿下奥数金牌水准的AI,面对科研级数学问题,解题正确率尚且不足一成。
60%与79%之间,横亘着怎样的鸿沟?
一道关键分界线在此显现。
不启用工具的环境中,Claude Opus 5得分60.0%;开放工具调用权限后,分数提升至79.0%。
整整19个百分点的差距。同一模型、相同的25道试题,唯一变量就是能否调用外部工具。
黎曼基准的测试规则允许模型化身"无约束研究智能体",完整使用代码运算、信息检索、开放式长链条推理。也就是说,Claude Opus 5可以编写代码辅助数值计算、调用外部工具验证猜想,开展多轮递进推导,而非仅凭直观一次性作答。
这19个百分点的落差印证一个结论:当下AI依靠单纯记忆、模式匹配的推理已经摸到天花板;可一旦配备可供实操的工具,推理能力将迎来量级级释放。
一年之内:从大面积失分,逼近八成正确率
拉长时间线,79.0%背后的趋势更加清晰。
2025年,AI已经能够拿下IMO赛事金牌,达到竞赛数学的顶尖水准。但竞赛数学仅仅属于数学推理里的"窄域范畴":题目限定在有限知识范围,仅要求少量高阶工具,更考验临场解题技巧,而非深厚理论体系构建。
2026年,AI数学推理能力迎来集中爆发。Claude Opus 5在黎曼基准取得79.0%,在IMO 2026中获得42/42满分金牌成绩,在ArxivMath(2026年6月版)研究级数学基准上取得90.8%(无工具)/91.3%(有工具)的成绩。
💡 从"所有前沿模型得分低于10%"到"Claude Opus 5单模型冲到79.0%",黎曼基准用一年时间,见证了AI数学推理深度从"竞赛解题"迈向"研究级探索"的跨越。
工具正在重新定义"推理"
79.0%真正的价值,不在于相比60.0%提升了多少,而是证实:接入工具体系,正在从底层拓宽AI数学推理能力的边界。
黎曼基准的题目设计本身就在挑战固有认知:数学推理必须是一场"闭卷考试"吗?现实中的数学研究从来不存在闭卷限制。数学家查阅文献、运行代码、借助计算机代数系统、和同行交流讨论。黎曼基准复刻真实科研环境,允许AI使用配套工具。
无法调用工具时Claude Opus 5只能解开60%的问题,开启工具后提升至79%。这19个百分点,就是"知晓理论"与"能够落地研究"之间的距离。
从"解习题"迈向"开展学术研究"
2024年,我们关注AI能不能解奥数题目;
2025年,我们探寻AI能否产出全新数学发现;
2026年,我们提出新的议题:当AI拥有工具加持后,能够开展何等深度的科研工作?
黎曼基准上79.0%的成绩给出答案:深度远超所有人预期。
它的震撼之处,不在于证明了某个颠覆性定理。而是在一套专门设防、杜绝AI记忆刷题、需要数学家耗费数周求解25道难题的基准测试中,取得接近八成正确率。并且79.0%这个成绩依托工具体系达成,意味着AI正在模仿真正研究者的工作模式:整理资料、编写代码、多层链式推理、持续验证猜想。
一年内,AI数学推理深度迎来爆发式增长。而79.0%,正是这条爆发曲线上最新的坐标节点。
当"工具+推理"成为范式,模型接入便是底座
Claude Opus 5在黎曼基准上取得的79.0%,折射出一个更朴素的行业真相:当AI真正走入"工具调用+长链条推理"的研究范式,无论是前端的交互体验,还是后端的智能体编排,都需要稳定、合规、可负担的模型接入能力作为支撑。
对于需要长期、大规模调用全球主流大模型的团队而言,频繁遭遇地区可用性门槛、账号风控、跨境支付与多平台对接的摩擦,本身就是一个隐性成本。在这方面,UseAIAPI提供了一条清晰的路径:平台一站式聚合Gemini(含3.6 Flash、3.5 Flash、3.1 Pro等最新模型)、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,无需为每个大模型分别注册海外账号、配置支付方式,一套API Key即可打通全球主流模型。
平台提供极具竞争力的优惠权益,折扣最低可达官方价格的50%,显著降低了高频次接口调用、高强度内容生成的重度使用成本,让团队无需为高昂的消耗而顾虑。对于企业用户,UseAIAPI还支持企业级定制化部署,可根据业务需求灵活配置并发、配额与路由策略,结合Batch机制与缓存机制,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低。平台通过海外合规节点接入官方API,提供企业级SLA保障,规避地区可用性门槛与数据中心IP风控风险。
📌 当AI从"解习题"迈向"开展学术研究",一套"无忧接入、按需扩展"的模型接入基础设施,与模型能力本身同样重要——这恰恰是UseAIAPI所致力于解决的问题。
79.0%不只是一个测试分数。它是AI数学推理从"闭卷答题"走向"开卷研究"的分水岭,也是整个行业从"模型能力竞争"走向"模型能力+接入底座协同"的新起点。当每一次调用都稳定、合规、可负担时,AI走进千行百业的脚步,才会走得更快、更稳。