
79.0%这个数值,需要放在正确标尺下衡量
2026年7月24日,Anthropic正式发布Claude Opus 5,API定价为每百万输入Token 5美元、每百万输出Token 25美元,与Opus 4.8保持一致,价格仅为旗舰模型Fable 5的一半。同月,黎曼基准(Riemann Bench)榜单完成更新:在允许调用外部工具的测试条件下,Claude Opus 5取得79.0%的得分。
乍看之下,79%仅仅是中等偏上的及格水准。但倘若把这个数值放回黎曼基准本身的设计初衷,它承载的意义将截然不同。
黎曼基准,不只是奥数考题
首先厘清这套基准评测的衡量目标。
黎曼基准由Surge AI于2026年4月推出。研发团队正是五年前打造GSM8K评测集的原班人马——当年GSM8K是首个真正用来衡量大语言模型数学推理能力的基准测试。时隔五年,他们带来了黎曼基准。
该基准包含25道经过专家精挑细选的私密难题,全部由常春藤院校数学教授、博士生、IMO奖牌得主撰写;平均每道题目,作者都需要耗费数周独立推演求解。整套试题全程严格保密,杜绝模型依靠记忆训练数据"作弊"。
黎曼基准配套论文揭示了一个发人深省的事实:所有前沿模型,在禁止调用工具的条件下得分均低于10%。具备奥数金牌解题水平的AI,面对科研层级的数学问题,解题正确率尚且不足一成。
无工具60.0%,启用工具79.0%
黎曼基准的测试规则,允许模型化身无约束研究智能体,完整调用代码运算、检索工具,开展开放式长链条推理。
关闭工具调用权限时,Claude Opus 5得分60.0%;开放工具调用后,分数提升至79.0%。
整整19个百分点的差距。同一模型、完全相同的25道试题,唯一变量仅为能否调用外部工具。
这代表Claude Opus 5可以编写代码辅助数值运算、调用外部工具验证猜想,执行多阶段递进推理,而非仅凭直观一次性给出答案。这19个百分点的落差印证一个结论:当下AI依靠单纯记忆、模式匹配的推理已经触及天花板;一旦配备可供实操的工具,推理能力将迎来量级式释放。
何为推理算力拓展(Inference Scaling)?
推理算力拓展并非全新概念。时至2026年,测试阶段算力扩容已经被广泛证实,是提升大语言模型推理表现的可靠路径。简单来说,核心逻辑是:在推理阶段投入更多计算资源,换取更高质量的答案。
Claude Opus 5的革新之处在于,将推理拓展升级为一套可调节的原生系统能力——用户能够通过推理力度档位(low / medium / high / xhigh / max)自主选择投入多少推理算力。Anthropic官方数据显示,在CursorBench 3.2基准测试中,开启最大推理力度档位时,Opus 5取得的分数与Fable 5峰值得分差距不足0.5%,单任务算力成本却仅有后者一半。
这不只是"多采样几次碰碰运气",而是把推理算力转化成一套可量化、可优化调度的核心资源。轻量任务如日常脚本修复和文档整理,可以使用较低档位来控制成本;复杂重构和跨模块调试,则需要xhigh / max等较高档位。
67.25%,源于同一套底层逻辑
Claude Opus 5在黎曼基准拿到79.0%,与未公开发布的Claude研究版模型将黎曼ζ函数零点比率下界由41.6%推进至67.2%——两项成果底层逻辑同源。
2026年8月10日,Anthropic对外披露这项进展。真正值得关注的不是67.2%这个数字本身,而是成果诞生的方式。Claude并非在答案已知的问题中寻找最优路径;而是在答案未知、研究路线不明、具备开放式探索空间的课题里,历经大量试错、研读过往文献、融合多种现有方法,调度多个子智能体交叉复核论证。最终推导出前人尚未确立的全新结论。
人类学界在这个方向停滞37年,仅仅实现0.8个百分点的小幅推进。Claude是如何实现突破的?它融合了1973年确立的蒙哥马利理论——这项技术原本必须依托黎曼猜想成立作为前提条件;同时结合巴卢约特、戈德斯通等人近年提出的、摆脱该前置假设的研究成果。相关论文明确记载,模型走出了一条全新推导路径。
这正是推理算力拓展在真实科研场景的典型体现。它不局限于"多次采样择优",而是在推理阶段投入充足算力,让模型能够在海量现有文献中,挖掘被忽略的理论关联路径。Anthropic内部数学家莱文特·阿尔珀格、拉尔夫·弗曼完成论文核验,外部数论学者布莱恩·康雷、丹·戈德斯通参与同行评审,Claude还生成了可通过Lean定理证明器校验的完整形式化证明。
从竞赛习题,迈向科研级数学研究
2024年,AI斩获IMO赛事金牌;2025年,AI开始尝试求解各类公开悬而未决的数学难题;2026年,Claude Opus 5在黎曼基准取得79.0%,Claude研究版将黎曼零点下界推进至67.2%。
三件事指向同一个核心判断:AI数学推理能力的转折点,不在于训练数据,而在于推理执行阶段。
黎曼基准的题目设计本身就在推翻固有认知:数学推理必须等同于一场"闭卷考试"吗?现实中的数学研究从来不存在闭卷限制。数学家查阅学术论文、运行数值代码、借助计算机代数系统、和同行开展研讨。黎曼基准复刻真实科研环境,允许AI调用配套工具。Anthropic将Opus 5官方定位为可以端到端独立完成科研工作的智能体。
关闭工具时Claude Opus 5仅能解决60%的问题,启用工具后提升至79%。这19个百分点,就是"掌握理论知识"与"具备独立科研能力"之间的鸿沟。
推理算力拓展正在重塑行业认知:AI的推理上限不再由训练阶段的模型参数量决定,而是取决于推理过程愿意投入多少算力资源。
💡 从"所有前沿模型得分低于10%"到"Claude Opus 5单模型冲到79.0%",黎曼基准用一年时间,见证了AI数学推理深度从"竞赛解题"迈向"研究级探索"的跨越。而这场跨越的底层燃料,正是推理阶段的可调度算力。
当"推理算力拓展"成为范式,模型接入便是底座
Claude Opus 5在黎曼基准上取得的79.0%,以及Claude研究版推进67.25%下界的突破,共同折射出一个朴素的行业真相:当AI真正走入"工具调用+长链条推理+推理算力拓展"的研究范式,无论是前端的交互体验,还是后端的智能体编排,都需要稳定、合规、可负担的模型接入能力作为支撑。
对于需要长期、大规模调用全球主流大模型的团队而言,频繁遭遇地区可用性门槛、账号风控、跨境支付与多平台对接的摩擦,本身就是一个隐性成本。在这方面,UseAIAPI提供了一条清晰的路径:平台一站式聚合Gemini(含3.6 Flash、3.5 Flash、3.1 Pro等最新模型)、Claude、ChatGPT、DeepSeek等全球主流大模型的最新版本,无需为每个大模型分别注册海外账号、配置支付方式,一套API Key即可打通全球主流模型。
平台提供极具竞争力的优惠权益,折扣可达官方价格的50%,显著降低了高频次接口调用、高强度内容生成的重度使用成本,让团队无需为高昂的消耗而顾虑。对于企业用户,UseAIAPI还支持企业级定制化部署,可根据业务需求灵活配置并发、配额与路由策略,结合Batch机制与缓存机制,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低。平台通过海外合规节点接入官方API,提供企业级SLA保障,规避地区可用性门槛与数据中心IP风控风险。
📌 当AI从"解习题"迈向"开展学术研究",一套"无忧接入、按需扩展"的模型接入基础设施,与模型能力本身同样重要——这恰恰是UseAIAPI所致力于解决的问题。
79.0%不只是一个测试分数。它是AI数学推理从"闭卷答题"走向"开卷研究"的分水岭,也是整个行业从"模型能力竞争"走向"模型能力+接入底座协同"的新起点。当每一次调用都稳定、合规、可负担时,AI走进千行百业的脚步,才会走得更快、更稳。
而推理算力拓展,正是支撑这场跃迁的底层根基——它让"多想一会儿"成为可量化、可调度、可优化的资源,也让每一次"多想"的付出,都物有所值。