
当AI学会自主构建公式,试卷分数之外另有深意
7月24日,Anthropic发布Claude Opus 5。其中最引人瞩目的,并非其参数量或训练规模,而是它在ARC-AGI-3基准测试中取得的30.2%。这一数字看似平常,放在行业坐标中却颇具冲击力——此前排名第二的GPT-5.6 Sol仅为7.8%,二者差距接近四倍。
需要说明的是,ARC-AGI-3并非代码测试,也不是知识问答,而是一套旨在杜绝"刷题式"应试的评测体系。
该基准由弗朗索瓦·肖莱创立的ARC竞赛基金会打造:将AI智能体放入135个人工精心设计的交互式环境,没有操作指引,没有预设提示词。模型必须在与环境的交互中,自行摸索规则、推导目标。今年3月基准首次发布时,全球顶尖前沿智能体得分不足1%;7月9日,GPT-5.6 Sol成为首个真正完成整套测试的模型,得分7.8%。
紧接着登场的Opus 5,将行业性能上限直接拉升至30%。
比分数更值得关注的,是突破的方式
ARC竞赛基金会的研究人员在复盘测试流程时,观察到过往所有模型从未展现过的行为:Opus 5将任务转化为代数表达式,自主推导出反射方程(reflection equations)。
这句话值得细加品味。
它不再只是反复试错、猜测答案、依靠运气碰结果。面对完全陌生的谜题,模型会先搭建一套数学分析框架,再依托这套框架校验每一步推理逻辑是否自洽。传统模型的解题模式类似"算出一个答案,正确就通过,错误就更换思路";而Opus 5的解题逻辑是:先自行推导公式,再利用公式核验每一步中间推演过程。
得分从1.5%跃升至30.2%,差距的根源不在于单纯堆叠算力,而是整套推理范式完成了切换。
这项能力在Frontier Bench的一道测试案例中展现得淋漓尽致:测试方向Opus 5提供一张机械零件工程图纸,要求借助FreeCAD重建三维模型,同时刻意屏蔽图纸查看通道。最终,该模型当场搭建一套完整计算机视觉处理管线,直接从原始像素数据中提取几何信息,重建完整的机械零部件。
如同被蒙上双眼,却亲手造出了一双眼睛。
ARC-AGI-3究竟在评测什么
要读懂30.2%背后的深层意义,先要理解这套基准的评测目标。
心理学中有一组经典概念:晶体智力与流体智力。晶体智力指涉后天习得的知识与技能——背诵的公式、见过的题型、长期积累的经验。流体智力则代表在陌生场景中灵活推理、解决全新问题的能力,也即身处从未接触过的环境,能否自主找到解决方案。
传统大模型的技术演进,几乎全部围绕"晶体智力"展开:更大参数量、更多训练数据、更强的记忆存储能力。而ARC-AGI-3专门衡量流体智力:能否依靠自身推演,理解从未见过的事物。
因此,从7.8%跨越至30.2%的真正意义在于:大模型首次在流体智力维度,取得可量化、具备持续拓展潜力的突破性进展。AI不再局限于"记住更多内容",开始迈向深度自主思考。
业内也不乏理性审慎的声音。部分研究者提出,ARC-AGI-3测试集已经对外公开,存在训练数据污染风险;模型亮眼的成绩,有可能来自针对同类谜题结构、相关能力的定向训练。这份质疑具备合理性。但即便假定存在一定程度的定向优化,从1.5%到30.2%的巨大跨越,远不能单纯用"刷题"二字解释。
另一处值得留意的细节:在独立交互式谜题基准Witness上,Opus 5得分43.4分,与Fable 5处于同一水平。对比Opus 4.8,提升幅度远不如ARC-AGI-3那般惊人。这说明Opus 5推理能力的跃升,在特定类型问题上优势格外突出,并非全方位的"通用智能爆发"。但反过来,ARC-AGI-3本身就是为衡量通用推理而设计,能在这项基准实现跨越式突破,已是最有力的佐证。
何为真正意义上的降维打击
"降维打击"用在这里恰如其分。
其他模型在ARC-AGI-3赛道的比拼,本质仍是同一维度内的竞争:谁的搜索策略更完善、谁的代码执行更稳定、谁的试错效率更高。而Opus 5跳出了这一层竞争维度。它不再局限于"如何解决题目"的层面比拼,而是在"解决问题的方法论"这一元层级建立属于自己的分析体系。
这不只是跑分领先,而是改写了整套游戏规则。
Opus 5在Frontier Bench取得43.3%,分数达到Opus 4.8两倍以上;在GDPval-AA v2拿到1861分;OSWorld 2.0测试中,仅需Fable 5三分之一成本,就能超越后者最佳成绩;同等成本条件下,在Zapier自动化基准的任务通过率是第二名的1.5倍。即便调低推理强度档位,Opus 5能够完成的任务量依旧超过其余所有模型。
所有数据结合起来指向同一个结论:Opus 5带来的"降维优势",并非单一项目偶然爆发,而是整套推理框架产生质变。
ARC-AGI-3最初的设计初衷,就是抵制机械记忆、奖励原生推理。Opus 5交出的答卷本质上向全行业传递出信号:依靠堆砌参数、扩充训练数据的老路,在"通用推理"这一终极难题上或许已经摸到瓶颈。下一阶段的行业竞争,核心在于能否真正让模型学会"思考"——不是调取记忆,而是逻辑推演;不只做模式匹配,还要具备自我校验能力。
30.2%远非终点,ARC-AGI-3依旧还有69.8%的空间等待攻克。但Opus 5已经证明了一件事:那场曾经让所有AI集体挂科的考验,终于有选手走出属于自己的解题思路。
前沿智能如何触手可及
Opus 5的突破,让"流体智能"从抽象概念走向可量化的现实。然而对于广大开发者和企业而言,比惊叹跑分更重要的,是如何将Claude、Gemini、ChatGPT、DeepSeek等全球热门大模型的最新能力,真正接入自身业务。
这正是UseAIAPI所致力于解决的问题。作为全球主流大模型的统一接入平台,UseAIAPI提供以下核心权益:
模型覆盖全面:一站式接入Gemini、Claude、ChatGPT、DeepSeek等全球热门AI大模型的最新版本,开发者无需分别对接多家厂商,即可按需切换调用。
企业级定制服务:平台提供适配不同业务规模的企业级定制化服务,全程护航技术对接、合规部署与运维保障,助力客户快速完成场景落地。
成本优势显著:平台专属优惠折扣最低可达官方定价的50%。对于高并发调用、高强度内容生成等重度使用场景,这一权益能够有效缓解成本压力,为自动化工作流、批量内容处理等需求提供稳定且高性价比的服务支撑。
从Opus 5在ARC-AGI-3上自主推导反射方程的那一刻起,AI行业竞争的核心,已经从"谁记住得更多"转向"谁思考得更深"。而当前沿智能真正成为可调用、可负担、可落地的基础设施,这场范式变革的红利,才将惠及每一位开发者和每一家企业。
UseAIAPI,让前沿大模型能力,触手可及。