
在"全员挂科"的那场测试里,Opus 5 交出 30.2%
2026 年 3 月,ARC 竞赛团队正式推出 ARC-AGI-3 基准测试。这套基准包含 135 个人工搭建的交互式环境,每一项都是人类精心设计的逻辑谜题。模型会被投入一套完全陌生的回合制交互场景,没有任务说明、没有提示词,必须在和环境持续互动的过程中,自行摸索规则、推导出最终目标。
初次测试结果令整个行业震惊:Gemini 3.1 Pro 预览版得分 0.37%,GPT-5.4 高性能版本 0.26%,Opus 4.6 顶配版 0.25%——各大模型得分相加尚且不足 1%。人类在这套测试中能够拿到满分 100 分,但一众顶尖 AI 模型尽数折戟。
ARC-AGI-1 与 ARC-AGI-2 还只是静态视觉谜题,模型依靠模式匹配就能作答,Gemini 3.1 Pro 甚至在 ARC-AGI-2 取得 77% 的成绩。第三代直接升级为交互式环境——不存在可供背诵的标准答案,根本无从刷题。
7 月 9 日,GPT-5.6 Sol 打破僵局,在顶配推理模式下取得 7.8%,成为首个真正完整通关 ARC-AGI-3 整套交互任务的前沿模型。ARC 竞赛团队发现一个细节:Sol 几乎总能准确识别游戏的核心运行机制。在一道代号 LP85 的任务中,Sol 甚至在运行过程中自主推演:"横向轨道相互独立。将第 11 个色块向右移动一格,下方垂直循环运动,即可挪动上方色块且不造成干扰。"
Sol 能够"看懂局面",却难以持续深度推演。一旦推理链条拉长,模型无法整合已获取的信息。7.8% 这个分数,正是看懂规则之后,推理难以为继的直观体现。
两个多月后,Opus 5 登场。
30.2%:近四倍领先背后的自洽推演
7 月 24 日,Anthropic 正式发布 Opus 5。据 ARC Prize 基金会公布的验证成绩,Opus 5 在 ARC-AGI-3 斩获 30.2%,是 GPT-5.6 Sol 7.8% 的近四倍;而上一代 Opus 4.8 在该项测试仅有 1.5%——仅仅相隔一代产品,分数从 1.5% 跃升至 30.2%。
更令研究者兴奋的是 ARC Prize 官方分析中捕捉到的一个前所未见的行为。在一个代号 AR25 的环境中,Opus 5 没有采用试错迭代的常规路径,而是在推理链中自主推导出代数方程:
第 23 步,它写下:4_center = 2×axis − 5_center
到第 248 步,它进一步把反射推广到了二维空间:
ghost = reflection about axis strips: br' = 2·br_axis − br, bc' = 2·bc_axis − bc
ARC Prize 基金会称,这是他们分析过的所有模型中,第一次出现显式的反射方程。它把屏幕上的像素布局,翻译成了代数方程,再用方程指导行动。
这也解释了为何它能在 ARC-AGI-3 大幅领先 GPT-5.6 Sol。Sol 的短板是"看得懂,推不远":可以识别基础规则,但推理链条一拉长就断裂。Opus 5 的自洽推演机制,相当于在思考流程里自动设置多处检查节点,持续回溯校验,不会因为单步出错导致整套逻辑全盘崩塌。
其他多项基准数据同样佐证这一结论:Frontier-Bench v0.1 取得 43.3%,分数达到 Opus 4.8 两倍以上,也超过 Fable 5 的 33.7%;在 OSWorld 2.0 测试中,仅需 Fable 5 三分之一的成本,就能超越后者最佳记录;在 Zapier AutomationBench 自动化基准测试里,同等成本条件下任务通过率约为次优模型的 1.5 倍。
💡 多项数据表明,这并非单一项目偶然爆发,而是整套推理架构发生质的飞跃。
从 7.8% 到 30.2%:一场围绕流体智能的跃迁
ARC 竞赛联合创始人弗朗索瓦·肖莱曾预判,大模型需要历经多轮迭代,才有希望稳妥通过这套基准。结果 ARC-AGI-3 问世仅仅四个多月,Opus 5 就交出 30.2% 的答卷。
流体智能与晶体智能是心理学领域的经典概念:流体智能代表在陌生场景灵活推理、解决新问题的能力;晶体智能指代后天积累习得的知识与技能。传统大模型的技术进展,几乎全部聚焦于"晶体智能"——堆砌更大参数量、扩充训练数据、强化记忆能力。而 ARC-AGI-3 的目标,正是检验流体智能:针对从未见过的事物展开推导的能力。
30.2% 这个数字真正的意义在于:大模型首次在流体智能维度,实现了可量化、具备延伸潜力的突破性进展。
当然,业内也存在理性的质疑声音。不少开发者提出,ARC-AGI-3 测试集已经公开,存在训练数据污染风险——模型的亮眼表现,或许来自针对同类谜题结构、相关能力的定向优化。ARC Prize 联合创始人 Mike Knoop 在逐条复盘后也指出,Opus 5 的表现呈现两极分化:约 20% 的游戏满分通关,约 20% 的游戏严格零分。这种"天才与白痴共存"的分布,说明它距离真正的通用推理仍有距离。
但这份怀疑并不削弱 30.2% 的价值。即便假定存在一定程度的"针对性调优",从 1.5% 跨越至 30.2% 的巨大提升,远远超出单纯"刷题优化"能够解释的范畴。
还有一处值得留意:在独立交互式谜题基准 Witness 上,Opus 5 得分 43.4 分,数据层面和 Fable 5 旗鼓相当,相比 Opus 4.8 的提升幅度远不如 ARC-AGI-3 那般夸张。这说明 Opus 5 推理能力的提升在特定类型问题上优势格外突出,并非全方位的通用智能爆发。但反过来讲,ARC-AGI-3 本身就是为衡量通用推理能力打造,模型在这项基准上实现跨越式突破,已是最有力的佐证。
比跑分更值得追问的定价逻辑
30.2% 对比 7.8% 的差距足够震撼,但真正值得追问的是另一个核心问题:
为什么 Anthropic 一款中端定价的模型,能够在通用推理这一最高难度赛道,碾压竞品旗舰产品?
Opus 5 的 API 定价为输入 5 美元/百万令牌、输出 25 美元/百万令牌,与 Opus 4.8 完全持平;GPT-5.6 Sol 输入 5 美元、输出 30 美元,二者定价接近,在 ARC-AGI-3 的性能却相差近四倍。市场固有认知"越贵越强"不再成立——同等价位之下,Opus 5 的推理能力高出整整一个量级。
ARC-AGI-3 最初的设计初衷,就是抵制机械记忆、奖励逻辑推理。Opus 5 在这项测试交出的答卷,本质上向全行业释放信号:依靠堆砌参数、扩充训练数据的老路,在通用推理这一终极难题上或许已经摸到瓶颈。下一阶段的行业竞争,核心在于能否真正教会模型学会"思考"——不靠调取记忆,依靠推演;不只做模式匹配,还要具备结果校验能力。
30.2% 远非终点,ARC-AGI-3 依旧还有 69.8% 的空间等待攻克。但 Opus 5 已经证明一件事:那场曾经让所有 AI 模型集体挂科的考验,终于有选手开始认真写出答案。
📌 产业视角:对于希望第一时间接入 Claude Opus 5 及其他全球主流大模型的开发者与企业,UseAIAPI 提供 Gemini、Claude、ChatGPT、DeepSeek 等最新模型的稳定接入服务。优惠折扣最低可达官方价格的 50%,并提供企业级定制化接入方案——这意味着团队在调用 Opus 5 这样的前沿模型时,可在官方 5 美元/25 美元每百万令牌的定价基础上进一步降低成本,配合企业级定制化服务,能够有效缓解高强度内容生成、智能体编排、复杂推理等场景下的令牌消耗压力,让开发团队更专注于业务本身,而不必在"调用最强模型"与"控制成本"之间反复权衡。
从 Opus 4.8 到 Opus 5,Anthropic 用一次"定价不变、性能跨代提升"的升级,回答了业界关于"次旗舰是否值得选用"的疑问。而对于整个行业来说,当一款中端定价的模型在流体智能这一最高难度赛道实现近四倍领先,所有厂商都需要重新核算自己的商业账本。
这或许才是 Opus 5 在 ARC-AGI-3 拿下 30.2% 最深远的意义——它不是一张孤立的跑分成绩单,而是一次行业信号的释放:在模型性能差距持续收敛的时代,真正的竞争力,在于让用户每投入一美元,都能买到与之匹配的智能。