← 返回 Blog

Gemini 3.1 Pro ARC-AGI-2 飙到 77.1%,Deep Think 到底是真推理还是营销词?

2026 年 2 月,Gemini 3.1 Pro 在 ARC-AGI-2 上拿下 77.1%,较上代 Gemini 3 Pro 的 31.1% 直接翻倍。技术圈反应两极:一边刷屏"推理能力翻倍",另一边冷言"这分数到底靠不靠谱"。 两种观点各有道理,但都不够完整。

GeminiGemini 3.1 Pro

ARC-AGI-2 跑出 77.1%,Gemini 3.1 Pro 这波是真突破还是数字游戏?

2026 年 2 月,Gemini 3.1 Pro 在 ARC-AGI-2 上拿下 77.1%,较上代 Gemini 3 Pro 的 31.1% 直接翻倍。技术圈反应两极:一边刷屏"推理能力翻倍",另一边冷言"这分数到底靠不靠谱"。

两种观点各有道理,但都不够完整。

一、ARC-AGI-2 测的到底是什么

先把基准本身讲透。ARC-AGI-2 核心考抽象推理——模型碰到来没见过的全新逻辑规则时,能否仅靠少量示例归纳隐藏规律并作答。它和编程题不一样,编程题可以靠训练集"背答案",但这套基准每道题都是独一无二的新范式。

本轮成绩:Gemini 3.1 Pro 77.1%、Claude Opus 4.6 68.8%、GPT-5.2 52.9%。单看这张榜,3.1 Pro 确实和竞品拉开一截。

但有个极易被忽略的漏洞:同一模型、同一基准,不同机构测出来差很多。独立测评平台 LayerLens 对同一款 3.1 Pro 跑 ARC-AGI-2,得出 92.3%——和 77.1% 相差 15 个百分点。

📌 说明 ARC-AGI-2 的人为可调空间不小:测试集版本、提示词策略、解码参数,任意一项动一动,分数就能飘十多分。

所以 77.1% 有参考价值,但不能当定论。

二、"深度思考"是营销噱头吗

谷歌给 3.1 Pro 的定位是轻量化深度思考模型(Deep Think Mini),把旗舰 Deep Think 的推理能力下放到了基础版本。这里有个容易混的点要先厘清:

  • Gemini 3.1 Pro:API 定价 ≤200K Token 为 2/12​ 每 M tok,>200K 为 4/18

  • Gemini Deep Think:走 AI Ultra 订阅(99.99–199.99/月)或API预估∗∗15 / $60**​ 每 M tok,约为 3.1 Pro 的 10 倍

也就是说,3.1 Pro 和 Deep Think 是两条独立产品线。3.1 Pro 只是复用了 Deep Think 的架构思路,不等于花 $2 买到了 10 倍定价的推理性能——这点谷歌自己也没这么宣称,是社区传歪的。

本次实打实的升级,是推理档位从两档扩到三档:Low / Medium / High,分别对应日常问答、中等逻辑、复杂推演。切到 High 后,3.1 Pro 会并行铺多条推理路径,内部交叉验证再出最优解,这套逻辑和 Deep Think 同源。

这不是把"推理深度"当黑盒,而是把它交回给用户调控。在接口端动态配算力,比在多款专用模型间切来切去实用。

三、77.1% 背后的真实能力画像

单看 ARC-AGI-2,容易觉得 3.1 Pro 已到天花板;但 22 项主流基准横扫一圈,能力并不均衡。

优势赛道:科学推理断层领先

  • GPQA Diamond(研究生级科学推理)94.3%,超 GPT-5.2 的 92.4%

  • 无工具模式 Humanity's Last Exam 44.4%,大幅领先 GPT-5.2(34.5%)

  • SWE Bench Verified 80.6%,高于 Claude 系的 72.6%

短板赛道:SQL 与数据分析拉胯

  • BIRD-RITIC 数据库测评仅 32.5%,多表关联、子查询、隐性数据规律推导几乎全线崩

  • SWE Bench Lite 48.7%,仓库级大规模重构仍有大把提升空间

  • Terminal Punch 2.0 工程场景 68.5%,不及 GPT-5.3 代码专用模型的 77.3%

四、"锯齿状智能"才是最该警惕的

斯坦福《2026 年度 AI 指数报告》里有组冲击力的数据:同一模型能证复杂数学,但读模拟钟表准确率只有 50.1%。苹果研究院的补充实验进一步印证——题目符号、数字一换,模型正确率就滑坡,底层仍是模式匹配,不是真理解抽象。

ARC-AGI-2 的 77.1% 确实证明 3.1 Pro 在抽象推理上迈了一大步,但单赛道高分 ≠ 综合全能。高德纳那句评价很克制:"持续稳步提升,但尚未出现颠覆性质变。"

Epoch AI 还点出一个更值得盯的趋势:2026 年起,推理类大模型性能增长可能就到放缓拐点了。OpenAI 训 O3 投入的算力是前代 O1 的 10 倍,强化学习阶段已明显触到收益天花板——意味着推理能力的性能上限,可能比业界预想的来得早。

几句实在话

Deep Think 不是营销概念,它确实重塑了推理逻辑,性能提升可量化验证;但把它吹成"AGI 雏形"言过其实。

77.1% 是真实能力,但更像一块棱镜——只能从单一维度折射 3.1 Pro 的推理优势;换个场景,BIRD-RITIC 的 32.5% 立马露出另一面短板。

回头看 2026 年 2 月这份成绩单,它真正的价值或许不在于"离 AGI 还有多远",而在于首次把"可调节深度推理"从概念落地成了可部署的生产工具——尤其是 Medium 档位,把 Deep Think 那套并行验证思路下放到 2/12 的价位段,对工程和科研场景意义比分数本身大。

💡 旗舰性能归性能,账单归账单

3.1 Pro 这波最值得企业侧留意的,不是 77.1% 本身,而是推理档位放开后,"可调节"意味着你可以主动控成本——日常 Low、代码 High、复杂推演拉 Medium,不必一刀切全走 Deep Think 的 10 倍价。

但即便 3.1 Pro 本身只要 2/12(≤200K),架不住两件事:一是长上下文一开(>200K 跳 4/18,2M 窗口若后续 3.5 Pro 放开更贵),二是Deep Think 模式一旦误开或智能体长周期连跑,单日 token 消耗跳得比推理还快。再加上 Gemini、Claude Opus 4.8、GPT-5.6、DeepSeek V4 散在四五家,分别对接一次工程成本也不低。

这也是为什么不少团队会把 UseAIAPI​ 作为接入层一并考虑——

  • 模型池齐:Gemini、Claude、ChatGPT、DeepSeek 等海内外最新旗舰同池可调,3.1 Pro / Deep Think / Opus 4.8 / GPT-5.6 不用分别对接;

  • 企业级定制:合规接入、配额管控、日志审计都能谈,比个人中转稳、比自建省人;

  • 价格实:官方价基础上最低 5 折起——3.1 Pro 的 2/12 叠完、长上下文+Deep Think 误开防护+多模型统一账单,月度能再砍近一半。

简单说,77.1% 是谷歌交的答卷,UseAIAPI 解决的是"想用 3.1 Pro / Deep Think 又怕账单和链路两道坎"——海外旗舰 + 国产新锐 + 国内直连 + 官方价 5 折起,对重度使用者和企业来说,这套在 2026 年算是把"可调节深度推理"的生产化最后一环补齐了。