
Claude Opus 5:三段提示词"手搓"射击游戏,"试炼循环"开启智能体自主开发新范式
AI 编程圈正在被一段只有三段的提示词点燃。
事件的起点,是 AI 投资人、HyperWrite 前 CEO 马特·舒默(Matt Shumer)在 Claude Opus 5 发布两天后发布的一段演示视频:模型完全自主打造出一款可玩的第一人称射击游戏,"没有一行外部素材进入构建"。这段提示词随后被完整开源到 GitHub,全文仅有三个自然段,没有架构设计,没有文件树清单,省略了所有繁琐的步骤拆解。
真正引发行业震荡的,并非"AI 能做游戏"这一老话题,而是藏在三段提示词背后的工作机制——"试炼循环"(Gauntlet Loop)。
三段提示词,每一段都直击智能体协作的本质
舒默设计的提示词,逻辑链条清晰而紧凑:
第一段确立标杆。 要求打造一款画质水准对标最新《使命召唤》作品的射击游戏,从材质贴图到物理引擎,每一帧都必须是纯 3A 规格。
第二段拆解分工。 调度多个子智能体,为每项任务指派拥有独立记忆与专一职责的"专职工人",对每一个部件单独攻坚。
第三段设立严苛评审。 派出独立的评审智能体担任"批评家",将实际输出与真实《使命召唤》画面进行盲测并排对比,达不到 3A 标准就打回重做,循环往复。
值得注意的是,舒默在原文中着重强调:整个过程由智能体独立完成,无需人类介入。人类的角色不再是逐行编写代码,甚至不需要撰写详尽的提示词,而只需设定一个"足够高"的质量基准,把探索路径完全交给 AI 自主推进。Anthropic 内置的 /loop 技能,正是支撑这种"修复—测试—调整"反复迭代、防止运行过早停止的关键机制。
这与过去一年业界通行的"提示词工程"思路几乎相反。在"氛围编码"浪潮中,专家的建议是"用标准代替形容词"——告诉模型什么叫做"好",而不是只说"要做到 AAA"。舒默的做法接近反向操作:他让自己的子智能体"彻底惊艳",而把"惊艳"的具体定义,交给 Opus 5 自己构建的评审员去完成。
社区复刻潮:同一段提示词,跑出万千世界
舒默的提示词很快成为开发者社区的"必读之作",一大批基于 Opus 5 生成的游戏 Demo 接连涌现:
《Claude of Duty》:舒默原版射击游戏,所有贴图、动画、声音全部由 AI 生成,未使用任何外部素材;
《Operation Blackout》:前对冲基金经理詹姆斯·阿尔图彻(James Altucher)用同一段提示词跑出,耗时十多个小时、消耗约 130 万 Token,浏览器端可免费试玩;
自行车公路竞速:开发者耗费 12 亿 Token、投入 863 美元完成;
2.3MB 的《辐射》废土:整个游戏打包进一个 HTML 文件,包含可自由探索的 3D 废土世界、功能完备的哔哔小子(Pip-Boy),以及带有完整对话树的 NPC;
《我的世界》复刻版:支持程序化无限生成世界、15 种生物群系,同时兼容生存与创造双模式;
《指环王》3D 场景:AI 领域学者安德烈·卡帕西(Andrej Karpathy)给出 100 万 Token(约 10 美元)预算,两小时后模型输出 5500 行代码,生成对应 3D 场景。
somethingbig.ai 建立的游戏库中,所有作品都来自同一段三段提示词——从第一人称射击到赛车竞速,从航海冒险到破坏沙盒,用户可以"不驾驶它,只设定一根标杆,然后让智能体跑过试炼"。
程序化创作:被颠覆的不只是游戏开发
仔细观察这些 Demo 的技术路线,会发现 Opus 5 的生成模式更接近程序化创作:模型直接通过代码生成几何结构、纹理材质、物理特效乃至背景音乐,最终产出可直接在浏览器运行的 HTML 文件(如 2.3MB 的《辐射》废土)。
这意味着生成结果是可编辑、可复用的数字资产,而非视频生成模型那样只能输出连续画面。在传统 3D 开发高度依赖素材库、图像资源与游戏引擎的范式下,这条路打开了一扇新的门。
但冷静审视,这套技术方案距离成熟仍有距离。
第一重掣肘是感知闭环的缺失。 大语言模型无法原生"观看视频",更无法进入自己生成的游戏内部实地测试。卡帕西自制的《指环王》3D 世界成品质感相对粗糙——AI 可以写出 5500 行代码搭建 3D 世界,却看不见这个世界;它无法高效读取视频画面,也就没办法检查比尔博小屋的大门是否歪斜、树木模型是否穿插穿模。截至目前,所有复刻作品都未能面对舒默原项目那样的盲测挑战,真实《使命召唤》在每一轮对比中仍然胜出。
第二重掣肘是算力成本。 单次生成一款游戏花费 423 美元看似不贵,但这只是一次性生成成本。一旦需要迭代优化、反复调试修改,开销会快速暴涨。同时,目前所有测试都属于社区非正式评测,缺少统一任务指标、打分标准与可控实验环境。
⚠️ 客观来看:现有成果证明了"试炼循环"作为一种智能体协作结构的有效性,但尚不能完全证明模型是从想象中"设计"了一款游戏,还是重组了它已吸收的既有代码模式。
时代已然开启,但"好玩吗"仍是人类的阵地
那么,AI 游戏生成时代真的来临了吗?
答案是:时代已然开启,但远没到普通人仅凭一句话就能打造 3A 大作的阶段。真正到来的是更底层的变革——AI 正在从"单纯生成代码",进化为无需人工干预、自主完成端到端复杂任务的智能系统。
Opus 5 的突破,不只是提升游戏开发效率,而是拓宽了智能体独立处理复杂任务的能力边界。"试炼循环"最核心的思路可以抽象为三句话:给 AI 设定高标准,使其自主拆解任务、执行工作、自我评审、循环优化。这套流程一旦稳定跑通,适用场景将远远超出游戏开发范畴,延伸至软件开发、内容生产、科研模拟等一切需要"长程自主迭代"的领域。
黄仁勋三年前在 GTC 大会提到,未来十年所有像素都将由 AI 生成。Opus 5 确实推进了这个进程,但从"所有像素均可生成"到"像素内容具备可玩性",中间仍隔着漫漫长路。河对岸矗立着那个 AI 至今无法回答的古老问题:这游戏,好玩吗?
而这,正是留给人类开发者最后、也是最坚固的阵地。
从技术演示到生产落地:稳定、合规、低成本的接入路径
"试炼循环"展现出惊人潜力的同时,也把一个现实问题摆在开发者面前:要让智能体持续跑通"拆解—构建—评审—迭代"的长链路,背后是对 Claude、Gemini、ChatGPT、DeepSeek 等全球主流大模型的高强度、规模化调用。尤其是在重消耗场景下,如何在保证合规的前提下,把单位 Token 成本压到可持续的水平,直接决定了这套方法论能否从社区 Demo 走向企业生产。
在这一背景下,UseAIAPI 作为全球热门 AI 大模型的聚合接入服务平台,为开发者和企业用户提供了一条更为从容的路径。
平台一站式覆盖 Gemini(含 3.6 Flash、3.5 Flash、3.1 Pro 等最新模型)、Claude、ChatGPT、DeepSeek 等主流厂商的最新旗舰模型。企业无需分别与各家厂商签约、对接、结算,即可通过统一接口灵活调用多模型能力,并根据业务场景自由切换——这对需要在"隐私合规""推理质量""响应速度""单 Token 成本"之间反复权衡的生产环境而言,意味着更高的架构韧性与更低的运维复杂度。
在具体的成本优化上,平台为企业用户提供了低至官方价格五折的优惠权益。以 Gemini 主力模型为例,通过 UseAIAPI 接入后的实际成本为:
模型 | 官方价(输入/输出,每百万 Token) | UseAIAPI 接入价(输入/输出) |
|---|---|---|
Gemini 3.6 Flash | 1.50 / 7.50 美元 | 0.75 / 3.75 美元 |
Gemini 3.5 Flash | 1.50 / 9.00 美元 | 0.75 / 4.50 美元 |
Gemini 3.1 Pro(200K 以内) | 2.00 / 12.00 美元 | 1.00 / 6.00 美元 |
Gemini 3.1 Pro(200K 以上) | 4.00 / 18.00 美元 | 2.00 / 9.00 美元 |
叠加 Google 原生 Batch API 异步批处理 50% 折扣,对文档处理、分类、批量内容生成等离线友好型业务,成本优化空间显著。对于需要长期、大规模调用大模型跑智能体工作流的团队,这套"官方价五折起 + Batch 再五折"的组合,意味着原本因预算门槛而却步的重消耗场景,现在具备了落地可行性。
更重要的是,UseAIAPI 提供企业级定制化部署服务,可根据业务规模、调用峰值、合规要求等因素,量身定制接入方案与技术支持,通过海外合规节点接入官方 API,提供企业级 SLA 保障,规避个人开发者难以解决的地区可用性门槛与数据中心 IP 风控风险。平台层面还可对接 Gemini API 原生的项目支出上限与使用分层机制,让成本精细化管控成为可能。
💡 对开发者而言,AI API 的成本控制早已不是"选最便宜的模型",而是"在正确的场景路由正确的模型"。UseAIAPI 的一站式聚合能力,恰恰让这种"按需路由"的策略得以低成本实施——真正实现"无忧接入、按需扩展",不再为高强度内容生成的消耗而担忧。
当"试炼循环"把智能体的自主迭代能力推向新高度,底层接入服务的稳定性与成本效率,将成为决定这场范式革命能否走深走实的关键基础设施。AI 写代码的时代真的来了,而让 AI 持续、合规、低成本地写下去,是下一阶段行业共同面对的课题。