看似最愚蠢的AI提示竟击败了数月的精心游戏设计提示工程
就在Claude Opus 5发布两天后,AI投资者和前HyperWrite首席执行官Matt Shumer发布了一段视频,展示了该模型完全独立构建的可玩第一人称射击游戏。
“Claude Opus 5一击即中这个游戏,”他写道,并补充说没有任何外部资产被纳入构建中。
现在,你可能会认为如此高质量的输出需要一个长而详细、精心设计的提示来引导AI模型应对构建一个精致第一人称射击游戏的复杂性。
再想想吧。
其背后的提示仅有三段简短的文字,已在GitHub上完整发布。它告诉Opus 5构建一个与最新的《使命召唤》游戏水平相当的射击游戏,分派子代理——每个子代理都有自己的独立记忆和狭窄的任务——单独处理各个部分,并在每个部分上不断循环,直到它在盲测中与真实的《使命召唤》画面并排对比时表现出色。根据提示,结果应该是“完全完美的”。
这与提示工程师教人们工作的方式正好相反。在流行的编码热潮中,建议是指定标准而不是形容词:说明“好”的含义,而不仅仅是要求它。代码应该考虑什么,而不是简单地说“AAA”。
Shumer的版本几乎是相反的,要求其子代理“完全惊艳”,并将实际定义留给Opus 5为自己构建的批评者。
两个Claude Code特性承载了这个循环。子代理在隔离的上下文窗口中启动,拥有自己的指令和工具访问权限,因此评估武器模型的批评者不会继承构建者对其外观的借口。Ultracode是Claude Code的一个设置,推动模型达到其最高推理能力,并允许它编写自己的编排计划,将工作分配给多达16个代理,同时每次运行限制在1000个。
Anthropic内置的/loop技能,旨在进行重复的修正-测试-调整周期,确保运行不会在游戏看起来不错的那一刻停止。Shumer从未指定轮数。他让批评者不断指出新的差距,并让构建者追逐这些差距,直到他自己结束会话。
最终构建在Three.js和普通WebGL2上运行,代码大约有55,000行,分布在11个子系统中。每个纹理、网格、动画和声音都在加载时在浏览器内部生成——没有下载的模型、HDRI、图像文件或音频文件。Shumer自己发布的批评日志显示,分数从10分中的3.59上升到略高于5,仍然在每一轮中落后于真实游戏。
怀疑论者认为隐藏了数小时的手动编码,因此Shumer发布了整个提示和代码库。于是,模仿者开始出现。
前对冲基金经理和播客主持人James Altucher运行了相同的提示,并报告称在Opus 5上花费了“十个多小时”和大约130万个标记。他的构建,Operation Blackout,可以在浏览器中免费玩,并且看起来很棒。
Prompt Silo的开发者将相同的请求指向OpenAI的竞争对手旗舰,发布了“Sol 5.6 Ultra with same prompt”——Sol是OpenAI于7月9日普遍发布的三模型GPT-5.6系列的顶级版本,伴随更便宜的Terra和Luna版本。
开发者Leon Lin则采取了相反的做法,使用通常的详细提示。与其复制Shumer的简短版本,他着手“逆向工程这个游戏的提示”,生成了一份约20个部分的文档,详细说明了从布娃娃物理到级联阴影图的一切。他将其输入Cursor,使用普通的Opus 5进行高强度工作,没有子代理和Ultracode,结果是一个名为Dust Corridor的市场街射击游戏,也可以在浏览器中玩,并且看起来也很棒。
没有任何后续构建经历过Shumer在自己项目上进行的盲测。他的批评日志仍然显示真实的《使命召唤》在他记录的每一轮中获胜——这是Altucher和Atom Tan Studio用他确切的三段提示所追逐的目标,而Leon Lin则追逐着他自己大约20个部分的提示。
这其中有多少实际上是新的?
像Claude Code这样的代理编码工具以一种受监督的初级工程师可能的方式编写软件:它们读取文件,运行代码,查看生成的截图,并将工作的部分交给子代理和批评者,后者检查结果是否符合既定目标。这个循环是真实的,而Shumer的Gauntlet Loop是构建它的真实方式。单凭这一点并不能证明模型是凭空设计了一个游戏,而不是重新组合它已经吸收的代码模式。
这并不意味着《使命召唤》是假的,但它使得“从零开始构建”这一说法更难以完全认可,因此对这些结果要持谨慎态度。
研究代码生成模型的研究人员对更广泛的问题有一个名称:数据污染,当一个模型在某个任务上表现良好,主要是因为几乎相同的示例已经存在于其训练数据中,而不是因为它推理出了新的东西。
没有任何第一人称射击游戏的构建发布了对此类污染的检查。Shumer自己的代码库确实包含Claude的创造力,如果这样称呼是公平的话。这是一个理由,让“击中了一款AAA游戏”被解读为一个在编程中最详细记录的类型中工作的能力代理,而不是作为证明一个AI在没有先前艺术支持的情况下设计了一个射击游戏的证据。
-- 价格
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。
猜你喜欢

DGrid AI 深度解读:去中心化 AI 基础设施如何让服务「可调用、可验证、可结算」

Claude Code官方省Token指南:11个技巧让额度用得更久

AI时代未来最重要的5个习惯

Meta Muse Spark 1.2 和 Muse Code 低价档发布,价格比 DeepSeek 便宜29%

从「投机资产」到「下一代金融底层」,Crypto 正长出一套新的 TradFi 世界?

100亿美元买一个中转站?Stripe看中了OpenRouter什么

Karpathy 提出长篇口述 Prompt 工作法

字节跳动发布 Seed Audio 1.0 生成音频模型

Kimi K3 发布一周众生相:共识、分歧、大势

DeepSeek V4 API 疑似使用 Fable 5 模型

GPT-5.6 调用 64 个 Agent 提出 50 年猜想证明

砍掉80%系统提示词后,Claude Fable 5开始反问开发者

xBubble 如何破局 VC 重注的 OPC 经济

2026 最野 DeFi 收益策略:不赌暴涨,吃尽链上投机手续费

贝森特提到数字资产可能成为对伊朗制裁的新目标

以太坊与索拉纳:哪个L1能捕获更多价值?

Fables 积分十月收官,「短平快」美股做市协议值得参与吗?

Robinhood Chain 热度持续爆发,微软首度单列 Azure 营收|WEEX TradFi 每日市场简报(2026年9月3日)
本篇简报聚焦 Robinhood Chain 链上交易热度持续升温及其对 Arbitrum 生态收入的直接传导,微软提升 Azure 与 AI 基础设施收入透明度,以及博通在 AI 半导体高增长背景下面临的预期博弈。同时,市场也将把关注点转向美国8月非农就业报告与 Ciena 财报对宏观利率路径和光通信景气度的进一步验证。

股票代币化究竟还面临着哪些挑战?

x402 上线以来:1.5 亿笔交易、结算额与真实使用场景回顾

周五非农前瞻:就业降温遇上通胀反弹,美联储如何选择?

Arc 主网倒计时,第一批流量会流向哪里?

伦敦证券交易所与Payward达成合作,计划将100只英国股票进行代币化

无论沃什「加不加息」,他肯定是「自己人」

加密货币上涨但股东未能受益…Kaiko研究,数字资产财务公司结构性限制诊断

康奈尔大学调查显示,90%的人听说过比特币,但只有13%理解其概念 日本在25个国家中对“难以理解”的回答最多

什么是卖空(short)?交易一分钟

华尔街早报:美债抛售暂歇、美股收涨,软件股与日债拍卖暗藏隐忧

Rain合约漏洞导致用户损失110万美元



