这一测试思路的核心在于,它并非单纯考察文本到图像的转换,而是要求模型理解长篇叙事中的空间关系、物体属性与场景氛围,并编写出能在浏览器中实时渲染、可交互的 3D 代码。这同时涉及长上下文记忆、复杂指令遵循、几何建模以及编程能力,是对模型综合智能的“压力测试”IT之家。卡帕西本人并未公布具体实现细节或模型测试结果,原文未提供更多技术路径。
从行业趋势看,这种对 AI 长叙事与多模态生成能力的更高要求,也与近期视频生成领域的发展形成呼应。例如,火山引擎刚上线的 Seedance 2.5 API 便着重提升了长叙事与指令遵循能力,原生支持 30 秒视频直出,并兼容十余种语言IT之家。这反映出业界正从生成简短内容,转向构建更连贯、更复杂的多模态体验,与卡帕西提出的 3D 世界构建测试在思路上不谋而合。
IT之家 8 月 5 日消息,OpenAI 联合创始人安德烈 · 卡帕西(Andrej Karpathy)于 8 月 2 日在 X 平台发布推文,提出一项 AI 基准测试思路: 向模型提供《指环王》开篇首段文字,再要求模型创建对应的 3D 世界。 在测试 AI 模型时,此前业内习惯使用生成“鹈鹕骑车图”的 SVG 图片方式,用来评估大语言模型在空间推理、几何逻辑和复杂代码生成方面的真实水平。 不过卡帕西指出目前模型能力不断提升,等简单任务已不在话下,因此提出新的 AI 基准测试思路: 让模型根据文学文本构建可交互的 3D 场景,从而观察模型在代码生成、场景设计与多媒体制作方面的综合表现。 Karpathy 要求 Claude Opus 5 使用 three.js 创建 3D 世界,输入内容为《指环王》的首段文字。测试的最高资源额度为 100 万 tokens,成本约为 10 美元。在这一配置下,Claude Opus 5 耗时约 2 小时,输出约 5500 行代码。 生成作品以 3D 动画形式呈现《指环王》开场相关场景,其中包括人们参加比尔博告别宴会,以及充满财宝的洞穴。报道指出,该作品无法与人工耗费数小时制作的内容相比,但考虑到 AI 在约 2 小时内完成生成,其完成度仍较高。