Andrej Karpathy 分享 Opus 5 场景渲染实测:展现强大代码能力但暴露出多模态感知弱点
Andrej Karpathy 分享了使用 Opus 5 渲染《指环王》场景的测试结果。该模型在两小时内生成了 5500 行 three.js 代码,展现出强大的空间编排与动画生成能力,但也暴露出因缺乏原生视频感知能力而难以自我审计的弱点。这一实测为评估前沿大模型在复杂定制化场景中的长文本与多模态能力提供了具体参考。
Andrej Karpathy 分享了使用 Opus 5 渲染《指环王》场景的测试结果。该模型在两小时内生成了 5500 行 three.js 代码,展现出强大的空间编排与动画生成能力,但也暴露出因缺乏原生视频感知能力而难以自我审计的弱点。这一实测为评估前沿大模型在复杂定制化场景中的长文本与多模态能力提供了具体参考。
Andrej Karpathy 分享了使用 Opus 5 渲染《指环王》场景的测试结果。该模型在两小时内生成了 5500 行 three.js 代码,展现出强大的空间编排与动画生成能力,但也暴露出因缺乏原生视频感知能力而难以自我审计的弱点。这一实测为评估前沿大模型在复杂定制化场景中的长文本与多模态能力提供了具体参考。
Andrej Karpathy 提出测试大模型能力的新思路,设想给予 Opus 5 百万 token 预算及长文本以观察其生成表现。Danny Limanseta 引用该观点并指出,当前 AI 构建游戏的最大瓶颈是模型有限的视觉能力。他认为,一旦视觉能力得到解锁,AI 将能够快速迭代并完善游戏开发,进而引发游戏与互动体验领域的爆发式增长。该讨论反映了业内对多模态能力在复杂交互场景中应用潜力的关注。
Andrej Karpathy 分享了对 Opus 5 模型的实测结果,他输入《指环王》首段文本并提供 100 万 Token 预算,模型耗时约 2 小时生成了 5500 行 Three.js 代码,成功实现了故事场景的程序化 3D 渲染。这一测试展示了新一代大模型在空间坐标编排与复杂动画生成上的长文本处理能力,预示着未来以极低成本按需生成高度定制化虚拟世界(如沉浸式游戏场景)的潜力。
Andrej Karpathy在加入Anthropic后首次发布长帖,展示了利用Opus 5模型在100万Token预算下生成《指环王》3D渲染内容的测试。他指出,当前AI在生成此类复杂内容时无法直接且连续地感知自身的输出状态,只能依赖分段截图。这一实测发现揭示了当前大模型在长上下文多模态生成任务中面临的视觉反馈局限性,为后续模型优化提供了参考方向。
Opus 5 模型以约 10 美元的成本生成了《指环王》相关的复杂输出,被业内人士视为评估大语言模型的新“鹈鹕测试”。该案例展示了模型在处理复杂叙事任务时的低成本与能力,为评估模型表现提供了一个新颖的参考视角。但作为单点测试展示,其对行业整体格局的实质性影响有限。
Andrej Karpathy 展示了对 Opus 5 模型的复杂生成能力测试。他向模型输入《指环王》第一段并提供 100 万 token 预算(约 10 美元),要求其生成 3D 渲染结果,以替代传统的简单 SVG 生成测试。这一实验反映了前沿大模型在处理长文本并生成复杂场景方面的能力演进,为大语言模型的评测提供了更具挑战性的新思路。
Andrej Karpathy 展示了一项大模型生成测试,向 Opus 5 提供《指环王》首段文本及 100 万 token 预算(约 10 美元),要求其生成对应的虚拟世界。开发者 Daniel San 转发并评论称,Three.js 将成为引领此类虚拟世界创建的核心库。该动态反映了业界对大模型在复杂 3D 场景生成能力的关注,预示着长上下文模型在文本到可交互世界转化中的应用潜力。