卡帕西提出 AI 能力测试新思路:100 万 Tokens 让 Claude Opus 5 构建《指环王》3D 交互场景 这条更新来自 ithome.com,发布时间为 2026-08-05,Aioga 保留原文入口以便核验。
摘要:OpenAI 联合创始人卡帕西提出 AI 基准测试新思路:向模型提供《指环王》开篇首段文字,要求其创建可交互的 3D 世界。他以 100 万 tokens(成本约 10 美元)为额度,让 Claude Opus 5 用 three.js 构建场景,模型耗时约 2 小时输出约 5500 行代码,生成作品呈现比尔博告别宴会等画面,完成度较高。
背景:报道指出,业内此前曾通过生成“鹈鹕骑车图”的SVG任务,观察模型的空间推理、几何逻辑和复杂代码生成能力。卡帕西认为简单任务已难以充分体现当前模型水平,因此尝试引入代码、场景设计和多媒体制作相结合的任务。
Aioga 观察:Aioga判断,这一方案的价值在于把单一图像或代码输出扩展为可交互场景,便于观察模型处理文学描述和综合制作任务的表现。但材料只展示了一次案例,尚不足以证明其可作为稳定、可重复或可横向比较的正式基准。
影响与后续:值得关注的是,较长资源额度下,模型能够在约2小时内生成包含比尔博告别宴会和财宝洞穴等画面的3D作品。报道同时强调,其效果仍不能与人工耗费数小时制作的内容相比,因此完成速度与成品质量需要分别评估。 Aioga判断,后续若要验证这一测试思路,可关注是否公开更明确的任务规则、评价标准与可重复结果,并比较不同模型在相同文学文本、资源额度和工具条件下的输出。现有材料未提供此类对照数据,不宜据此排列模型能力。






