一项新研究通过"影子评估"测试前沿 AI 智能体能否独立完成开放式 AI 研究。
智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。
研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。
Sebuah penelitian baru menguji agen AI terkini melalui "penilaian bayangan" untuk melihat apakah agen tersebut dapat menyelesaikan penelitian AI terbuka se...
Sebuah penelitian baru menguji agen AI terkini melalui "penilaian bayangan" untuk melihat apakah
agen tersebut dapat menyelesaikan penelitian AI terbuka secara independen. Agen tersebut menyelesaikan semua tugas rekayasa dalam enam hari dengan biaya beberapa ribu dolar untuk komputasi, namun gagal membuat kemajuan substantif pada masalah inti dari dua makalah yang belum dipublikasikan di NeurIPS 2026, dan ditolak secara tegas oleh penulis asli. Penelitian ini mengidentifikasi lima pola kegagalan utama, termasuk penilaian standar publikasi yang kurang, desain penelitian yang kurang inovatif, ketidakmampuan untuk menelusuri jalan buntu, kesadaran sumber daya yang buruk, dan penyimpangan instruksi.
一项新研究通过"影子评估"测试前沿 AI 智能体能否独立完成开放式 AI 研究。
智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。
研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。
研究以“影子评估”检验前沿 AI 智能体独立开展开放式 AI 研究的能力。智能体虽在六天内完成全部工程任务,却未对两项核心研究问题取得实质性进展。
评估对象涉及两项未发表的 NeurIPS 2026 论文,实验投入为六天和数千美元算力。最终成果被原作者明确拒稿,显示工程任务完成不等于达到论文发表标准。
Aioga 判断,这项早期证据揭示了研究自动化中的关键落差:智能体能够推进工程执行,但在选题判断、研究创意与失败后的路线调整方面仍可能难以胜任开放式研究。
值得关注的是,研究归纳的五类失败模式同时涉及判断、创意、回溯、资源意识和指令遵循。这可能意味着,评估研究型智能体不能只看任务完成率,还需检查成果质量与过程稳定性。 Aioga 判断,后续应重点观察更多研究案例能否复现这些失败模式,并分别评估发表标准判断、研究设计、死胡同回溯、资源管理和指令稳定性,而非据两项案例作普遍结论。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: arxiv.org
Sumber: HuggingFace Daily Papers(社区热门论文)
原文链接: Buka sumber asli
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-29T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。