一项新研究通过"影子评估"测试前沿 AI 智能体能否独立完成开放式 AI 研究。
智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。
研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。
새로운 연구는 최첨단 AI 에이전트가 독립적으로 개방형 AI 연구를 수행할 수 있는지 테스트하기 위해 '섀도우 평가'를 사용합니다. 이 에이전트는 모든 엔지니어링 작업을 6일 만에 완료하고 수천 달러의 컴퓨팅 파워를 투입했으나, 두 개의 미발표 NeurIPS 2026 논문의 핵...
새로운 연구는 최첨단 AI 에이전트가 독립적으로 개방형 AI 연구를 수행할 수 있는지 테스트하기 위해 '섀도우 평가'를 사용합니다. 이 에이전트는 모든 엔지니어링 작업을 6일 만에
완료하고 수천 달러의 컴퓨팅 파워를 투입했으나, 두 개의 미발표 NeurIPS 2026 논문의 핵심 연구 질문에 대해서는 실질적인 진전을 이루지 못했고, 원저자들에 의해 명시적으로 거부되었습니다. 연구는 출판 기준에 대한 판단력 부족, 연구 설계 시 창의성 부족, 막다른 길을 효과적으로 추적하지 못함, 낮은 자원 인식, 그리고 지침 지연 등 다섯 가지 주요 실패 패턴을 확인했습니다.
一项新研究通过"影子评估"测试前沿 AI 智能体能否独立完成开放式 AI 研究。
智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。
研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。
研究以“影子评估”检验前沿 AI 智能体独立开展开放式 AI 研究的能力。智能体虽在六天内完成全部工程任务,却未对两项核心研究问题取得实质性进展。
评估对象涉及两项未发表的 NeurIPS 2026 论文,实验投入为六天和数千美元算力。最终成果被原作者明确拒稿,显示工程任务完成不等于达到论文发表标准。
Aioga 判断,这项早期证据揭示了研究自动化中的关键落差:智能体能够推进工程执行,但在选题判断、研究创意与失败后的路线调整方面仍可能难以胜任开放式研究。
值得关注的是,研究归纳的五类失败模式同时涉及判断、创意、回溯、资源意识和指令遵循。这可能意味着,评估研究型智能体不能只看任务完成率,还需检查成果质量与过程稳定性。 Aioga 判断,后续应重点观察更多研究案例能否复现这些失败模式,并分别评估发表标准判断、研究设计、死胡同回溯、资源管理和指令稳定性,而非据两项案例作普遍结论。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.
수집 채널: 요약 집계 · 원본 도메인: arxiv.org
출처: HuggingFace Daily Papers(社区热门论文)
원문 링크: 원문 열기
Aioga 아카이브: 정보 페이지 보기
Content record: summary-fallback · Updated: 2026-07-29T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga는 전 세계 AI 동향을 집계하고 확인과 인용을 위해 출처 정보를 보존합니다.