{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-30T05:40:21.510Z","headline":"AI 智能体能否进行开放式 AI 研究？两项案例的早期证据","description":"一项新研究通过\"影子评估\"测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务，但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展，被原作者明确拒稿。研究识别出五大失败模式，包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。","url":"https://www.aioga.com/news/cms6x4iu80273rouqra49hny9/","mainEntityOfPage":"https://www.aioga.com/news/cms6x4iu80273rouqra49hny9/","datePublished":"2026-07-29T00:00:00.000Z","dateModified":"2026-07-29T00:00:00.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://arxiv.org/abs/2607.27191","https://aihot.virxact.com/items/cms6x4iu80273rouqra49hny9"],"canonicalUrl":"https://www.aioga.com/news/cms6x4iu80273rouqra49hny9/","directAnswer":{"@type":"Answer","text":"研究以“影子评估”检验前沿 AI 智能体独立开展开放式 AI 研究的能力。智能体虽在六天内完成全部工程任务，却未对两项核心研究问题取得实质性进展。","url":"https://www.aioga.com/news/cms6x4iu80273rouqra49hny9/","dateCreated":"2026-07-29T00:00:00.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"arXiv source article","url":"https://arxiv.org/abs/2607.27191","datePublished":"2026-07-29T00:00:00.000Z","provider":{"@type":"Organization","name":"arXiv","url":"https://arxiv.org/abs/2607.27191"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cms6x4iu80273rouqra49hny9","datePublished":"2026-07-29T00:00:00.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cms6x4iu80273rouqra49hny9"}}],"aggregationSource":"HuggingFace Daily Papers（社区热门论文）","originalPublisher":{"name":"arXiv","url":"https://arxiv.org/abs/2607.27191"},"article":{"id":"cms6x4iu80273rouqra49hny9","slug":"cms6x4iu80273rouqra49hny9","url":"https://www.aioga.com/news/cms6x4iu80273rouqra49hny9/","title":"AI 智能体能否进行开放式 AI 研究？两项案例的早期证据","title_en":"Can AI agents conduct open-ended AI research？ Early evidence from two case studies","summary":"一项新研究通过\"影子评估\"测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务，但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展，被原作者明确拒稿。研究识别出五大失败模式，包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。","source":"HuggingFace Daily Papers（社区热门论文）","sourceUrl":"https://arxiv.org/abs/2607.27191","aiHotUrl":"https://aihot.virxact.com/items/cms6x4iu80273rouqra49hny9","publishedAt":"2026-07-29T00:00:00.000Z","category":"论文研究","score":72,"selected":true,"articleBody":["一项新研究通过\"影子评估\"测试前沿 AI 智能体能否独立完成开放式 AI 研究。","智能体在六天和数千美元算力下完成了全部工程任务，但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展，被原作者明确拒稿。","研究识别出五大失败模式，包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。"],"articleImages":[],"mediaStatus":"none","articleBodyZh":[],"translationStatus":"","bodyOrigin":"summary-fallback","editorial":{"summary":"研究以“影子评估”检验前沿 AI 智能体独立开展开放式 AI 研究的能力。智能体虽在六天内完成全部工程任务，却未对两项核心研究问题取得实质性进展。","background":"评估对象涉及两项未发表的 NeurIPS 2026 论文，实验投入为六天和数千美元算力。最终成果被原作者明确拒稿，显示工程任务完成不等于达到论文发表标准。","viewpoint":"Aioga 判断，这项早期证据揭示了研究自动化中的关键落差：智能体能够推进工程执行，但在选题判断、研究创意与失败后的路线调整方面仍可能难以胜任开放式研究。","implications":"值得关注的是，研究归纳的五类失败模式同时涉及判断、创意、回溯、资源意识和指令遵循。这可能意味着，评估研究型智能体不能只看任务完成率，还需检查成果质量与过程稳定性。","nextStep":"Aioga 判断，后续应重点观察更多研究案例能否复现这些失败模式，并分别评估发表标准判断、研究设计、死胡同回溯、资源管理和指令稳定性，而非据两项案例作普遍结论。","evidenceRefs":["title","summary","articleBody","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-07-30T03:02:23.164Z","sourceHash":"c8cb41e1da943473","review":{"approved":true,"groundedness":91,"clarity":90,"duplicationRisk":18,"blockingIssues":[],"notes":["“选题判断”与来源中的“对发表标准判断不足”并不完全等同，建议改为“发表标准判断”，以更准确对应原文。","“研究自动化中的关键落差”和后续评估建议均明确标注为“Aioga 判断”或使用“可能意味着”，属于基于来源的审慎观点，没有冒充已证实事实。","候选内容保留了“两项案例”的范围限制，并明确提醒不应据此作普遍结论，未对早期证据进行过度外推。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","low-source-overlap","no-html","independent-ai-review"]}},"tags":["论文研究","HuggingFace Daily Papers（社区热门论文）"],"translations":{"zh-CN":{"title":"AI 智能体能否进行开放式 AI 研究？两项案例的早期证据","summary":"一项新研究通过\"影子评估\"测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务，但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展，被原作者明确拒稿。研究识别出五大失败模式，包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。","category":"论文研究","source":"arXiv","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"AI 智能体能否进行开放式 AI 研究？两项案例的早期证据 - Aioga AI资讯","description":"一项新研究通过\"影子评估\"测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务，但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展，被原作者明确拒稿。研究识别出五大失败模式，包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。","url":"https://www.aioga.com/news/cms6x4iu80273rouqra49hny9/"},"en":{"title":"Can AI Agents Conduct Open-Ended AI Research? Early Evidence from Two Cases","summary":"A new study tested whether advanced AI agents could independently conduct open-ended AI research through a 'shadow evaluation'. The agent completed all engineering tasks in six days with computational costs of a few thousand dollars but did not achieve substantive progress on the core research questions of two unpublished NeurIPS 2026 papers and was explicitly rejected by the original authors. The study identified five major failure patterns, including insufficient judgment of publication standards, lack of creativity in research design, inability to effectively backtrack dead ends, poor resource awareness, and instruction drift.","category":"Research","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Can AI Agents Conduct Open-Ended AI Research? Early Evidence from Two Cases - Aioga AI News","description":"A new study tested whether advanced AI agents could independently conduct open-ended AI research through a 'shadow evaluation'. The agent completed all engineering tasks in six day...","url":"https://www.aioga.com/en/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:00:41.287Z"},"ja":{"title":"AIエージェントはオープンAI研究を行うことができるのか? 2件の初期の証拠","summary":"新しい研究では「シャドウアセスメント」を用いて、最先端のAIエージェントが独立してオープンAI研究を行えるかどうかを検証しています。 このエージェントはすべてのエンジニアリング作業を6日間で完了し、数千ドルの計算能力を費やしましたが、未発表のNeurIPS 2026論文の中核研究課題については大きな進展を示せず、元の著者たちから明確に却下されました。 研究は、出版基準の判断不全、研究デザインにおける創造性の欠如、行き止まりを効果的に追跡できないこと、リソース認識の低さ、指示のドリフトなど、5つの主要な失敗パターンを特定しました。","category":"論文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"AIエージェントはオープンAI研究を行うことができるのか? 2件の初期の証拠 - Aioga AIニュース","description":"新しい研究では「シャドウアセスメント」を用いて、最先端のAIエージェントが独立してオープンAI研究を行えるかどうかを検証しています。 このエージェントはすべてのエンジニアリング作業を6日間で完了し、数千ドルの計算能力を費やしましたが、未発表のNeurIPS 2026論文の中核研究課題については大きな進展を示せず、元の著者たちから明確に却下されました。 研究は...","url":"https://www.aioga.com/ja/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:00:43.464Z"},"ko":{"title":"AI 에이전트가 개방형 AI 연구를 수행할 수 있을까요? 두 사건의 초기 증거","summary":"새로운 연구는 최첨단 AI 에이전트가 독립적으로 개방형 AI 연구를 수행할 수 있는지 테스트하기 위해 '섀도우 평가'를 사용합니다. 이 에이전트는 모든 엔지니어링 작업을 6일 만에 완료하고 수천 달러의 컴퓨팅 파워를 투입했으나, 두 개의 미발표 NeurIPS 2026 논문의 핵심 연구 질문에 대해서는 실질적인 진전을 이루지 못했고, 원저자들에 의해 명시적으로 거부되었습니다. 연구는 출판 기준에 대한 판단력 부족, 연구 설계 시 창의성 부족, 막다른 길을 효과적으로 추적하지 못함, 낮은 자원 인식, 그리고 지침 지연 등 다섯 가지 주요 실패 패턴을 확인했습니다.","category":"연구","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"AI 에이전트가 개방형 AI 연구를 수행할 수 있을까요? 두 사건의 초기 증거 - Aioga AI 뉴스","description":"새로운 연구는 최첨단 AI 에이전트가 독립적으로 개방형 AI 연구를 수행할 수 있는지 테스트하기 위해 '섀도우 평가'를 사용합니다. 이 에이전트는 모든 엔지니어링 작업을 6일 만에 완료하고 수천 달러의 컴퓨팅 파워를 투입했으나, 두 개의 미발표 NeurIPS 2026 논문의 핵심 연구 질문에 대해서는 실질적인 진전을 이루...","url":"https://www.aioga.com/ko/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:00:52.179Z"},"es":{"title":"¿Pueden los agentes de IA realizar investigación de IA de manera abierta? Primeras evidencias de dos casos","summary":"Un nuevo estudio utiliza la \"evaluación en la sombra\" para probar si los agentes de IA avanzados pueden realizar investigación de IA abierta de manera independiente. Los agentes completaron todas las tareas de ingeniería en seis días y con varios miles de dólares en potencia de cálculo, pero no lograron avanzar significativamente en los problemas de investigación centrales de dos artículos inéditos de NeurIPS 2026, siendo rechazados explícitamente por los autores originales. El estudio identificó cinco principales modos de fallo, incluyendo insuficiente juicio sobre los estándares de publicación, falta de creatividad en el diseño de investigación, incapacidad de retroceder efectivamente desde callejones sin salida, conciencia limitada de los recursos y desviación de instrucciones.","category":"Investigación","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"¿Pueden los agentes de IA realizar investigación de IA de manera abierta? Primeras evidencias de dos casos - Aioga Noticias de IA","description":"Un nuevo estudio utiliza la \"evaluación en la sombra\" para probar si los agentes de IA avanzados pueden realizar investigación de IA abierta de manera independiente. Los agentes co...","url":"https://www.aioga.com/es/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:00:50.614Z"},"fr":{"title":"Les agents IA peuvent-ils mener des recherches ouvertes en IA ? Premières preuves issues de deux affaires","summary":"Une nouvelle étude utilise l'« évaluation de l’ombre » pour tester si des agents d’IA de pointe peuvent mener de manière indépendante des recherches ouvertes en IA. L’agent a terminé toutes les tâches d’ingénierie en six jours et a dépensé des milliers de dollars de puissance de calcul, mais n’a pas réussi à progresser substantiellement sur les questions de recherche fondamentales de deux articles NeurIPS 2026 non publiés, et a été explicitement rejeté par les auteurs originaux. L’étude a identifié cinq schémas majeurs d’échec, notamment un jugement insuffisant des critères de publication, un manque de créativité dans la conception de la recherche, une incapacité à remonter efficacement aux impasses, une faible connaissance des ressources et une dérive pédagogique.","category":"Recherche","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Les agents IA peuvent-ils mener des recherches ouvertes en IA ? Premières preuves issues de deux affaires - Aioga Actualités IA","description":"Une nouvelle étude utilise l'« évaluation de l’ombre » pour tester si des agents d’IA de pointe peuvent mener de manière indépendante des recherches ouvertes en IA. L’agent a termi...","url":"https://www.aioga.com/fr/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:01:00.958Z"},"de":{"title":"Können KI-Agenten offene KI-Forschung betreiben? Frühe Hinweise aus zwei Fallstudien","summary":"Eine neue Studie testete durch „Schattenevaluation“, ob fortschrittliche KI-Agenten eigenständig offene KI-Forschung durchführen können. Der Agent erledigte alle Ingenieursaufgaben innerhalb von sechs Tagen und mehreren tausend Dollar Rechenressourcen, konnte jedoch bei den Kernforschungsfragen von zwei unveröffentlichten NeurIPS 2026-Papieren keinen substanziellen Fortschritt erzielen und wurde von den Originalautoren klar abgelehnt. Die Studie identifizierte fünf Hauptfehlschlagmuster, darunter unzureichendes Urteilsvermögen über Veröffentlichungsstandards, mangelnde Kreativität im Forschungsdesign, fehlende Fähigkeit zur effektiven Rückverfolgung von Sackgassen, geringe Ressourcenwahrnehmung und Befehlsdrift.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Können KI-Agenten offene KI-Forschung betreiben? Frühe Hinweise aus zwei Fallstudien - Aioga KI-News","description":"Eine neue Studie testete durch „Schattenevaluation“, ob fortschrittliche KI-Agenten eigenständig offene KI-Forschung durchführen können. Der Agent erledigte alle Ingenieursaufgaben...","url":"https://www.aioga.com/de/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:00:59.282Z"},"pt-BR":{"title":"Agentes de IA podem realizar pesquisa aberta em IA? Evidências iniciais de dois casos","summary":"Um novo estudo testou, através de 'avaliação sombra', se agentes avançados de IA conseguem realizar pesquisa aberta em IA de forma independente. O agente completou todas as tarefas de engenharia em seis dias com alguns milhares de dólares de computação, mas não fez progresso substancial nas questões centrais de dois artigos não publicados do NeurIPS 2026, sendo rejeitado pelos autores originais. O estudo identificou cinco modos de falha, incluindo julgamento inadequado sobre padrões de publicação, falta de criatividade no design da pesquisa, incapacidade de retroceder em becos sem saída, baixa consciência de recursos e deriva de instruções.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Agentes de IA podem realizar pesquisa aberta em IA? Evidências iniciais de dois casos - Aioga Notícias de IA","description":"Um novo estudo testou, através de 'avaliação sombra', se agentes avançados de IA conseguem realizar pesquisa aberta em IA de forma independente. O agente completou todas as tarefas...","url":"https://www.aioga.com/pt-BR/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:01:08.426Z"},"ru":{"title":"Могут ли агенты ИИ проводить открытые исследования в области ИИ? Ранние доказательства по двум делам","summary":"Новое исследование использует «теневой оценку» для проверки, могут ли передовые агенты ИИ самостоятельно проводить открытые исследования в области ИИ. Агент выполнил все инженерные задачи за шесть дней и потратил вычислительные мощности на тысячи долларов, но не смог добиться значительного прогресса по ключевым исследовательским вопросам двух неопубликованных статей NeurIPS 2026 и был явно отклонён оригинальными авторами. Исследование выявило пять основных закономерностей неудач, включая недостаточную оценку критериев публикации, недостаток креативности в дизайне исследований, неспособность эффективно проследить тупики, низкую осведомлённость о ресурсах и дрейф обучения.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Могут ли агенты ИИ проводить открытые исследования в области ИИ? Ранние доказательства по двум делам - Aioga Новости ИИ","description":"Новое исследование использует «теневой оценку» для проверки, могут ли передовые агенты ИИ самостоятельно проводить открытые исследования в области ИИ. Агент выполнил все инженерные...","url":"https://www.aioga.com/ru/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:01:09.646Z"},"ar":{"title":"هل يمكن لوكلاء الذكاء الاصطناعي إجراء أبحاث مفتوحة حول الذكاء الاصطناعي؟ الأدلة المبكرة من قضيتين","summary":"تستخدم دراسة جديدة \"تقييم الظل\" لاختبار ما إذا كان بإمكان وكلاء الذكاء الاصطناعي المتقدمين إجراء أبحاث مفتوحة في الذكاء الاصطناعي بشكل مستقل. أكمل العميل جميع المهام الهندسية في ستة أيام وكلف آلاف الدولارات من قوة الحوسبة، لكنه فشل في تحقيق تقدم كبير في الأسئلة البحثية الأساسية لورقتين غير منشورتين من NeurIPS 2026، وتم رفضه صراحة من قبل المؤلفين الأصليين. حددت الدراسة خمسة أنماط فشل رئيسية، منها الحكم غير الكافي على معايير النشر، ونقص الإبداع في تصميم الأبحاث، وعدم القدرة على تتبع الطرق المسدودة بفعالية، وضعف الوعي بالموارد، وانحرافها في التعليم.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"هل يمكن لوكلاء الذكاء الاصطناعي إجراء أبحاث مفتوحة حول الذكاء الاصطناعي؟ الأدلة المبكرة من قضيتين - Aioga أخبار الذكاء الاصطناعي","description":"تستخدم دراسة جديدة \"تقييم الظل\" لاختبار ما إذا كان بإمكان وكلاء الذكاء الاصطناعي المتقدمين إجراء أبحاث مفتوحة في الذكاء الاصطناعي بشكل مستقل. أكمل العميل جميع المهام الهندسية في ست...","url":"https://www.aioga.com/ar/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:01:18.200Z"},"hi":{"title":"क्या एआई एजेंट खुले एआई अनुसंधान का संचालन कर सकते हैं? दो मामलों के शुरुआती सबूत","summary":"एक नया अध्ययन यह जांचने के लिए \"छाया मूल्यांकन\" का उपयोग करता है कि क्या अत्याधुनिक एआई एजेंट स्वतंत्र रूप से खुले एआई अनुसंधान का संचालन कर सकते हैं। एजेंट ने सभी इंजीनियरिंग कार्यों को छह दिनों में पूरा किया और कंप्यूटिंग शक्ति में हजारों डॉलर लगाए, लेकिन दो अप्रकाशित न्यूरआईपीएस 2026 पेपर के मुख्य शोध प्रश्नों पर पर्याप्त प्रगति करने में विफल रहा, और मूल लेखकों द्वारा स्पष्ट रूप से खारिज कर दिया गया। अध्ययन ने पांच प्रमुख विफलता पैटर्न की पहचान की, जिसमें प्रकाशन मानदंडों का अपर्याप्त निर्णय, अनुसंधान डिजाइन में रचनात्मकता की कमी, प्रभावी ढंग से मृत सिरों का पता लगाने में असमर्थता, खराब संसाधन जागरूकता और निर्देश बहाव शामिल हैं।","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"क्या एआई एजेंट खुले एआई अनुसंधान का संचालन कर सकते हैं? दो मामलों के शुरुआती सबूत - Aioga AI समाचार","description":"एक नया अध्ययन यह जांचने के लिए \"छाया मूल्यांकन\" का उपयोग करता है कि क्या अत्याधुनिक एआई एजेंट स्वतंत्र रूप से खुले एआई अनुसंधान का संचालन कर सकते हैं। एजेंट ने सभी इंजीनियरिंग कार्...","url":"https://www.aioga.com/hi/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:01:18.234Z"},"it":{"title":"Gli agenti AI possono svolgere ricerca AI aperta? Prime evidenze da due casi","summary":"Un nuovo studio ha testato tramite \"shadow evaluation\" se agenti AI all'avanguardia possono completare autonomamente la ricerca AI aperta. Gli agenti hanno completato tutti i compiti ingegneristici in sei giorni e con potenza di calcolo per alcune migliaia di dollari, ma non sono riusciti a fare progressi sostanziali sui problemi di ricerca principali di due articoli NeurIPS 2026 non pubblicati, venendo respinti dagli autori originali. Lo studio ha identificato cinque principali modalità di fallimento: giudizio insufficiente sugli standard di pubblicazione, scarsa creatività nel design della ricerca, incapacità di recuperare efficacemente vicoli ciechi, scarsa consapevolezza delle risorse e deriva delle istruzioni.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Gli agenti AI possono svolgere ricerca AI aperta? Prime evidenze da due casi - Aioga Notizie IA","description":"Un nuovo studio ha testato tramite \"shadow evaluation\" se agenti AI all'avanguardia possono completare autonomamente la ricerca AI aperta. Gli agenti hanno completato tutti i compi...","url":"https://www.aioga.com/it/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:01:25.695Z"},"nl":{"title":"Kunnen AI-agenten open AI-onderzoek uitvoeren? Vroege bewijzen uit twee cases","summary":"Een nieuwe studie test via een 'schaduwevaluatie' of geavanceerde AI-agenten zelfstandig open AI-onderzoek kunnen uitvoeren. De agent voltooide binnen zes dagen en met enkele duizenden dollars aan rekenkracht alle engineeringtaken, maar boekte geen substantiële vooruitgang bij de kernonderzoeksvragen van twee ongepubliceerde NeurIPS 2026-artikelen, en werd duidelijk afgewezen door de oorspronkelijke auteurs. De studie identificeerde vijf grote faalpatronen, waaronder onvoldoende oordeelsvorming over publicatienormen, gebrek aan creatieve onderzoeksopzet, onvermogen om doodlopende paden effectief terug te draaien, slechte bewustwording van middelen en opdrachtverschuiving.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Kunnen AI-agenten open AI-onderzoek uitvoeren? Vroege bewijzen uit twee cases - Aioga AI-nieuws","description":"Een nieuwe studie test via een 'schaduwevaluatie' of geavanceerde AI-agenten zelfstandig open AI-onderzoek kunnen uitvoeren. De agent voltooide binnen zes dagen en met enkele duize...","url":"https://www.aioga.com/nl/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:01:25.101Z"},"tr":{"title":"Yapay Zeka Ajanları Açık Uçlu AI Araştırması Yapabilir mi? İki Vaka Üzerine Erken Kanıtlar","summary":"Yeni bir çalışma, öncü AI ajanlarının bağımsız şekilde açık uçlu AI araştırması yapıp yapamayacağını \"gölge değerlendirme\" yöntemiyle test etti. Ajan, altı gün ve birkaç bin dolarlık hesaplama gücü ile tüm mühendislik görevlerini tamamladı, ancak yayımlanmamış iki NeurIPS 2026 makalesinin temel araştırma sorunlarında kayda değer ilerleme sağlayamadı ve özgün yazarlar tarafından açıkça reddedildi. Çalışma, yayımlama standartlarını doğru değerlendirememe, araştırma tasarımında yaratıcılık eksikliği, çıkmazları etkili şekilde geri takip edememe, kaynak farkındalığının düşük olması ve talimat sapması olmak üzere beş temel başarısızlık modelini belirledi.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Yapay Zeka Ajanları Açık Uçlu AI Araştırması Yapabilir mi? İki Vaka Üzerine Erken Kanıtlar - Aioga AI Haberleri","description":"Yeni bir çalışma, öncü AI ajanlarının bağımsız şekilde açık uçlu AI araştırması yapıp yapamayacağını \"gölge değerlendirme\" yöntemiyle test etti. Ajan, altı gün ve birkaç bin dolarl...","url":"https://www.aioga.com/tr/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:01:33.722Z"},"vi":{"title":"Các AI agent có thể tiến hành nghiên cứu AI mở không? Bằng chứng sớm từ hai trường hợp","summary":"Một nghiên cứu mới đã thử nghiệm các AI agent tiên tiến có thể tự triển khai nghiên cứu AI mở thông qua \"đánh giá bóng\". AI agent đã hoàn thành tất cả nhiệm vụ kỹ thuật trong sáu ngày với hàng nghìn đô la chi phí tính toán, nhưng không tiến triển đáng kể với hai vấn đề nghiên cứu cốt lõi của các bài báo NeurIPS 2026 chưa công bố, bị tác giả gốc từ chối rõ ràng. Nghiên cứu nhận diện năm dạng thất bại chính, bao gồm đánh giá chuẩn xuất bản chưa đầy đủ, thiết kế nghiên cứu thiếu sáng tạo, không thể quay lại những ngõ cụt, thiếu ý thức tài nguyên và lệch lệnh.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Các AI agent có thể tiến hành nghiên cứu AI mở không? Bằng chứng sớm từ hai trường hợp - Tin tức AI Aioga","description":"Một nghiên cứu mới đã thử nghiệm các AI agent tiên tiến có thể tự triển khai nghiên cứu AI mở thông qua \"đánh giá bóng\". AI agent đã hoàn thành tất cả nhiệm vụ kỹ thuật trong sáu n...","url":"https://www.aioga.com/vi/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:01:33.040Z"},"id":{"title":"Apakah agen AI dapat melakukan penelitian AI terbuka? Bukti awal dari dua kasus","summary":"Sebuah penelitian baru menguji agen AI terkini melalui \"penilaian bayangan\" untuk melihat apakah agen tersebut dapat menyelesaikan penelitian AI terbuka secara independen. Agen tersebut menyelesaikan semua tugas rekayasa dalam enam hari dengan biaya beberapa ribu dolar untuk komputasi, namun gagal membuat kemajuan substantif pada masalah inti dari dua makalah yang belum dipublikasikan di NeurIPS 2026, dan ditolak secara tegas oleh penulis asli. Penelitian ini mengidentifikasi lima pola kegagalan utama, termasuk penilaian standar publikasi yang kurang, desain penelitian yang kurang inovatif, ketidakmampuan untuk menelusuri jalan buntu, kesadaran sumber daya yang buruk, dan penyimpangan instruksi.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Apakah agen AI dapat melakukan penelitian AI terbuka? Bukti awal dari dua kasus - Berita AI Aioga","description":"Sebuah penelitian baru menguji agen AI terkini melalui \"penilaian bayangan\" untuk melihat apakah agen tersebut dapat menyelesaikan penelitian AI terbuka secara independen. Agen ter...","url":"https://www.aioga.com/id/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:01:41.789Z"},"th":{"title":"เอเจนต์ AI สามารถทําการวิจัย AI แบบเปิดได้หรือไม่? หลักฐานเบื้องต้นจากสองคดี","summary":"การศึกษาชิ้นใหม่ใช้ \"การประเมินเงา\" เพื่อทดสอบว่าเอเจนต์ AI ล้ําสมัยสามารถทําวิจัย AI แบบเปิดได้อย่างอิสระหรือไม่ เอเจนต์ทํางานวิศวกรรมทั้งหมดเสร็จภายในหกวันและใช้พลังงานคอมพิวเตอร์หลายพันดอลลาร์ แต่ไม่สามารถก้าวหน้าอย่างมีนัยสําคัญในคําถามวิจัยหลักของบทความ NeurIPS 2026 สองฉบับที่ยังไม่เผยแพร่ และถูกปฏิเสธอย่างชัดเจนโดยผู้เขียนต้นฉบับ การศึกษานี้ระบุรูปแบบความล้มเหลวหลัก 5 ประการ รวมถึงการตัดสินใจเกณฑ์การตีพิมพ์ที่ไม่เพียงพอ ขาดความคิดสร้างสรรค์ในการออกแบบงานวิจัย ไม่สามารถติดตามย้อนกลับไปยังทางตันได้อย่างมีประสิทธิภาพ การรับรู้ทรัพยากรต่ํา และการสอนที่เบี่ยงเบนไป","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"เอเจนต์ AI สามารถทําการวิจัย AI แบบเปิดได้หรือไม่? หลักฐานเบื้องต้นจากสองคดี - ข่าว AI Aioga","description":"การศึกษาชิ้นใหม่ใช้ \"การประเมินเงา\" เพื่อทดสอบว่าเอเจนต์ AI ล้ําสมัยสามารถทําวิจัย AI แบบเปิดได้อย่างอิสระหรือไม่ เอเจนต์ทํางานวิศวกรรมทั้งหมดเสร็จภายในหกวันและใช้พลังงานคอมพิวเตอร...","url":"https://www.aioga.com/th/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:01:42.241Z"},"pl":{"title":"Czy agenci AI mogą prowadzić otwarte badania nad AI? Wczesne dowody z dwóch spraw","summary":"Nowe badanie wykorzystuje \"ocenę cieniową\" do sprawdzenia, czy nowatorscy agenci AI mogą samodzielnie prowadzić otwarte badania nad AI. Agent ukończył wszystkie zadania inżynieryjne w sześć dni i położył tysiące dolarów w mocy obliczeniowej, ale nie osiągnął znaczących postępów w kluczowych kwestiach badawczych dwóch nieopublikowanych artykułów NeurIPS 2026 i został wyraźnie odrzucony przez oryginalnych autorów. Badanie zidentyfikowało pięć głównych wzorców niepowodzeń, w tym niewystarczającą ocenę kryteriów publikacji, brak kreatywności w projektowaniu badań, niemożność skutecznego odnalezienia ślepych zaułków, słabą świadomość zasobów oraz dryf instrukcji.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Czy agenci AI mogą prowadzić otwarte badania nad AI? Wczesne dowody z dwóch spraw - Aioga Wiadomości AI","description":"Nowe badanie wykorzystuje \"ocenę cieniową\" do sprawdzenia, czy nowatorscy agenci AI mogą samodzielnie prowadzić otwarte badania nad AI. Agent ukończył wszystkie zadania inżynieryjn...","url":"https://www.aioga.com/pl/news/cms6x4iu80273rouqra49hny9/","contentTranslated":true,"sourceHash":"6a0c1f365a35efc2","translatedAt":"2026-07-30T03:01:50.885Z"}}}}