Aioga
AI资讯 / 技巧观点
返回 AI资讯

AI智能体尚无法开展开放式AI研究

AI as Normal Technology(RSS)Aioga 编辑团队2026-08-05T13:49:19.000Z热度 70

普林斯顿大学团队通过"影子评估"测试前沿AI智能体的开放式研究能力:让智能体在六天时间内、使用数千美元API额度和算力,回答两篇未发表论文的核心研究问题,结果两篇论文均被原作者...

技巧观点AI as Normal Technology(RSS)

今日 AI 情报摘要

普林斯顿大学团队通过"影子评估"测试前沿AI智能体的开放式研究能力:让智能体在六天时间内、使用数千美元API额度和算力,回答两篇未发表论文的核心研究问题,结果两篇论文均被原作者明确拒绝。

分析显示,智能体缺乏研究判断力、资源意识、创造性反馈应对能力和有效回溯能力,且未遵循具体指令。 研究团队认为,开放式研究对前沿AI智能体仍具挑战性,但结果尚属初步,需扩大样本量并持续评估。

中文正文 · AI 翻译

领导的目标:https://www.anthropic.com/institute/recursive-self-improvement AI 实验室:https://cdn.openai.com/pdf/25752ecb-0e5c-47f9-b9e4-c0f4d76f8d3d/a-blueprint-for-a-federal-framework.pdf 是递归自我改进(RSI):使用 AI 代理自动化 AI 研究。RSI 也支撑着对 AI 爆炸性进展的预测:https://ai-2027.com/:https://metr.org/notes/2026-02-10-simpler-ai-timelines-model/:https://www.forethought.org/research/will-ai-r-and-d-automation-cause-a-software-intelligence-explosion。我们如何评估是否接近这一里程碑?

AI as Normal Technology

一种方法是使用基准测试,测试代理是否可以进行 AI 研究。鉴于 AI 社区对基准测试的关注,它们一直是评估 RSI 进展的主要方式。在过去一年中,许多此类评估:https://cruxevals.com/crux/can-ai-agents-conduct-research#introduction:~:text=AI%20research%20questions.-,Selected,-evaluations%20and%20demonstrations 发现代理现在能够在成功易于验证的任务上取得进展,这引发了关于我们是否接近 RSI 的猜测。

但尽管这些评估是有帮助的,它们仅限于狭窄且可验证的任务。AI 研究可能更加开放式。成功往往不会立即显现或易于验证,而要取得进展,研究人员需要测试有前景的假设、回溯或考虑新的或非常规的方法。我们如何评估代理进行开放式 AI 研究的能力?我们在一篇新论文中采取了回答这一问题的第一步:https://cruxevals.com/crux/can-ai-agents-conduct-research。

我们与两篇未发表 AI 论文的作者合作,请他们起草各自论文的主要研究问题。然后,我们让前沿 AI 代理进行研究以回答这些问题,并为它们提供了数千美元的 API 积分和计算资源,以及六天的实际时间。原作者审查了代理的论文。

作者明确拒绝了两篇代理论文。为了更好地理解这些结果,我们团队花费了超过一百小时分析代理日志。我们的主要结论:

这些代理缺乏进行开放式研究的判断力。虽然代理提出的方向让专家评审觉得印象深刻,但他们很快因为低质量或合成数据而拒绝了这些提议方向。

代理缺乏对可用资源的意识。两次运行都在 API 预算使用不到 50% 且距离截止时间还有几小时的情况下结束,尽管代理可以监控他们的使用情况,并被鼓励花完预算。

代理没有创造性地回应反馈。尽管代理自身的 AI 自我评审发现了许多专家评审后来提出的问题,代理并没有创造性地解决这些问题。当面对负面反馈时,他们通过在现有发现中增加警告来回应,并在前景不佳的研究方向上加大投入。

代理没有有效地回溯。他们在实验的第一天就放弃了最雄心勃勃的研究目标,而且之后没有任何代理从根本上调整其方法。

代理没有遵循具体的指示。他们忽视了关于探索时间、使用 AI 自我评审工具获取反馈频率以及论文长度严格限制的明确规则。

我们希望评估 AI 进行开放式研究的能力已有两年时间,自从我们发布基准:https://arxiv.org/html/2409.11363v1 以研究是否可以用代理来提高可重复性。但我们希望首先把方法做好。我们的方法理念由论文中一些英国 AISI 合作者提出,并由我们普林斯顿核心团队完善。

我们称这些为“影子评估”,因为代理在原始研究中进行影子跟踪。除了我们两人外,核心团队还包括 Peter Kirgis、Andrew Schwartz 和 Stephan Rabanser。完整作者列表在本文末尾。

影子评估有重要优势:它们允许我们在代理未接受过训练且无法在线获取结果的情况下测试代理。同时,它们也允许花费数月回答问题的专家评估代理的输出。 1:#footnote-1

但影子评估也有其固有的局限性。专家评审知道论文是由 AI 生成的,他们可能会更偏好自己采取的方法,而不是代理采取的方法。由于我们对每篇论文都进行深入评估,样本量较小(在我们的研究中,我们仅使用了两篇论文)。而且这些评估必然涉及研究者在设计、执行和解释方面的诸多灵活性。

事实上,我们以某种特定立场而闻名:https://www.normaltech.ai/p/ai-as-normal-technology 在关于递归自我改进和超级智能的讨论中。这可能会影响我们如何开展研究。我们在论文中有详细的部分介绍我们的潜在偏见以及如何应对它们。我们寻求了一支并非完全共享我们先验观点的合作团队,并明确展示了由此产生的分歧。2:#footnote-2 针对未来的评估,我们希望“对抗性合作者”能成为核心团队的一部分。

对人工智能快速发展的影响

我们的结果表明,对前沿 AI 代理进行开放式研究仍然充满挑战。不过,这些发现仍是初步的,我们正在努力解决这些局限性,例如通过增加样本量、在新模型上进行测试以及可能的支架改进。但如果这些发现成立,其含义是什么?

首先,我们需要了解前沿 AI 进展(及 RSI)在多大程度上仅通过在可验证任务上的逐步优化就能实现。我们的观点是,虽然在狭义任务(例如提高效率)上确实可能加快进展,但我们认为这不会导致广泛的 RSI 或爆发性进展。不过,我们计划密切关注由于 AI 代理在可验证任务上的能力而引发的 AI 进展如何展开。

其次,我们需要衡量当前代理在进行开放式研究时的局限性(例如缺乏创造力和判断能力)能够多快被克服,例如通过更有针对性的训练和支架改进。我们计划定期继续进行影子评估,以帮助回答这个问题。

最后,即使这些局限性可以克服,可能还存在进一步的瓶颈,会减缓 AI 进展的速度。

瓶颈可能包括计算能力的限制、必须从真实世界实验中收集数据的需求,以及其他我们尚未发现的瓶颈,因为它们目前尚未阻碍进展。例如,高质量强化学习环境的重要性在它们对推理扩展有用之前并不明显。同样,为数据中心建设能源基础设施的重要性也没有被认识到,直到公司开始在用于训练和推理的数据中心上投资数千亿美元。

我们是否会遇到进一步的瓶颈,以及这些瓶颈的可解决程度如何,将对理解进展的速度产生重大影响。在这方面,我们的论文指出了一个尚未解决的瓶颈,即前沿智能体在开放性人工智能研究上的表现不佳(尽管是否在通向通用人工智能的关键路径上仍有待观察)。

如果我们处在一个能够轻松解决完全自动化研究瓶颈的世界中,我们应当预期通过提高人工智能能力可以获得人工智能进展的显著回报。但如果我们处在一个仍有许多难以克服的瓶颈的世界,阿姆达尔定律(Amdahl’s law:https://en.wikipedia.org/wiki/Amdahl%27s_law)将发挥作用:即使在易于应用人工智能的部分实现百倍加速,总体进展的速度仍只会略微提高,因为进展受最慢部分的速度所限制。3:#footnote-3

弄清我们所处的世界类型可能会极大影响对人工智能进展速度的估计。我们希望我们的研究结果有助于更深入地理解这些瓶颈。

在这里阅读论文:https://arxiv.org/pdf/2607.27191。作者是 Peter Kirgis、Sayash Kapoor、Andrew Schwartz、Stephan Rabanser、David Africa、Konstantinos Voudouris、Viet Nguyen、Toby Pilditch、Magda Dubois、Harry Coppock、Cozmin Ududec、Nitya Nadgir、Matilda Orona、Tilman Bayer、Derrick Chan-Sew、Yue Ling、Abhishek Shetty、Helen Toner、Gillian Hadfield、Seth Lazar、Steve Newman、Shoshannah Tekofsky、Rishi Bommasani 和 Arvind Narayanan。

这与提交论文进行盲审相反。不幸的是,人工智能领域的同行评审存在评审质量低下以及评审人与所分配论文之间专业匹配度不高的问题,这可能是由于提交数量的急剧增加所导致的:https://www.cs.cmu.edu/~nihars/preprints/SurveyPeerReview.pdf。

例如,我们的合著者对于这些智能体是否缺乏创造力,或者它们是否由于认知锁定而无法有效地整合反馈存在分歧。

在实践中,可能会发现某些类型的人工智能进展存在瓶颈,而其他类型则没有。例如,提高现有人工智能系统的效率和速度是一项可验证的任务,其进展非常迅速。因此,企业已经有效地利用智能体来提升人工智能系统的效率:https://x.com/OpenAI/status/2082878156483219672?s=20。在短期内,我们预计在有可验证信号的方面人工智能会快速进展。

有趣的是,这些智能体会“陷入循环”,并未重新考虑之前搁置的路径。“之前没成功,但或许这次会成功,也许我只需稍作调整……”似乎是根本的人类行为(尽管它经常失败)。而在耗尽预算之前放弃?那可不对!:-D

这只进一步证明,无论机器所使用的“思考”过程是什么,它都不是*人类*的。

研究是否通过提出研究问题来进行?我(杜威式观点)认为,将你的研究表述为问题会扭曲研究,除非你已经完成了研究。

情报判断

Aioga 编辑摘要

普林斯顿大学团队让前沿AI智能体用六天时间及数千美元API额度和算力,回答两篇未发表论文的核心问题。原作者明确拒绝了两份智能体论文,团队认为开放式研究仍具挑战。

背景分析

现有评估多聚焦结果容易验证的狭窄任务,而开放式AI研究需要判断假设是否值得推进,并在必要时回溯或尝试新方法。该团队与两篇未发表AI论文的作者合作,开展了此次影子评估。

Aioga 观点

Aioga 判断,这项测试的重要性不在于证明智能体完全不能研究,而在于揭示可验证任务成绩与开放式研究能力之间可能存在差距。方向提议令人印象深刻,也未能弥补研究判断和执行上的不足。

影响与后续

值得关注的是,智能体未充分使用可用预算和时间,也未能针对自我审查发现的问题创造性调整,反而增加限定说明或继续投入前景不佳的方向。这可能限制其独立承担开放式研究的可靠性。 研究团队已明确将结果界定为初步发现,后续需要扩大样本量并持续评估。Aioga 判断,未来评估还应继续观察智能体能否有效利用资源、响应负面反馈、遵循具体指令,并在方向不佳时及时回溯。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: normaltech.ai

来源: AI as Normal Technology(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-05T13:49:19.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

普林斯顿大学团队通过"影子评估"测试前沿AI智能体的开放式研究能力:让智能体在六天时间内、使用数千美元API额度和算力,回答两篇未发表论文的核心研究问题,结果两篇论文均被原作者...

AI as Normal Technology(RSS)2026-08-05T13:49:19.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。