Aioga
AI资讯 / 行业动态
返回 AI资讯

Google 与 DeepMind 提出 Dream-RSI,让 AI 智能体通过回放搜索历史改进策略

The Decoder:AI News(RSS)Aioga 编辑团队2026-09-19T11:08:06.000Z热度 58

Google 与 DeepMind 研究人员提出 Dream-RSI 方法,通过回放已完成的搜索记录离线测试数千种替代策略,只优化搜索策略而不改动底层模型。

行业动态The Decoder:AI News(RSS)

今日 AI 情报摘要

Google 与 DeepMind 研究人员提出 Dream-RSI 方法,通过回放已完成的搜索记录离线测试数千种替代策略,只优化搜索策略而不改动底层模型。

中文正文 · AI 翻译

谷歌和DeepMind的研究人员开发了一种方法,帮助AI代理更高效地处理复杂的搜索任务。该方法利用过去的搜索运行来测试新策略,而无需重复昂贵的计算。

Image description

自我改进的AI代理有望有一天能够自行发现新的算法、数学问题的解决方案或更快速的代码。它们遵循相同的基本过程:提出解决方案、评估结果、从中学习并再次尝试。经过成千上万次尝试,它们逐渐接近良好的结果。

对于复杂任务,搜索空间可能会变得极大。代理必须不断决定哪些有前景的方法值得追求,哪些可以并行尝试,以及哪些应被放弃。这个过程称为探索,它可能决定搜索是否成功,或者是否浪费计算资源去追逐错误的想法。

来自谷歌和DeepMind的一个研究团队推出了“Dream-RSI:https://github.com/zhengkid/Dream-RSI”以改进这些决策。该方法改变了智能体的搜索方式,而不是底层的人工智能模型。

现有方法通常以两种方式处理探索。固定搜索策略无法从经验中学习,因此代理可能会多次碰到相同的死胡同。在搜索过程中调整策略可以避免这种僵化,但代价不小。需要多次尝试才能确定策略是否有效,而测试无数备选方案则意味着要重复耗时且昂贵的运行。

研究人员建议重用已完成搜索的数据,在代理已经探索过的空间中测试替代策略。代理在搜索过程中记录其尝试及其结果,从而提供后续回放这些决策所需的数据。

研究人员将此方法比作在陌生区域寻找路线。第一次访问时,你会遇到死路、回头并努力寻找路径。然而,一旦你有了心理地图,就可以规划不同的路线,而无需再次访问每个地点。

Dream-RSI 将这一原理应用于记录的搜索历史。与其在实时运行中测试新策略,不如让智能体在存储的结果中运行它。这使它能够检查,如果先采用其他方法或放弃某些先前的步骤,会发生什么情况。系统不会在重放过程中完全创造新的解决方案;它是在记录的搜索树中测试不同的决策。

Diagram of a recorded search tree showing two alternative strategies following colored paths, each scored for quality, cost, and latency.

由于这些结果已经存在,智能体不需要再次生成或评估解决方案,从而避免了实时运行所需的昂贵计算。这使得测试新的搜索策略成本更低。研究人员称这一过程为“做梦”。智能体会演练成千上万种变体,并选择最佳方案,然后再将其应用于实时搜索。

这一过程以循环方式重复。每次搜索后,智能体会利用记录的结果测试更好的策略,然后将改进版本应用到下一次实时运行中。在整个循环过程中,唯一变化的是搜索策略;生成解决方案的模型保持不变。

Diagram of Dream-RSI's three-stage cycle showing live exploration, replay simulator construction, and strategy improvement through simulated searches. A close-up shows the proposal, evaluation, and feedback loop.

研究人员在八项任务上测试了 Dream-RSI,涵盖三个领域,使用了 Gemini 3.1 Pro:https://the-decoder.com/google-releases-gemini-3-1-pro-with-improved-reasoning-capabilities/?cmpscreencustom=1 和 Gemini 3.7 Flash:https://the-decoder.com/gemini-3-7-flash-lands-with-coding-gains-and-undercuts-its-three-week-old-predecessors-price-by-50/。每次对比使用了具有相同起始条件但固定搜索策略的基线。

其中一项任务要求系统为基因组学和金融中常用的统计计算编写运行最快的程序。Dream-RSI 的程序在所有六个测试数据集上的运行速度都比已建立的库 sklearn 和 glmnet 更快。

使用 Gemini 3.1 Pro 时,平均运行时间从 3,587 毫秒降至 2,931 毫秒,而尝试次数从 550 次降至 317 次。Dream-RSI 还超过了一种名为 SimpleTES 的竞争系统,后者需要 51,200 次运行,而 Dream-RSI 仅需 317 次尝试。

Line chart showing the best ConvDiv performance in rounds E0 through E8, above a bar chart showing 50 to 110 evaluated attempts per round.

数学优化任务和高效 GPU 内核编写的努力也呈现出同样的模式,以更低的计算成本获得了相当或更好的结果。在两个 GPU 任务中,Dream-RSI 的性能相当,同时运行次数减少了最多 2.43 倍。在另外两个任务中,它在相同预算下提供了最多 2.09 倍的性能。

Four step charts comparing Dream-RSI with Recursive Fixed Exploration on VGG16, LayerNorm, ConvDiv, and ConvMax, plotting GPU kernel performance in inverse milliseconds against the number of generations.

在后续分析中,研究人员测试了另一种使用搜索历史的方法。他们没有用它们来回放以测试策略,而是将这些历史压缩成指令,告诉代理在哪里搜索。

在一个 GPU 任务中,包含这些指令的版本表现不如没有指令的版本。研究人员建议,过于具体的指令可能会过度缩小搜索空间,阻止代理探索更广泛的方法。

同样的分析显示了学习策略如何调整其努力。当性能提高时,它最初减少了尝试次数。当进展停滞时,它再次增加搜索努力,这与进一步的收益一致。研究人员已在 GitHub 分享了代码和更多细节:https://github.com/zhengkid/Dream-RSI。

递归自我改进最近吸引了越来越多的关注。该领域的发展是 Anthropic 首席执行官 Dario Amodei 最近对人工智能研究速度发出警告的原因之一:https://the-decoder.com/ex-deepmind-vp-vinyals-says-ai-self-improvement-is-coming-but-wont-trigger-an-intelligence-explosion/。

谷歌 DeepMind 在 2025 年推出了 AlphaEvolve:https://the-decoder.com/alphaevolve-is-google-deepminds-new-ai-system-that-autonomously-creates-better-algorithms/,使用相同的基本原理。Gemini Flash 生成代码提案,Gemini Pro 分析这些提案,进化算法选择最佳版本。Dream-RSI 在这个过程之上再提升一级,通过优化搜索策略本身实现改进。

AutoTTS:https://the-decoder.com/researchers-let-claude-code-discover-ai-scaling-algorithms-that-humans-probably-wouldnt-have-designed/?cmpscreencustom=1 使用类似的方法,利用编码代理在模拟环境中搜索算法。这些算法决定语言模型何时启动、扩展或放弃推理路径。最终得到的方法在计算资源更少的情况下超越了手动设计的方法。

谷歌研究最近提出了一种用 WikiSkill 重用过去运行的方法:https://the-decoder.com/google-gives-ai-agents-their-own-wiki-so-they-can-learn-from-mistakes-and-successes/。该系统在一个 wiki 中记录失败和成功,并将其转化为可供代理使用的可重用指令。Dream-RSI 的后续分析表明,像这样的明确指令可能会限制在开放式搜索任务中的探索。

Meta 通过 Hyperagents 更进一步:https://the-decoder.com/metas-hyperagents-improve-at-tasks-and-improve-at-improving/?cmpscreencustom=1,允许代理重新编写控制它们如何提高的机制。

保持 AI 动态更新。清晰、有用、无废话。

关注 The Decoder 以获取 AI 新闻、背景故事和专家分析。

解码器:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Google 与 DeepMind 研究人员提出 Dream-RSI,通过回放已完成搜索的记录,离线测试替代搜索策略;该方法只调整智能体的搜索策略,不改动底层 AI 模型。

背景分析

复杂任务的搜索空间可能很大,智能体需要决定继续、并行或放弃哪些路径。固定策略无法从经验中学习,实时调整策略则需要反复运行并承担较高计算成本。

Aioga 观点

Aioga 判断:Dream-RSI 的重点是复用既有搜索历史来评估不同决策顺序,试图降低重复计算需求;其改进对象是探索过程,而非底层模型本身。

影响与后续

可能影响:该方法可能提升既有搜索记录的利用效率,但回放仅能测试已记录搜索树中的不同决策,不代表能够在回放阶段产生全新的解决方案,其适用范围仍需要结合后续研究判断。 后续观察:需要关注 Dream-RSI 在不同复杂搜索任务中的评估结果,以及离线策略测试能否稳定转化为后续搜索改进;现有材料不足以判断其普遍适用性。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-19T11:08:06.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Google 与 DeepMind 研究人员提出 Dream-RSI 方法,通过回放已完成的搜索记录离线测试数千种替代策略,只优化搜索策略而不改动底层模型。

The Decoder:AI News(RSS)2026-09-19T11:08:06.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。