Aioga
AI资讯 / 论文研究
返回 AI资讯

ABBEL:通过信念瓶颈提升LLM长程交互中的摘要学习效率

BAIR:Berkeley AI Research BlogAioga 编辑团队2026-07-26T09:00:00.000Z热度 51

BAIR提出ABBEL框架,将长程交互中的摘要生成隔离为自然语言信念状态,并通过信念评分进行监督。在CollabBench协作编程测试中,基于重建的信念评分将全上下文模型的性能...

论文研究BAIR:Berkeley AI Research Blog

今日 AI 情报摘要

BAIR提出ABBEL框架,将长程交互中的摘要生成隔离为自然语言信念状态,并通过信念评分进行监督。

在CollabBench协作编程测试中,基于重建的信念评分将全上下文模型的性能差距缩小约50%,训练步数减少50%。 该方法解决了递归摘要(如Cursor Composer 2.5采用的压缩技术)在有限训练数据下性能下降的问题。

中文正文 · AI 翻译

--> ABBEL 相较于传统递归总结的概述。信念代替完整的交互历史作为代理的工作上下文,而信念评分通过监督每个信念状态的内容来提升性能。

随着任务范围的扩大,LLM 的上下文无法无限扩展。自我总结可以生成简洁、可解释的上下文,但代价是显著的性能损失,特别是在高质量数据稀缺的人类辅助领域,例如协作代码生成。我们使用 ABBEL 解决这一问题:https://arxiv.org/abs/2512.20111:一个框架,以自然语言信念状态的形式隔离和监督总结的信息内容。

为了使语言模型能够有效地协助处理日益复杂的任务,如软件开发,它们必须能够与我们进行数百甚至数千步的交互。对于如此长的任务,在上下文中保留整个交互历史是不现实的。到目前为止使用的启发式方法是生成总结,有时称为上下文压缩。例如,Cursor 的最新模型 Composer 2.5 在训练期间使用压缩以提高性能(Cassano 等, 2026:https://cursor.com/blog/self-summarization)。与 Composer 一起,Grandcode(DeepReinforce 等, 2026:https://arxiv.org/abs/2604.02721),这是首次在在线编码竞赛中持续击败所有人类竞争者的系统,尽管它使用了最新的高效注意力模型之一(Qwen 3.5-397B),仍发现有必要使用上下文总结。

但压缩存在问题。尽管在基准测试中表现差距似乎很小,模型服务商如 Cursor 仍建议用户在任务进行中避免对代码助手进行上下文压缩(Heule 等, 2026:https://cursor.com/blog/continually-improving-agent-harness)。

要理解原因,请参见下图对 Context 总结模型与完整上下文模型在 Combination Lock(一种类似 Wordle 的游戏,允许最多 16 次猜测)上 RL 微调的性能比较。虽然两种模型类型在训练过程中都有提升,但总结模型从未缩小差距。

--> 图 1:在 RL 微调过程中,在 Combination Lock 上猜测目标词的平均尝试次数(越低越好)。上下文摘要策略随着训练而改进,但仍未达到全上下文策略的水平。

在完成任务的同时让模型自我总结会增加学习问题的复杂性。虽然通常可以通过更多数据的训练来解决,但在现实交互环境中观察到的性能下降,很可能源于我们在有效创建和使用人类模拟器以生成高质量训练环境方面的困难(Lin et al., 2025:https://jessylin.com/2025/07/10/user-simulators-1/, Tomlin et al., 2025:https://nickatomlin.github.io/blog/user-simulators-2.html)。因此,你在有限且混乱的多轮交互轨迹上学习总结的能力越强,你的模型对下游用户就会越有利。

--> 图 2:受自编码器启发的信念评分。模型将先验信念、动作和观察(b t、a t、o t)编码为后验信念 b t+1,并根据从该信念中重构历史中所选信息的效果进行奖励。

为了解决学习效率低的问题,我们将摘要生成任务隔离开来。借鉴递归贝叶斯估计的思想,我们将摘要公式化为信念状态,并定期提示模型根据新信息更新信念。 3:#fn:videoabbelslow

ABBEL overview animation frame

然后我们提取并监督信念状态的内容(图 2,信念评分)。信念评分可以被理解为添加一个辅助的 RL 任务,使用旨在捕捉良好信念特征的启发式作为奖励。一种编码的示例启发式是越短越好,但越接近能够重构 git diff 也越好,因此平衡这些便会产生一个良好的信念。在很难定义良好启发式的领域,我们提出了一种通用的、自编码器启发的评分函数,将当前语言模型 π θ 视为历史信息的编码器和解码器,将信念状态视为代码。我们通过当前模型 π θ 能多好地重构最近的观察 o t 来对每个信念 b t+1 进行评分:

--> 式 1:重建评分目标。这里 b t+1 是更新后的信念,o t 是最新观察,a t 是刚采取的动作,b t 是先前信念,p I 是任务提示,π θ 是当前模型。较高的分数奖励能够保留解码最新观察所需信息的信念。

我们在以人为驱动的辅助编程这一激励领域中展示了信念评分的实用性,使用的是 Sweet-RL 的 CollabBench 环境(Zhou 等, 2025:https://arxiv.org/pdf/2503.15478)。

--> 图 4:CollabBench 协作编程环境。智能体提出澄清性问题,然后提交一个函数,该函数会根据隐藏的单元测试进行评分。

我们看到,通过通用重建型信念评分函数,我们将与全上下文模型的性能差距减少了约 50%,同时相比训练模型总结而不使用信念评分(无 BG),训练步骤减少了 50%。训练后,ABBE L 的内存使用量仍显著低于全上下文设定,这通过峰值上下文令牌长度(Peak Tokens)进行衡量。

此外,在 CombinationLock 中,我们演示了 ABBEL 使用借助领域知识的信念评分器(通过对历史数据计算有用统计并检查是否可以从信念状态重建这些统计)时,实现了比全上下文(FULL CTX)模型更高的学习效率。

--> 图 6:在 Combination Lock 上猜测目标单词的平均尝试次数(数值越低越好)。在有领域知识的信念评分下,ABBE L 在这一设定中接近甚至超过 FULL CTX;无信念评分时,学习速度更慢。

在第三个环境中,多目标问答(来自 MEM1 Zhang 等, 2025:https://arxiv.org/pdf/2512.24601,一项近期工作,在典型递归总结的修改版本中进行了端到端优化),我们展示了将信念状态与推理隔离的实用性,通过显示 Peak Belief 长度惩罚(具体细节见论文)在最小性能下降的情况下显著减少内存使用,而不像通常在惩罚推理长度时观察到的情况(Arora 等, 2025:https://proceedings.neurips.cc/paper_files/paper/2025/file/579b5b84311e122584dedab1d3b7613f-Paper-Conference.pdf)。

--> 图 7:多目标问答中,精确匹配分数和峰值内存随目标数量的变化。在本次评估中,带峰值信念惩罚(PBP)的 ABBEL 保持了可比性能,同时比 MEM1 和不带 PBP 的 ABBEL 使用更少内存。

通过将显式信念状态用作多步交互的信息瓶颈,可以实现更多可能性。你可以根据动作对信念状态的影响来奖励动作,以指导探索;传递显式信念状态以改善智能体之间的沟通;甚至可以通过直接修改智能体决策所依赖的记忆来提高用户的可控性。

某些类型的信息,例如一个人的长相,仅靠文本很难很好地表示。一个持续学习的系统也必须捕捉这些信息。此外,如果我们希望系统学习使用全新的语言进行交流,或者在全新的游戏中表现优于任何人,那么在对话或游戏过程中积累的技能必须以非常压缩的形式存储,本质上承担模型自身权重的作用。

更强大的系统可能会利用多种记忆形式组合,其中上下文的内容可能对应于工作记忆,而其他方法用于短期和长期记忆。如何实例化这些其他形式的记忆,例如通过测试时训练、适配器记忆、连续上下文记忆或其组合,是一个令人兴奋的挑战。

如果 ABBEL 对你的未来工作有启发,请引用我们的工作!这里有一些建议:https://jakob-bjorner.github.io/abbel-advice.html,用于进行类似研究!

在新模型中,达到 50% 计算量在注意力上的分配所需的标记数量远大于 25K。像 GPT-OSS 和 DeepSeekv4 那样在全注意力中交错线性注意力替代方案,可以大幅减少注意力计算的 FLOPs。例如,对于 DeepSeekv4-Pro(1.6T A49B),达到 50% 权衡点几乎需要 45 万个标记。Grandcode 使用 Qwen-3.5-397B-A17B,这是一个在大约 15 万标记处达到注意力 50% FLOPs 的模型。 ↩:#fnref:efficientattn

这个设置在技术上可以用更高效的计算工具来解决,但它作为一个灵活的测试平台,用于研究递归总结的特性。Bertsimas 等人,2022:https://wordle-page.s3.amazonaws.com/assets/Wordle_Paper_Final.pdf,显示对于以 JavaScript 游戏原始词汇表实例化的 Wordle 游戏,可以通过动态规划找到精确解,但显然,将 Wordle 一般化为使用 K 个字母进行猜测的游戏,并且有 L 次尝试和某个有效词典以及正确词 D 的情况下,要确定所需的最少步数是 NP 难的。↩:#fnref:wordlehard

在实践中,总结有一个 O(N/K) 的额外开销。N 是动作的总数。K 是触发总结前的动作数。对于任何总结方法,这都是必然的。为了便于说明,这个 gif 使用 K = 1。在我们的实验中,为了更强调总结的弱点,我们也使用 K = 1。在实践中开销很小,因为 K 可以选择接近高效硬件的限制。↩:#fnref:videoabbelslow

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:BAIR提出ABBEL框架,将长程交互中的摘要生成隔离为自然语言信念状态,并通过信念评分进行监督。 Aioga 将其归入「论文研究」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: bair.berkeley.edu

来源: BAIR:Berkeley AI Research Blog

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-26T09:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

BAIR提出ABBEL框架,将长程交互中的摘要生成隔离为自然语言信念状态,并通过信念评分进行监督。在CollabBench协作编程测试中,基于重建的信念评分将全上下文模型的性能...

BAIR:Berkeley AI Research Blog2026-07-26T09:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。