Aioga
AI资讯 / 行业动态
返回 AI资讯

Agent 长任务上下文工程解析:用预算控制、压缩、todo-state 和记忆对抗上下文溢出与目标丢失

MarkTechPost(RSS)Aioga 编辑团队2026-09-13T05:56:03.000Z热度 72

文章解析 Agent harness 层应对长任务中上下文溢出与目标丢失的四类机制:上下文预算与卸载、压缩、todo-state 复述和跨会话记忆。

行业动态MarkTechPost(RSS)

今日 AI 情报摘要

文章解析 Agent harness 层应对长任务中上下文溢出与目标丢失的四类机制:上下文预算与卸载、压缩、todo-state 复述和跨会话记忆。

中文正文 · AI 翻译

一个代理,在最简单的形式下,就是一个循环调用工具的 LLM。这个循环适用于短任务。给它一个运行一小时并调用200次工具的任务,它会以两种可预测的方式崩溃。AWS Samples 自主云编码代理设计指南:https://aws-samples.github.io/sample-autonomous-cloud-coding-agents/design/agent-harness 直接提到了它们:浅层代理会遭遇上下文溢出、分心(目标丢失),并且无法在长时间内维持状态。解决这一问题的层不是模型,而是 AWS 所描述的管理除模型之外一切的外壳(harness)。

本文揭示了这一层。压缩、内存策略、上下文预算和待办状态是将浅层循环转变为深度代理的机制。我们研究 LangChain 深度代理:https://www.langchain.com/blog/context-management-for-deepagents、Claude Code:https://code.claude.com/docs/en/context-window、Manus:https://manus.im/blog/Context-Engineering-for-AI-Agents-Lessons-from-Building-Manus、OpenAI Codex:https://developers.openai.com/api/docs/guides/compaction 和 Amazon Bedrock AgentCore:https://aws.amazon.com/blogs/machine-learning/build-context-rich-research-agents-with-deep-agents-and-bedrock-agentcore 如何实现每一个机制,以及它们实际使用的阈值。

显而易见的解决方法是更大的上下文窗口。证据显示其帮助没有预期的那么大。Chroma 的上下文衰减报告:https://www.trychroma.com/research/context-rot 对包括 GPT-4.1、Claude 4、Gemini 2.5 和 Qwen3 在内的18个 LLM 进行了评估,发现随着输入长度的增加,即使是简单的检索任务,性能也变得越来越不可靠。Anthropic 的上下文工程指南:https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents 解释了机制:注意力为 n 个标记创建 n² 的成对关系,因此每增加一个标记就会消耗有限的“注意力预算”。上下文是一种收益递减的资源,而不是一个桶。

对于一个代理循环,这比听起来更糟。Manus 报告说,一个典型任务大约需要 50 次工具调用,而且输入到输出的 token 比例接近 100:1。每个观察都会进入上下文并保持在那里。原始指令会漂移到窗口的中间位置,正是在这里回忆会下降。目标丢失不仅仅是模型的错误,这是在任务足够长时未管理上下文的预期结果。

一个挂载系统的首要任务是决定哪些内容永远不进入窗口。Deep Agents 配备了两个带有硬性数字的卸载规则。当工具响应超过 20,000 个 token 时,它会被写入文件系统,并替换为文件路径加前 10 行的预览。当会话上下文超过模型窗口的 85% 时,较早的写入和编辑工具调用(其完整文件内容已经存储在磁盘上)将被截断为指针。只有在卸载空间用尽后,挂载系统才会使用摘要作为回退方案。

Claude Code 对第一次提示前加载的内容也采取了同样的预算管理。自动内存限制在前 200 行或 25KB。MCP 工具模式默认保持延迟加载,仅列出工具名称,完整模式通过工具搜索按需加载。经过压缩后,任何超过 5,000 个 token 的重读文件会以路径引用返回,而不是内容。Claude Code 文档中的上下文窗口模拟:https://code.claude.com/docs/en/context-window 使收益具体化:一个研究子代理读取了 6,100 个 token 的文件,并向父代理返回一个 420 token 的结果。

这种子代理模式是在架构层面的预算管理。Anthropic 的指南指出,每个子代理可能会消耗数万个 token 进行探索,但返回的是精炼摘要,通常为 1,000 到 2,000 个 token。AWS AgentCore 演练构建了完全相同的模式:一个协调员并行生成 3 个浏览器子代理,每个子代理在自己的 MicroVM 中运行,而分析子代理只接收它们的结构化发现。AWS 报告预期运行时间为 4 到 6 分钟,并指出顺序处理可能需要长达 3 倍的时间。

当卸载不够时,系统会进行摘要。压缩是指将接近窗口限制的对话进行总结,并用该摘要重新启动一个新上下文的做法。这也是目标最容易丢失的地方,因为有损摘要可能会丢掉唯一重要的约束条件。

各实现方式在承诺保留的内容上有所不同。Claude Code 的压缩提示会保留架构决策、未解决的 bug 和实现细节,同时丢弃冗余的工具输出。压缩完成后,它会重新读取最近修改的最多 5 个文件,重新加载与这些文件匹配的规则,并重新注入已调用的技能内容,每项技能最多 5,000 个 token,总计 25,000 token。文档明确指出,对话早期的详细指令可能会丢失,这就是为什么持久性规则应放在项目根目录下的 CLAUDE.md 中,并从磁盘重新注入。用户可以通过 /compact 指令聚焦于授权 bug 修复,或通过 /autocompact 移动触发点。

Deep Agents 将目标保留作为结构特性。它的摘要是一个结构化文档,具有专门字段用于表示会话意图、创建的工件和下一步计划。LangChain 团队在强制摘要实验后增加了这些字段,结果显示这一更改提高了性能。完整的原始记录也会写入文件系统,因此被摘要掉的事实可以在稍后通过 read_file 恢复。

压缩(Compaction)也已进入 API 层。OpenAI 的 Responses API 通过 context_management 提供服务器端压缩,设置 compact_threshold,并且提供一个独立的 /responses/compact 端点,该端点返回包含不透明加密压缩项的压缩上下文窗口;OpenAI 指导开发者在下一次调用中不更改地传入返回的窗口。OpenAI 表示 Codex 依赖此机制:https://openai.com/index/equip-responses-api-computer-environment/ 以维持长时间运行的编码任务。Claude 开发者平台:https://platform.claude.com/docs/en/build-with-claude/compaction 提供了 compact_20260112 context-management 编辑,可包含自定义指令和 pause_after_compaction 选项,用于在模型继续之前插入内容。当你在此编写自定义指令时,它们会完全替代默认提示,因此压缩提示是真正的工程产物,而不是一个设置。

压缩在总结瞬间保护目标。Todo-state 在每个中间步骤保护它。Manus 简单地描述了这个技巧:其代理创建一个 todo.md 并逐步重写,逐项勾选。重写列表将目标复述到上下文末尾,将全局计划推进到模型的近期注意范围内,减少“中间丢失”的偏移。无需改变架构。这是使用自然语言来引导模型自身注意力的方式。

关于 todo-state 的证据并非单方面。Deep Agents 默认提供 write_todos 工具,直到 2026 年 7 月 v0.7 版本:https://www.langchain.com/blog/deep-agents-v0-7,当时 LangChain 在其对 3 类任务的评估中显示禁用 todos 略微提高奖励且降低成本后,将 TodoListMiddleware 设置为可选。LangChain 仍建议在长多步骤任务、低能力模型以及显示进度的 UI 上重新启用它。Claude Code 保持 todo 列表,并在压缩后从磁盘重新注入 plan 模式中编写的计划。Anthropic 的指南称这一通用模式为结构化笔记:代理在窗口外写 NOTES.md 或 TODO 文件并重新加载。在 Claude 玩《宝可梦》的示例中,它在数千步游戏中保持统计数据,然后在每次上下文重置后读取自己的笔记并继续多小时序列。

这些背后的模式是目标存在作为一个可变的工件,而不仅仅是历史中的一条信息。信息会随时间老化并被总结。每隔几轮重写一次的文件总是最新的,总是简短的,并且可以在任何重置后存活。它是否值得每轮的代币成本取决于模型和任务长度,这正是 Deep Agents 评估所测量的内容。

最后一部分是任务结束后仍然存在的内容。Claude Code 在每次压缩后会重新注入项目根目录的 CLAUDE.md 文件和磁盘上的自动记忆。AgentCore Memory 存储事件,并在后台运行配置的提取策略,因此协调器可以在下一次运行时调用回忆工具,而无需重新研究。AWS 警告称,如果至少没有配置一个提取策略,原始事件会被存储,但不会提取用于检索。Anthropic 的基于文件的记忆工具在 Claude 平台上也起到相同作用。

限制在于持久上下文并非免费的。我们在二月报道的苏黎世联邦理工学院的研究:https://www.marktechpost.com/2026/02/25/new-eth-zurich-study-proves-your-ai-coding-agents-are-failing-because-your-agents-md-files-are-too-detailed/ 发现,像 AGENTS.md 这样的仓库上下文文件通常不会提高任务成功率,同时会增加推理成本:LLM 生成的文件在两个基准测试中分别增加了 20% 和 23% 的成本,而开发者提交的文件增加了最多 19%。每次会话都重新加载的记忆是对注意力预算的长期负担。Claude Code 文档给出相应建议:将 CLAUDE.md 保持在 200 行以下,并将参考资料移动到技能或路径范围规则中,仅在需要时加载。

下面的模拟器通过 200K 代币窗口运行一个 60 步的迁移任务。切换 4 种机制,设置压缩触发,并按运行。关闭所有功能时,在任务完成一半之前窗口会溢出。打开卸载、压缩、待办事项背诵和子代理委派后,同一任务可以在目标仍处于近期注意中的情况下完成。代币计数仅供示例;阈值与 Deep Agents 默认值匹配。

上下文管理只有在代理仍能完成任务并恢复其不再看到的细节时才有用。LangChain 为此保持了针对性的评估:测试在任务中途触发总结,并检查代理是否继续朝着目标前进,以及在大海捞针的案例中,某个事实被总结掉后必须通过文件系统搜索恢复。为了生成足够的事件以比较提示变体,团队在窗口的 10% 到 20% 处触发总结,而非默认的 85%,并在 terminal-bench-2 上使用 Claude Sonnet 4.5 进行了 25% 的触发来研究效果。

在 LangChain 看来,失败的原因是未能关注目标漂移:代理在总结后立即请求澄清,或错误地宣布任务完成。AgentCore 评估提供了一个目标成功率评估器,可以对相同的跟踪进行评分。如果运行测试工具并且未在测试中强制压缩,你尚未知道总结提示会丢失哪些内容。

Implementation of Machine Learning Workflows with NVIDIA cuML, RAPIDS, GPU Benchmarking, Explainability, Clustering, and Model Inference
Can LLMs Engineer Their Own Agent Harness? ByteDance Seed's HarnessDev Says Only 34 of 64 Changes Generalize
Cohere Releases North Small Translate

面向从业者的 AI/ML 新闻和分析,每月有超过 100 万开发者和研究人员阅读。

情报判断

Aioga 编辑摘要

MarkTechPost文章称,长任务中的Agent可能出现上下文溢出、目标丢失和状态维护不足。文章归纳了上下文预算与卸载、压缩、todo-state复述、跨会话记忆四类harness机制。

背景分析

材料将harness描述为模型之外的管理层,并介绍了Deep Agents、Claude Code、Manus、OpenAI Codex和Amazon Bedrock AgentCore对上下文管理的做法。文章还援引研究称,输入变长可能使模型表现更不稳定。

Aioga 观点

Aioga判断:长任务能力不宜只按上下文窗口大小衡量。来源材料显示,工具结果如何进入上下文、旧信息如何保留,以及目标状态如何被重新呈现,都是Agent持续执行时值得关注的编辑观察点。

影响与后续

可能影响:Agent产品需要在信息完整性与上下文成本之间做管理。自动卸载和压缩可能减少窗口压力,但不代表关键信息一定被保留;产品评估也应关注长任务中的状态连续性,而不足以只看短任务表现。 后续观察:关注相关产品是否公开压缩触发条件、卸载规则、状态记录方式和跨会话记忆边界,并核对这些机制在不同任务长度与工具调用规模下的实际效果。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-13T05:56:03.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

文章解析 Agent harness 层应对长任务中上下文溢出与目标丢失的四类机制:上下文预算与卸载、压缩、todo-state 复述和跨会话记忆。

MarkTechPost(RSS)2026-09-13T05:56:03.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。