当 AI Agent 从几轮问答走向跨小时、跨任务的连续执行时,真正稀缺的往往不是上下文窗口容量,而是其中的“有效注意力”。对话记录、工具返回、检索片段、失败重试和中间推理不断堆积,过期信息与当前事实混在一起,最终形成历史噪声。即使模型仍未触及长度上限,也可能出现目标漂移、引用旧状态、重复调用工具和忽略关键约束等问题。
一、历史噪声是如何累积的
Agent 的上下文通常由系统指令、用户消息、模型回复、工具定义、工具执行结果、检索资料及外部记忆共同组成。长任务中的每一步都会产生新内容,如果系统采用“完整历史直接回灌”的方式,上下文便会持续膨胀。Anthropic 将上下文工程概括为对推理阶段所用信息进行持续筛选和维护,而不只是优化一段提示词,参见上下文工程实践说明。
常见噪声主要有四类:一是已经失效的状态,例如任务文件已更新,但历史记录仍保留旧版本;二是高度重复的信息,例如多轮检索返回相似段落;三是低价值过程,例如调试日志、完整网页正文和冗长 JSON;四是未经验证的内容,例如工具返回中的提示性文本被误当成系统指令。噪声一旦参与后续摘要,还可能被固化为“伪记忆”,形成持续污染。
二、污染为何不能只靠扩大窗口解决
更大的上下文窗口只能提高容量,不能自动判断信息是否正确、有效或仍然适用。关键事实可能被埋在大量工具结果之间,互相冲突的历史决策也可能同时存在。Microsoft Research 提出的高效上下文方向同样强调相关信息识别、冗余削减、混合检索与智能压缩,目标是提高上下文效用,而非单纯增加输入量,参见相关研究项目。
更隐蔽的问题是污染具有传播性。某次工具调用失败,如果 Agent 把失败结果总结成已完成事实,后续规划就会建立在错误前提上;某条临时规则如果没有作用域和失效时间,也可能被错误应用到其他任务。因此,治理对象不应只是 token 数量,还应包括信息来源、时间、可信级别、适用范围和验证状态。
三、建立分层上下文,而不是保存一切
生产系统可以把上下文拆成四层,并为每层设置不同生命周期:
- 固定指令层:保存角色、权限、安全边界和长期不变的输出规则,禁止被普通检索内容覆盖。
- 任务工作层:只保留当前目标、约束、执行计划、待办事项和最近状态,任务结束后及时释放。
- 外部记忆层:存储用户偏好、稳定事实、历史决策与可复用流程,通过检索按需注入,而不是每轮全部加载。
- 证据与审计层:保存原始工具结果、文件版本和操作日志,默认不进入模型上下文,仅在核验或追责时读取。
Microsoft Agent Framework 将聊天历史和持久化存储区分处理,说明 Agent 可以通过上下文提供器按需获得历史信息,而不必把全部记录永久塞入当前窗口,参见记忆与持久化文档。这种分层设计能够把“留存”与“调用”分开:数据可以完整保存,但模型每一步只看到完成当前决策所需的最小信息集。
四、压缩必须保留可恢复的任务状态
简单截断最早消息虽然成本低,却容易删除任务起因、关键约束和用户承诺。更稳妥的方式是结构化压缩,将历史整理为目标、已确认事实、已完成动作、失败尝试、未决问题、关键产物和下一步计划。摘要中的重要事实应附带来源标识、生成时间和有效期,避免把推断写成确定事实。
压缩还应采用“原文可回查”原则。摘要是导航层,不是唯一事实源。当 Agent 准备执行高影响操作,或发现摘要与当前状态冲突时,应返回证据层重新读取原始记录。Microsoft Research 的 ACON 研究表明,长程 Agent 的压缩需要同时处理环境观察和交互历史,并根据压缩导致的失败持续优化规则,参见ACON 研究介绍。
五、在写入记忆前设置污染闸门
外部记忆不能成为“什么都记”的仓库。每条候选记忆写入前应经过事实性、稳定性、相关性、权限范围和重复度检查。用户临时提出的要求应标注会话级作用域;工具结果中的自然语言指令应默认视为不可信数据;互相矛盾的记忆不应静默覆盖,而应保留版本并触发核验。
- 为记忆增加来源、时间戳、任务编号、可信级别和过期时间。
- 对偏好、事实、流程、临时状态使用不同存储类型和更新策略。
- 相似内容先去重,再通过新旧证据决定合并、替换或并存。
- 执行敏感操作前重新读取权威数据,不以摘要或模型记忆作为唯一依据。
- 允许用户查看、更正和删除与自己有关的持久记忆。
六、用回放测试衡量治理效果
上下文治理不能只看压缩率,还要观察任务完成率、事实一致性、错误工具调用、重复步骤、检索命中率和人工纠正次数。建议保存经过脱敏的任务轨迹,构造“长会话回放集”,分别测试完整历史、滑动窗口、结构化摘要和外部记忆检索等方案。重点检查关键约束是否丢失、旧状态是否继续生效,以及恶意或无关内容能否进入高信任区域。
判断上下文是否健康的标准,不是模型记住了多少,而是它能否在正确时刻调用正确事实,并明确知道哪些内容尚未验证。
总结
AI Agent 的超长上下文治理,本质上是一套信息生命周期管理机制。有效实践并非无限保存历史,而是通过分层存储、按需检索、结构化压缩、来源追踪、有效期控制和执行前复核,让当前决策始终建立在少量、高相关、可验证的信息之上。只有把上下文视为需要持续维护的运行时资产,Agent 才能在长程任务中减少历史污染,保持目标一致性,并获得更稳定、可审计的执行结果。