在 AI Agent 项目中,基础模型决定了智能体理解任务、调用工具、维护状态和处理长流程的能力。许多团队选型时首先比较上下文窗口长度,却容易忽略一个更关键的问题:模型“能够接收”几十万甚至更多 Token,并不代表它能稳定利用其中每一处信息。尤其当关键条件位于上下文中段时,模型可能出现遗漏、混淆或错误引用。因此,选型不能只看窗口大小,还要同时评估有效上下文、信息召回、工具调用、推理稳定性、延迟与成本。
一、超长上下文对 AI Agent 有什么价值
Agent 的上下文不仅包含用户问题,还可能包括系统指令、对话历史、工具定义、检索文档、执行日志、代码文件和阶段性结果。更长的上下文窗口可以减少机械截断,让模型一次读取更多资料,也有利于代码仓库分析、合同审阅、多文档问答和长周期任务。
但上下文是一种有限资源。内容越多,输入成本与首字响应时间通常越高,无关信息也会稀释关键证据。对于持续运行的 Agent,如果每轮都把完整历史重新发送给模型,还会产生不断膨胀的“上下文债务”。因此,超长上下文更适合作为容量上限,而不是默认填满的空间。
二、重点关注“中段信息召回”
研究论文 《Lost in the Middle》 指出,在多文档问答和键值检索实验中,模型通常更容易利用上下文开头或结尾的信息,而关键内容位于中间时,性能可能明显下降。这种现象说明,标称上下文窗口不能直接等同于可靠工作窗口。
对 Agent 而言,中段召回不足可能产生实际风险:早期写入的规则被后续内容冲淡,检索到的核心证据被大量相似文档包围,工具返回的错误信息没有在最终回答前得到重新检查,或者任务进行到后半程时遗忘中途形成的约束。模型最终可能给出语言流畅却不符合事实或流程要求的答案。
三、不要只比较模型参数表
基础模型选型应围绕真实任务建立测试集,而不是照搬公开排行榜。建议从以下维度进行比较:
- 有效上下文:逐步增加输入长度,观察答案完整性、证据引用和指令遵循是否下降。
- 位置敏感度:将同一条关键事实分别放在开头、中间和结尾,比较召回率及回答一致性。
- 干扰抵抗力:加入主题相近但结论不同的材料,检查模型能否找到真正相关的来源。
- 工具调用能力:测试参数生成、调用顺序、失败重试、结果校验和停止条件。
- 多轮稳定性:观察长流程中是否遗忘目标、重复执行工具或擅自修改约束。
- 工程指标:综合比较响应延迟、并发限制、输入输出价格、可用性和数据合规要求。
四、设计可复现的中段召回测试
测试时可以准备一批需要精确读取事实的任务,例如从多份制度文档中找出审批条件,或从日志中定位某次异常。每个任务设置唯一正确答案,并加入若干合理但错误的干扰项。随后保持问题不变,只调整正确证据在上下文中的位置。
评价指标不应只有“答对或答错”。还应记录证据定位是否准确、引用是否真实、工具调用次数、总 Token 消耗、响应时间以及多次运行的一致性。最好覆盖短、中、长三档上下文,并在相同参数和提示词下重复测试。这样才能区分偶然成功与稳定能力。
一个适合生产环境的模型,不一定在最长输入下表现最好,而应在企业常见输入范围内持续、可预测地完成任务。
五、通过上下文工程降低遗忘
即使选择了长上下文模型,也不应把全部资料无差别塞入提示词。首先,应使用检索、权限过滤和相关性重排,只保留与当前步骤有关的内容。其次,为文档添加来源、时间和章节等元数据,并使用明确分隔符,避免不同资料相互污染。
对于关键事实,可以要求模型先提取证据,再基于证据推理。Anthropic 的长上下文提示研究也讨论了先抽取相关引文、再回答问题的做法。该策略不能保证绝对正确,但能够让证据选择过程更容易检查,也便于在 Agent 工作流中增加来源验证。
长流程还应引入分层记忆:稳定规则保留在系统层,当前任务状态保存为结构化字段,历史过程压缩为阶段摘要,原始材料按需检索。工具执行完成后,应把冗长日志转换为“结果、证据、异常、下一步”四类信息,而不是永久保留所有原始输出。
六、按业务场景选择模型组合
高价值、强合规或复杂推理任务,可以优先选择长上下文利用率较高、工具调用稳定且支持结构化输出的模型。大量分类、路由和格式转换任务,则可使用成本更低的小模型。生产系统通常不必让一个大模型承担全部工作,而可以采用“小模型路由、大模型决策、检索系统供证、规则程序校验”的组合架构。
选型还要保留替换空间。建议建立统一的模型接口、提示词版本管理和回归评测流水线。当模型版本、价格或限额发生变化时,可以重新运行同一套测试,避免凭主观体验迁移。微软的提示工程文档也强调,不同模型行为可能不同,通用技巧需要结合实际模型进行验证。
总结
AI Agent 基础模型选型的核心,不是寻找上下文窗口最大的产品,而是确认模型能否在真实长度、真实噪声和真实工具链中稳定找到关键信息。团队应把中段召回、干扰抵抗、多轮记忆和工具可靠性纳入基准测试,同时通过检索重排、证据抽取、分层记忆与上下文压缩提升有效利用率。只有把模型能力与上下文工程结合起来,超长上下文才会从参数优势转化为可验证的业务能力。