为 AI Agent 选择基础模型,不能只看通用榜单分数或单轮问答效果。Agent 在真实环境中需要持续规划、调用工具、观察结果,并在失败后调整策略。所谓自主反思与推理纠错能力,核心不是“能否生成一段检讨”,而是模型能否识别错误、定位原因、提出有效修正,并避免在后续步骤中重复犯错。
先明确评估对象:反思不等于纠错
模型输出“刚才的做法可能不正确”,只能说明它具备反思表达能力。真正有效的纠错至少包含四个环节:发现结果与目标不一致,判断错误发生在哪一步,生成可执行的修正方案,以及重新行动后取得更好的结果。如果反思内容听起来合理,却没有改变后续决策,就不能视为有效纠错。
Reflexion 研究提出将任务反馈转化为语言形式的反思,并存入情景记忆,供后续尝试参考。这说明评估时不能只检查单次回答,还应观察模型是否会利用历史失败经验改善下一轮行为。
建立覆盖真实 Agent 循环的测试集
评估题目应来自目标业务,而不是完全依赖数学题或代码题。例如客服 Agent 可设置政策检索错误、用户意图变化和工具返回异常;数据分析 Agent 可设置字段缺失、单位混淆和 SQL 执行失败;研发 Agent 则可加入测试未通过、依赖冲突和需求约束遗漏。
每个任务最好包含初始目标、可用工具、环境反馈、成功条件和风险边界,并设计不同长度的行动链。AgentBench通过多个交互环境评估模型的推理与决策能力,其思路值得借鉴:基础模型选型应放在多轮、开放式、可执行的环境中,而不是停留在静态问答层面。
重点测量六类能力指标
- 错误发现率:环境已经给出失败信号时,模型能否意识到当前方案存在问题,而不是继续重复调用。
- 错误定位准确率:模型能否区分事实错误、推理跳步、工具参数错误、权限问题和目标理解偏差。
- 修正成功率:第一次失败后,经过一次或多次反思,最终完成任务的比例。
- 负向纠错率:原答案本来正确,模型却因无依据的自我怀疑改成错误答案的比例。
- 重复错误率:模型是否在获得明确反馈后继续采用同一种失败策略。
- 纠错成本:完成纠错所增加的轮数、Token、工具调用次数、延迟与费用。
其中,修正成功率必须和负向纠错率同时观察。一个频繁改答案的模型未必更可靠,它可能只是缺乏判断稳定性。CorrectBench 将自我纠错区分为内部反思、外部验证和经过专门训练的纠错方式,也表明不同纠错机制应分开测试,不能用一个综合准确率掩盖差异。相关方法可参考 CorrectBench 项目说明。
采用分层对照实验
建议为每个候选模型设置四组实验:第一组直接作答,不允许反思;第二组允许模型自行检查;第三组提供环境反馈或验证工具;第四组加入历史记忆后再次执行。通过对比各组结果,可以判断提升究竟来自模型自身纠错、外部工具,还是简单的重复采样。
还应准备“无反馈”“模糊反馈”“错误反馈”和“冲突反馈”四种条件。优秀模型不应盲目迎合反馈,而要根据证据判断是否修改。对于高风险任务,应特别测试模型能否在证据不足时停止执行、请求补充信息或转交人工,而不是通过编造理由强行完成闭环。
分析轨迹,而不只看最终答案
两个模型可能得到相同结果,但过程可靠性完全不同。评审人员应保留完整轨迹,检查模型是否引用了真实观察结果、是否跳过关键约束、是否在失败后改变计划,以及反思内容与下一步行动是否一致。必要时可由业务专家进行盲评,并统一使用“发现问题、定位原因、提出方案、执行验证”四级评分标准。
一个值得选用的 Agent 基础模型,不一定每次都能立即答对,但必须能够在可验证反馈出现后,以较低成本收敛到正确且安全的行动。
选型时关注能力与工程约束的平衡
最终选型不宜简单追求最高纠错分数。高频、低风险任务可优先考虑成本低、响应快且重复错误率低的模型;复杂分析任务应提高长链推理和工具纠错权重;涉及资金、权限或数据删除的场景,则应优先考察停止条件、证据校验和人工升级能力。
同时要固定模型版本、提示词、温度、工具权限和最大轮数,并进行多次重复测试。Agent 运行具有一定随机性,单次成功案例无法代表稳定能力。上线后还应持续记录失败类型、修正次数和人工接管原因,用真实业务轨迹定期更新评估集。
总结
评估 AI Agent 基础模型的自主反思与推理纠错能力,本质上是在检验它能否从失败中获得可操作的信息,并将信息转化为更可靠的下一步行动。有效方法是围绕真实任务建立交互式测试集,以错误发现、原因定位、修正成功、负向纠错、重复错误和运行成本为核心指标,再结合轨迹审查与分层对照实验。只有同时具备纠错有效性、行为稳定性和工程可控性的模型,才适合作为生产级 Agent 的推理核心。