在 AI Agent 项目中,基础模型选型不能只看通用问答分数、上下文窗口或单次工具调用成功率。真正进入业务流程后,Agent 往往需要把模糊目标转化为可执行步骤,识别步骤之间的数据、资源和时序依赖,并在执行条件变化时调整计划。因此,评估重点应从“模型能否给出答案”转向“模型能否形成正确、可执行且可恢复的任务图”。
一、先明确要评估的两项核心能力
复杂任务分解是指模型能否把总目标拆成粒度适当、边界清晰、可以验证的子目标。拆得过粗,执行器无法直接操作;拆得过细,则会增加调用次数、状态管理成本和错误传播概率。理想的分解结果应覆盖完成任务所需的关键步骤,同时避免无关、重复或无法执行的动作。
子目标依赖识别则关注模型能否判断哪些步骤必须串行、哪些可以并行,以及后续步骤依赖哪些中间产物。例如,“生成经营分析报告”可能包含读取数据、清洗字段、计算指标、解释异常和输出文档。指标计算依赖清洗结果,异常解释依赖计算结果,而不同业务区域的指标计算可能并行完成。
TaskBench 将任务自动化划分为任务分解、工具选择和参数预测三个阶段,并使用工具图表达子任务关系,这种思路适合用来设计企业内部测试集,参见 TaskBench 论文说明。
二、用任务图而不是自然语言评价计划
如果只让模型输出一段计划文字,评审者很容易被语言流畅度影响。更可靠的方式是要求模型输出结构化任务图:每个节点代表一个子目标,边表示依赖关系,节点属性记录输入、输出、工具、前置条件和完成标准。即使生产系统最终不采用这种格式,评测阶段也应尽量统一表达,以便自动比较。
一份参考任务图应由熟悉业务和工具能力的人员共同标注。评估时不必要求模型与参考答案逐字一致,而应检查以下内容:
- 目标覆盖率:完成总目标所需的关键子目标是否全部出现。
- 冗余率:是否生成重复、无效或不能推进任务的步骤。
- 依赖正确率:前置关系是否准确,是否存在先使用结果、后生成结果的倒置。
- 并行识别能力:互不依赖的步骤是否被错误地全部串行化。
- 可执行性:每个节点的输入、工具和成功条件是否明确。
- 无环性:计划中是否出现相互等待、无法启动的循环依赖。
三、分层构造测试任务
测试集应覆盖不同复杂度,而不能只使用“订机票”“查天气”一类短任务。可以从四个层级逐步增加难度:第一层是固定顺序的线性任务;第二层包含可以并行处理的分支;第三层包含条件判断、共享资源和多工具协作;第四层加入信息缺失、工具故障、权限限制及不可完成目标。
每个业务场景还应设计成对样本。例如,在原任务中加入一个新的日期约束、审批规则或工具限制,观察模型能否只调整相关节点,而不是完全改写计划。也可以删除必要输入,检查模型是否主动询问、暂停执行或明确拒绝,而不是凭空补全事实。
近期的 Agent Planning Benchmark 强调将规划质量与实际执行结果分开诊断,并覆盖整体规划、逐步规划、无关工具、故障工具和不可解任务等情形,参见 Agent Planning Benchmark。这一原则非常重要:一次端到端失败可能来自计划错误,也可能来自接口超时,二者不应被记为同一种模型缺陷。
四、设计可落地的评分体系
建议采用“硬指标加人工审查”的组合方式。硬指标负责检查必要节点、依赖边、拓扑顺序、工具约束和结构合法性;人工评审则判断分解粒度、业务合理性和异常处理策略。综合评分可以把目标覆盖、依赖正确、可执行性和鲁棒性设为主要维度,但权重应依据业务风险确定,而不是机械套用统一比例。
- 先在不调用工具的条件下评估静态规划,隔离模型自身的任务理解能力。
- 再提供工具描述,检查工具能力是否改变了分解方式和依赖关系。
- 随后运行真实或模拟执行器,记录每一步的输入、输出、重试和回退行为。
- 最后注入超时、空结果、权限不足等异常,观察模型能否局部重规划。
除了平均分,还应单独统计严重错误,例如遗漏合规审批、在数据生成前启动分析、对不可逆操作缺少确认,以及工具失败后反复执行同一动作。对于高风险场景,一次关键依赖判断错误的影响,可能远高于多次普通步骤遗漏。
五、把质量、成本与稳定性一起纳入选型
模型能力强并不等于系统成本最低。测试时应在相同提示词、工具说明、最大重试次数和输出格式下,记录完成率、规划耗时、输入输出量、工具调用次数及计划波动。对同一任务重复运行多次,可以观察任务图是否稳定;如果每次依赖关系都明显变化,生产环境中的调试和审计成本会很高。
实际选型还可以采用分层架构:较轻量模型处理意图识别、简单分解和状态摘要,复杂模型负责长链规划、高风险决策及失败后的重规划。这样比让单一高规格模型参与所有步骤更容易兼顾效果、延迟和预算。
总结
评估 AI Agent 基础模型的关键,不是比较谁能生成更像样的计划文本,而是验证谁能稳定构造正确的子目标与依赖关系。通过结构化任务图、分层测试集、规划与执行解耦、异常注入和多次重复实验,可以更准确地判断模型是否适合真实业务。最终选择应同时满足规划正确、依赖清晰、异常可恢复、结果可审计和运行成本可控,而不是仅依据单一排行榜作出决定。