当 AI Agent 从“回答问题”走向“调用工具并执行操作”后,基础模型能否识别歧义与信息缺口,往往比语言是否流畅更重要。一个不会追问的模型,可能把不完整需求当成明确指令;一个过度追问的模型,又会增加等待时间和交互成本。因此,选型评估的重点不是简单判断“会不会问”,而是验证它能否在正确时机提出最有价值的问题。
一、先明确两种不同的问题
评估前应区分歧义与信息缺口。歧义是指用户表述存在多个合理解释,例如“把报告发给负责人”,但系统中有多位负责人;信息缺口则是完成任务所需的必要参数尚未提供,例如发送邮件时缺少收件人地址。二者都可能触发澄清,但评估方法不能完全相同。
还要区分“用户需求不确定”与“模型自身不确定”。前者需要向用户提问,后者可能更适合通过检索、读取上下文或调用查询工具解决。相关研究提出,可围绕工具参数及其取值范围分析结构化不确定性,而不是只依赖语言层面的模糊判断,参见 Structured Uncertainty guided Clarification for LLM Agents。
二、建立覆盖真实风险的测试集
测试集不应只放明显缺失参数的简单问题,而应按照风险和难度分层。每条样例需标注预期行为,包括直接回答、查询上下文、调用只读工具、发起澄清、拒绝执行或请求人工介入。这样才能判断模型是否选择了正确策略,而不是仅比较生成文本。
- 明确且完整:信息已经充分,模型不应无故追问。
- 单一关键缺口:缺少一个决定任务成败的必要字段。
- 多重歧义:对象、时间、范围或执行方式同时不明确。
- 可由上下文补全:答案已存在于会话、用户档案或业务记录中。
- 可由工具验证:模型应先查询系统,而不是把验证责任推给用户。
- 高风险操作:涉及删除、付款、发布或权限变更时,应采用更严格的澄清标准。
- 不可完成请求:即使反复提问也无法满足,需要及时说明限制。
样例来源应结合真实业务日志、领域专家设计的边界案例,以及经过人工审核的合成案例。通用基准只能提供参考,真正影响选型的仍是模型在目标业务分布中的表现。评估还应持续加入线上出现的新失败案例,而不是在项目初期一次性完成,相关方法可参考 OpenAI Evals。
三、重点衡量六类能力
1. 该问时能否主动问
首先统计“应澄清样例召回率”,即存在关键歧义或缺口时,模型有多少次真正提出了问题。如果召回率偏低,Agent容易擅自假设参数并执行错误操作。对于不可逆或高影响任务,应单独观察这一指标,不能被大量低风险样例稀释。
2. 不该问时能否直接做
只看主动澄清率会奖励过度谨慎。还应统计“不必要澄清率”,检查模型是否重复询问上下文中已有的信息,或者对无关细节反复确认。优秀模型应把追问视为有成本的动作,而不是规避责任的通用答案。
3. 能否找到真正的关键缺口
一个请求可能缺少多项信息,但并非每项都值得立即询问。评估者应检查问题是否指向影响执行路径、结果正确性或安全性的关键变量。例如预订出行服务时,日期通常比座位偏好更优先。模型若先询问低价值细节,会拉长对话并降低任务完成率。
4. 问题是否具体且容易回答
“请提供更多信息”通常不是高质量澄清。更好的问题会明确指出缺失字段,并尽可能给出候选项,例如“你指的是华东区销售负责人还是项目负责人?”评分时可考察问题的针对性、单义性、答案负担和是否包含必要上下文。
5. 能否根据回答继续推进
澄清能力必须放在多轮环境中测试。用户补充信息后,模型应更新任务状态,避免重复询问,并正确完成后续工具调用。Agent会跨多轮使用工具、修改环境状态,早期错误还可能沿执行链传播,因此仅评估第一轮文本远远不够。多轮评估的设计原则可参考 Anthropic 的 Agent 评估实践。
6. 能否控制澄清成本
建议同时记录完成任务所需的澄清轮数、重复问题数、总延迟和调用成本。理想模型不是提问最多,而是以较少轮次消除足以影响决策的不确定性。若两个模型任务成功率接近,应优先选择澄清更精准、交互负担更低的一方。
四、采用“结果、过程、安全”三层评分
结果层关注任务最终是否正确完成;过程层检查是否识别缺口、是否选择正确的信息获取方式,以及提问顺序是否合理;安全层判断模型有没有在高风险信息不足时擅自执行。三层指标应分别报告,避免一个综合分数掩盖严重缺陷。
评分方式可以组合使用:工具名称和参数完整性采用规则校验;是否需要澄清采用人工标签;问题质量通过双人评审或经过人工校准的模型评审完成。由于模型输出存在随机性,同一样例应运行多次,并比较稳定性,而不是依据单次“演示效果”做选型决定。
一个实用的选型原则是:把“错误执行的代价”与“多问一次的代价”同时纳入评分。业务风险越高,对漏问的惩罚越大;任务越高频、越低风险,对无效追问和交互延迟的约束越严格。
五、避免常见评估误区
- 只测试明确缺参:这只能验证格式识别,无法验证复杂歧义判断。
- 只看最终回答:Agent可能碰巧得到正确结果,但中间决策并不可靠。
- 把所有追问都算正确:无关、重复或可由工具解决的问题不应获得高分。
- 忽略提示词与工具描述:基础模型表现会受到系统提示、参数定义和工具接口质量影响,选型时应使用相同配置进行公平比较。
- 只运行一次:单次成功无法代表稳定性,应通过重复试验观察波动与失败模式。
- 使用纯通用数据:真实业务中的缩写、隐含规则和权限约束通常不会出现在公开基准中。
总结
评估 AI Agent 基础模型的主动澄清能力,本质上是在衡量它能否管理任务执行前的不确定性。完整的方法应覆盖歧义识别、缺口定位、提问价值、多轮状态更新、工具使用、安全边界和交互成本。最终选型不应追求“最爱提问”的模型,而应选择能够先利用已有上下文和工具,在确有必要时提出少量、精准、可回答问题,并在信息充分后可靠执行的模型。