在 AI Agent 项目中,基础模型决定的不只是回答质量,还影响工具选择、参数生成、任务规划、异常恢复和运行成本。很多团队选型时只比较通用问答或推理能力,却忽略了一个更关键的问题:模型究竟擅长使用训练阶段反复接触的原生工具,还是能够仅凭工具说明,正确调用第一次见到的新工具?这两类能力看似相近,实际对应着不同的产品路线与工程风险。
一、先区分两类工具能力
原生工具学习通常指模型经过专门训练、微调或平台级适配,已经熟悉某种工具调用格式以及一组常用能力,例如联网搜索、代码执行、文件检索和计算器。它的优势是调用路径成熟、参数格式稳定,并能与平台运行时形成较完整的闭环。
新工具零样本泛化则是把一个模型未必见过的 API、企业内部函数或 MCP 工具,通过名称、描述、参数结构和返回值说明临时提供给模型,观察其能否在没有额外训练样例的情况下完成选择与调用。函数调用本质上是让模型输出工具名称及结构化参数,再由外部程序真正执行,相关机制可参考 Gemini 函数调用文档。citeturn1search5
二、原生工具学习的优势与边界
对高频、标准化任务而言,原生工具往往更有优势。例如搜索公开信息、执行 Python、查询知识库或处理文件时,平台通常已经优化了工具描述、消息协议、结果回传和失败重试。开发者不必从零搭建每一个环节,更容易快速形成可用产品。
但原生工具表现好,不等于模型具备强泛化能力。模型可能习惯某个固定名称、参数顺序或返回格式,一旦换成企业内部接口,便出现选错函数、遗漏必填字段或擅自补全参数的问题。与此同时,深度依赖平台专属工具还可能增加迁移成本,因此选型时应把“现成体验”与“开放工具适应性”分开评估。
三、零样本泛化为什么更难
面对陌生工具,模型至少需要完成四步判断:理解用户意图、从候选工具中准确匹配、依据结构约束生成参数,以及在信息不足时主动追问或拒绝调用。任何一步出错,都可能让 Agent 从“回答错误”升级为“执行错误”。
零样本测试尤其要关注模型是否会克制调用。用户只是询问退款规则时,不应直接触发退款;缺少订单号时,也不应凭空生成。Berkeley Function Calling Leaderboard 不仅评估单次、串行和并行函数调用,还覆盖多轮交互、状态保持与应当放弃调用的场景,说明真实工具能力不能只看 JSON 是否合规,可参考 BFCL 评测页面及相关论文。citeturn1search7turn1search9
四、基础模型选型的核心维度
- 工具选择准确性:同时提供功能相近的工具,检查模型能否依据适用范围、权限和时效性作出正确选择。
- 参数可靠性:测试必填字段、枚举值、数组、嵌套对象、日期格式以及空值处理,不能只测试简单字符串。
- 未知工具适应性:使用模型未接触过的内部接口,并更换工具名称与描述方式,判断能力是否依赖固定模板。
- 多步规划能力:观察模型能否先查询、再判断、后执行,并把前一步结果正确传递给下一步。
- 拒绝与澄清能力:当参数缺失、权限不足、工具无关或操作风险较高时,模型应暂停执行,而不是猜测。
- 成本与时延:统计完整任务中的模型轮次、工具次数、上下文长度和重试数量,而非只比较单次调用价格。
五、建议采用双轨评测方法
第一条轨道评估原生工具。在同一批真实任务上测试搜索、文件读取、代码执行等平台能力,记录完成率、错误类型、平均轮次和人工接管比例。第二条轨道评估陌生工具:准备一组内部 API,严格控制说明质量,不提供额外示例,测试模型的零样本表现。
随后增加扰动测试,包括相似工具名、冗长说明、无关候选、缺失参数、冲突约束、接口报错和超时返回。为了避免把提示词工程误当成模型能力,应先使用统一工具描述进行横向比较,再针对候选模型分别优化。工具名称、用途说明和参数结构本身会显著影响调用效果,因此生产评测必须固定描述规范。
一个实用的决策原则
工具集合稳定、上线速度优先时,优先选择原生工具闭环成熟的模型;工具变化频繁、需要接入大量企业系统时,更应重视零样本工具泛化和协议兼容能力。
面向客服查询、办公助手和内容检索等相对固定的场景,可以把原生工具成功率放在更高权重。面向运维自动化、数据分析平台和多租户 Agent,则应提高陌生工具选择、多步调用、错误恢复与拒绝执行的权重。无论选择哪一类模型,高风险操作都应加入参数校验、权限检查、幂等控制、审计日志和人工审批。
总结
AI Agent 基础模型选型不能简化为“哪个模型最聪明”。原生工具学习决定产品能否快速落地,新工具零样本泛化决定系统能否持续扩展。更稳妥的做法,是围绕企业真实任务建立双轨评测,分别检验熟悉工具与陌生工具,再综合比较准确性、克制能力、多步规划、成本和工程适配度。最终应选择在目标场景中最稳定、可控且便于治理的模型,而不是单纯追逐某个公开榜单上的最高分。