导语:随着 AI 智能体从“回答问题”转向自主规划、调用工具、操作文件、执行代码和访问企业系统,沙箱已成为阻隔风险的重要边界。然而,提示注入、权限配置错误、工具链漏洞和隔离机制缺陷,可能让攻击者借助智能体越权访问宿主环境。🔐 企业若仍沿用传统应用的上线检查表,很难覆盖智能体持续决策、动态调用和机器身份扩张带来的新风险。安全审查标准必须从“模型是否可靠”升级为“整个自动化执行链是否可控”。
一、为什么传统沙箱审查已经不够
传统自动化程序通常具有固定代码、明确输入和相对稳定的调用路径,而 AI 智能体会根据上下文动态生成计划,并从多个工具中选择执行方式。同一条业务指令,在不同数据、记忆或外部页面影响下,可能形成不同调用链。这意味着企业不能只审查部署镜像和应用代码,还要审查模型输入、工具描述、身份凭据、长期记忆、网络出口与执行环境之间的组合风险。
需要特别区分“模型越狱”和“沙箱逃逸”。前者主要是诱导模型绕过内容或行为限制,后者则意味着智能体突破文件系统、进程、容器、虚拟机或网络边界。两者可能形成连续攻击链:恶意文档通过间接提示注入改变智能体目标,智能体随后调用高权限工具,再利用组件缺陷接触宿主资源。OWASP AI 智能体安全清单已将提示注入、工具滥用、权限提升、数据外泄、记忆投毒和过度自治列为关键风险。
二、把审查对象从“模型”扩展到“执行链”
企业首先应建立完整的智能体资产清单,包括模型版本、系统提示词、编排框架、插件与 MCP 服务、代码执行器、知识库、外部 API、机器身份、密钥来源及运行环境。任何未登记的工具、动态下载的依赖或临时接入的数据源,都不应直接进入生产链路。📋 审查结论还应绑定具体版本,模型、镜像、工具权限或提示词发生实质变化后,应重新触发评估。
其次,要绘制端到端信任边界。外部网页、邮件、工单、附件和用户上传文件均应按不可信输入处理;模型生成的计划、参数与代码也不能被默认视为可信。真正承担安全决策的,应是模型之外的确定性策略层,由它验证调用者身份、目标资源、参数范围、数据敏感度和操作影响,而不是让智能体自行判断自己是否有权执行。
三、升级沙箱隔离与权限控制标准
沙箱审查不能停留在“是否使用容器”。企业应根据任务风险选择隔离级别,并评估宿主内核共享、系统调用面、设备挂载、进程权限和跨租户影响。对于运行未知代码、处理敏感数据或承担多租户任务的智能体,应采用更强的隔离方案,同时设置只读根文件系统、临时工作目录、资源配额、执行超时、进程数量限制,并禁用不必要的特权模式、宿主目录挂载和管理接口。
网络出口应默认拒绝,仅允许访问经过登记的域名、端口和服务。DNS、HTTP 请求、重定向与下载行为都要经过网关检查,防止智能体把上下文、令牌或业务数据发送到未授权位置。🌐 对确需访问互联网的场景,可采用独立代理、内容过滤、下载文件扫描和响应大小限制,并阻断云实例元数据地址、内部管理网段及其他敏感基础设施入口。
权限设计应遵循最小权限、短期授权和任务隔离原则。每个智能体使用独立机器身份,不共享长期密钥;读取、写入、删除、发布和审批权限应分别配置;高风险凭据应通过密钥服务按任务动态下发,并在执行结束后立即失效。智能体也不应直接读取环境变量中的全部密钥,更不能把凭据写入提示词、记忆库或普通日志。
四、将高风险动作纳入强制审批
企业应按影响程度对工具调用分级。查询公开信息、读取低敏数据可在策略约束下自动执行;修改生产配置、批量删除、对外发送信息、资金操作、创建高权限账户和导出敏感数据,则必须进入人工审批。⚠️ 审批界面要展示原始请求、智能体计划、目标对象、关键参数、数据范围和潜在后果,避免只提供含糊的“同意执行”按钮。
对于不可逆操作,可采用“计划、验证、执行”三阶段流程。智能体先生成结构化计划,策略引擎检查权限和参数,执行器再使用受限凭据完成动作。审批后还要防止参数被替换,因此应对计划内容、工具版本、调用参数和审批结果进行完整性绑定。涉及大批量对象时,建议先在少量样本上试运行,再逐步扩大范围。
五、把红队测试变成持续准入机制
上线前测试应覆盖直接与间接提示注入、恶意附件、路径穿越、命令拼接、工具参数污染、记忆投毒、跨租户访问、凭据窃取、网络外传和失控循环等场景。测试重点不是观察模型是否“说了不该说的话”,而是验证异常输入能否引发真实操作。🧪 OWASP 智能体安全倡议提供了面向自主智能体、多步骤工作流和 MCP 服务的风险框架,可作为企业设计测试用例与审查基线的参考。
一次性渗透测试仍然不足。企业应在模型升级、工具新增、权限变化、知识库更新和编排逻辑调整后自动执行回归测试,并建立攻击样本库。准入门槛应包含明确的阻断条件,例如出现跨租户读取、未经批准的外部通信、宿主资源访问或高风险动作绕过审批时,不允许以“模型偶发行为”为理由带风险上线。
六、完善可观测性与应急处置
审计日志应记录用户请求、模型版本、智能体计划、工具调用、参数摘要、权限决策、网络目的地、审批人、执行结果和异常原因,同时对个人信息、令牌及商业机密进行脱敏。日志应写入智能体无法修改的独立存储,并使用统一任务标识串联完整调用链。这样既能支持事故追踪,也能识别调用频率突增、异常资源访问和重复失败等风险信号。📊
企业还要为智能体设置实时“停止开关”。出现可疑外联、权限提升、异常成本增长或策略连续拒绝时,平台应能够暂停任务、撤销临时凭据、隔离运行实例并保留现场。应急预案不能只包含关闭模型服务,还要覆盖密钥轮换、受影响数据确认、下游系统回滚、记忆库清理和第三方工具停用。
七、形成可执行的企业审查清单
- 资产:模型、智能体、工具、知识库、身份和依赖是否全部登记并有责任人。
- 隔离:文件、进程、系统调用、网络、租户和宿主边界是否经过验证。
- 权限:是否采用独立身份、最小权限、短期凭据与细粒度授权。
- 输入:外部内容是否按不可信数据处理,并隔离其中可能包含的指令。
- 执行:工具参数是否由策略层校验,高风险动作是否强制人工审批。
- 测试:是否完成攻击链测试、回归测试及沙箱逃逸专项验证。
- 监控:是否具备不可篡改日志、异常检测、资源限额和紧急停止能力。
- 变更:模型、权限、工具或编排变化后,是否自动触发重新审查。
总结
AI 智能体安全不能依赖单一沙箱、提示词规则或模型自律。企业自动化部署的审查标准,应升级为覆盖身份、权限、输入、工具、执行环境、网络出口、人工审批、持续测试与应急响应的纵深防御体系。🛡️ 核心原则是:默认不信任智能体生成的计划,默认限制其可调用的能力,默认记录每一次真实操作,并确保任何高影响行为都能被阻断、追溯和恢复。只有把安全控制放在模型之外,企业才能在扩大自动化收益的同时,把沙箱逃逸和失控执行限制在可管理范围内。