🤖 AI Agent 正在从“回答问题的工具”变成“能够调用系统、读写数据、执行任务的数字协作者”。能力越强,安全边界就越重要。尤其当 Agent 可以访问邮件、知识库、工单、代码仓库、数据库或业务系统时,风险不再只是“回答错了”,还可能是越权读取、误操作、数据泄露,甚至被提示词注入诱导执行高危动作。
导语:先把 Agent 当成“有权限的主体”
很多团队在落地 AI Agent 时,容易把重点放在模型效果、插件数量和自动化能力上,却忽略了一个基本问题:Agent 到底代表谁在行动?如果它可以调用 API、发送消息、创建订单或修改配置,就应该像员工、服务账号或机器人流程一样,被纳入身份、权限、审计和风控体系。OWASP 在大模型应用安全资料中也重点提醒了提示词注入、敏感信息泄露、过度代理能力等风险 [1]。
一、权限设计:最小权限不是口号,而是默认策略 🔐
AI Agent 的权限控制应从“能不能完成任务”升级为“是否只拥有完成当前任务所需的最小权限”。例如,一个用于总结销售周报的 Agent,只需要读取指定报表和生成摘要,不应默认拥有导出全部客户资料、修改 CRM 字段或访问财务数据的权限。Microsoft 关于 AI Agent 最小权限的实践也强调,要在身份、范围、工具访问和可审计性上提前定义边界 [2]。
- 按任务授权:不同 Agent 对应不同业务场景,不共用万能账号。
- 按资源收敛:限制可访问的数据表、文档库、文件夹、接口和环境。
- 按动作拆分:读取、创建、更新、删除、审批应分别授权。
- 按时间控制:高权限操作尽量采用临时授权、审批后授权或任务结束即回收。
二、身份治理:每个 Agent 都要有“身份证” 🪪
如果多个 Agent 共用同一个服务账号,审计时很难判断是谁触发了某个动作,也难以及时回收异常权限。更好的做法是为每个 Agent 建立独立身份,记录负责人、用途、权限范围、创建时间、数据来源和调用工具。这样一来,Agent 的生命周期就可以被管理:上线前评审,运行中监控,停用后回收凭据和权限。
在企业环境中,可以参考成熟的身份治理思路,例如基于角色的访问控制、权限评审、特权访问管理和条件访问策略。Microsoft Entra 的最小特权角色文档也提到,应根据具体任务分配最低可用角色,并可通过更小范围或自定义角色进一步限制权限 [3]。
三、工具调用:给 Agent 装上“安全刹车” 🛑
Agent 的危险往往不在“说了什么”,而在“能做什么”。如果模型被恶意内容诱导,且工具层没有二次校验,它可能把错误指令转化为真实操作。因此,工具调用层必须独立于模型输出进行权限判断,不能因为模型说“用户已经同意”就直接执行。
- 危险动作二次确认:删除、转账、外发、提交审批、修改权限等操作,应加入人工确认或强校验。
- 参数白名单:限制 API 参数范围,避免模型构造异常请求。
- 结果脱敏:工具返回给模型的数据应最小化,避免把完整敏感字段放进上下文。
- 调用链记录:记录用户请求、Agent 决策、工具名称、参数摘要、执行结果和关联身份。
四、提示词注入防护:不要把外部内容当成可信指令 🧩
提示词注入是 Agent 场景中非常典型的风险。攻击内容可能藏在网页、邮件、文档、代码注释或知识库条目里,诱导 Agent 忽略系统规则、泄露上下文或调用工具。OWASP 的提示词注入防护资料指出,外部内容可能通过直接或间接方式改变模型行为,因此需要区分“用户指令”“系统规则”和“被处理的数据” [4]。
实践中可以采用三层防线:第一,在提示词中明确外部内容只是数据,不是指令;第二,对检索内容进行来源校验、标签标注和风险扫描;第三,在工具执行前做策略判断,确保即使模型被诱导,也不能越权调用关键能力。
一个实用原则是:模型可以提出建议,但权限系统决定能否执行;模型可以组织流程,但安全策略决定边界。
五、数据安全:上下文越长,泄露面越大 📦
很多 Agent 依赖 RAG、企业搜索或多轮记忆来提升效果,但上下文中混入的数据越多,泄露风险也越高。应避免把不必要的个人信息、密钥、合同细节、客户名单、内部策略等直接送入模型。对敏感数据,应在进入上下文前做分类、脱敏、摘要化或访问校验。
同时,Agent 的记忆功能要谨慎设计。短期会话记忆适合提升体验,但长期记忆必须有明确用途、保存期限、删除机制和用户可见性。对于企业知识库,建议根据用户身份动态检索,而不是让 Agent 拿到一个全量索引后再自行判断是否展示。
六、风险管理:把安全嵌入开发和运营流程 ⚙️
AI Agent 安全不是上线前做一次检查即可。NIST AI 风险管理框架提出了 Govern、Map、Measure、Manage 四类核心功能,强调 AI 风险管理应贯穿系统生命周期 [5]。对应到 Agent 落地,可以形成一套轻量但持续的机制。
- Govern:明确负责人、审批流程、使用边界和风险分级。
- Map:梳理 Agent 使用场景、数据来源、工具清单和影响对象。
- Measure:开展红队测试、越权测试、提示词注入测试和误操作演练。
- Manage:根据日志、告警和业务反馈持续修正权限与策略。
总结:让 Agent 有能力,也有边界 ✅
AI Agent 的价值在于自动化、协同和智能决策,但真正可持续的落地,必须建立在安全与权限控制之上。实践上,应从独立身份、最小权限、工具隔离、敏感数据保护、人工确认、日志审计和持续评估几个方面入手。不要指望一句系统提示词解决所有问题,也不要把模型当成权限判断的最终裁判。最稳妥的路线,是让 Agent 像一个受管理的数字员工:职责清晰、权限有限、行为可追溯、异常可阻断。这样,企业才能在提升效率的同时,把 AI 带来的新型风险控制在可接受范围内。