2026年9月10日,Anthropic发布《检测与应对人工智能滥用:2026年9月》威胁情报报告,披露其在2025年12月至2026年8月间发现并阻断的高风险活动。报告释放出的关键信号不是“有人利用AI做坏事”这么简单,而是AI在部分网络行动中已从提供建议的助手,转向能够调用工具、拆分任务、协调多个智能体并依据结果继续执行的编排层。[1]
从生成内容到执行行动,风险边界发生了什么变化
传统内容治理主要判断模型“说了什么”,例如是否生成违法信息、虚假信息、侵权内容或危险指引。智能体系统增加工具调用、长期记忆、身份凭证和外部接口后,治理对象还必须包括“访问了什么、调用了什么、改变了什么、把数据传到了哪里”。这意味着一次看似普通的请求,可能被拆成侦察、代码生成、凭证处理、数据收集等连续动作,单轮审核无法覆盖整条风险链路。
Anthropic将这一变化概括为网络行动从“助手”走向“编排者”。报告涉及网络行动、影响行动、监控、诈骗与欺诈、生物滥用、常规武器开发以及非法模型蒸馏七类风险。二次分析也指出,这些案例证明的是风险模式已经出现,而不是所有AI使用都具有同等危险,更不能据此推算整体滥用率。[2]
用“九不准”和“七条底线”审视智能体平台
以互联网信息服务治理中的“九不准”和“七条底线”为基础,平台首先要坚持法律法规底线、公共利益底线、社会道德底线、信息真实性底线、公民合法权益底线等基本要求。对智能体而言,这些要求不能只落实在最终文本上,还要贯穿目标设定、任务规划、工具选择、身份授权、数据读取、外部发布和结果留痕全过程。
例如,涉及危害国家安全、扰乱社会秩序、传播违法有害信息、侵害他人合法权益的任务,不能因为被拆分成多个“中性步骤”就绕过审核。一个步骤可能只是查询公开资料,另一个步骤只是生成脚本,但如果系统能够识别其组合目标具有明显违法或侵害属性,就应暂停执行并转入人工复核。
第一道边界:从提示词审核升级为任务链审核
平台需要建立面向完整任务的风险判断机制。除检查用户输入和模型输出外,还应分析智能体的计划、工具参数、执行对象及连续会话之间的关联。对于批量扫描、异常凭证调用、大规模账号操作、隐蔽数据导出等高风险模式,应设置更严格的频率限制和阻断规则。
任务链审核还要防止“拆单规避”。如果多个低风险请求在短时间内共同指向同一高风险目标,平台应通过会话、账户、设备和工具调用等信号进行关联识别,而不是把每次请求孤立处理。
第二道边界:最小权限必须落实到每一次工具调用
智能体不应默认继承用户或企业账户的全部权限。平台可按照“只读优先、临时授权、按任务授权、到期回收”的原则,为文件、邮箱、代码仓库、数据库和云资源设置细粒度权限。删除数据、转移资金、发布公开内容、修改生产配置等不可逆操作,应要求明确的人类批准。
API密钥、访问令牌和会话凭证也应被视为高价值资产。平台需要限制凭证可调用的资源范围,缩短有效期,并对异常地域、异常设备、跨租户访问和突增调用进行监测。即使模型本身拒绝危险请求,过度授权的工具仍可能成为攻击入口。
第三道边界:把“可停止、可追溯、可恢复”做成默认能力
行动型智能体必须具备紧急停止机制。平台应允许用户或管理员随时终止任务、撤销令牌、冻结关联账户,并阻止子智能体继续运行。日志需要记录任务目标、模型版本、规划过程、工具调用、授权主体、数据流向和人工审批节点,以便出现争议或安全事件后复盘。
同时,平台应为关键操作设计回滚方案。对配置修改、内容发布和批量数据处理,可先在隔离环境中演练,确认结果后再进入生产系统。没有可靠回滚能力的操作,不应交由智能体全自动执行。
第四道边界:高风险场景实行分级准入
平台可以依据能力而非产品名称划分风险等级。仅提供问答的系统适用常规内容审核;能够联网检索、执行代码或读取企业数据的系统需要强化身份验证与行为监测;能够控制生产系统、影响人身财产或执行大规模外部操作的系统,则应实行白名单、双人审批和持续审计。
- 低风险任务:允许自动执行,但保留必要日志与申诉通道。
- 中风险任务:限制工具范围、调用频率和数据权限,并进行抽样复核。
- 高风险任务:执行前人工审批,执行中实时监控,执行后强制审计。
- 禁止任务:一旦触及违法活动、严重侵权或明显危害公共安全的目标,立即拒绝并阻断关联操作。
平台不能把厂商报告当成风险发生率
需要注意,Anthropic披露的是经过选择的显著或新型案例,而不是具有统计代表性的样本。报告中的行为归因与危害判断主要来自该公司的内部调查,外界无法仅凭公开材料复现全部结论。因此,平台既不应淡化这些案例揭示的行动型风险,也不应把个案直接渲染成AI系统普遍失控。
更稳妥的做法,是把报告视为威胁建模的输入:核查自身智能体能够访问哪些资源、能够执行哪些不可逆操作、异常行为能否被发现,以及发生事件后能否及时中断并保全证据。
总结
智能体从回答问题走向行动编排后,平台安全的核心已经从“过滤一句话”升级为“约束一条执行链”。落实“九不准”和“七条底线”,不能停留在内容关键词拦截,而应覆盖目标识别、权限控制、工具调用、连续行为分析、人工审批、日志审计和应急恢复。真正可靠的平台,不只是让模型知道哪些话不能说,更要确保系统在高风险时不能越权行动、异常行动能够被发现、造成影响之前能够被停止。
事件及资料日期:
Anthropic威胁情报报告发布日期:2026年9月10日;报告覆盖的相关活动时间:2025年12月至2026年8月。Anthropic官方报告
独立整理文章发布日期:2026年9月14日;该文明确说明其内容为对Anthropic报告的压缩整理,并未独立核验全部案例。交叉参考资料