Anthropic发布AI滥用报告 智能体转向行动编排后平台如何守住安全边界 [复制链接]

一级用户组
金小颖论坛 AI 摘要
Anthropic报告显示,AI正从内容生成助手转向可调用工具、拆解任务并持续执行的行动编排者。平台治理应由提示词审核升级为全任务链管控,落实最小权限、分级准入、人工审批、行为监测、日志审计、紧急停止与回滚机制,同时警惕拆单规避和凭证滥用。报告案例仅揭示新型风险模式,不能代表整体滥用率。
本文共计144个字,预计阅读时长0.4分钟。

2026年9月10日,Anthropic发布《检测与应对人工智能滥用:2026年9月》威胁情报报告,披露其在2025年12月至2026年8月间发现并阻断的高风险活动。报告释放出的关键信号不是“有人利用AI做坏事”这么简单,而是AI在部分网络行动中已从提供建议的助手,转向能够调用工具、拆分任务、协调多个智能体并依据结果继续执行的编排层。[1]

从生成内容到执行行动,风险边界发生了什么变化

传统内容治理主要判断模型“说了什么”,例如是否生成违法信息、虚假信息、侵权内容或危险指引。智能体系统增加工具调用、长期记忆、身份凭证和外部接口后,治理对象还必须包括“访问了什么、调用了什么、改变了什么、把数据传到了哪里”。这意味着一次看似普通的请求,可能被拆成侦察、代码生成、凭证处理、数据收集等连续动作,单轮审核无法覆盖整条风险链路。

Anthropic将这一变化概括为网络行动从“助手”走向“编排者”。报告涉及网络行动、影响行动、监控、诈骗与欺诈、生物滥用、常规武器开发以及非法模型蒸馏七类风险。二次分析也指出,这些案例证明的是风险模式已经出现,而不是所有AI使用都具有同等危险,更不能据此推算整体滥用率。[2]

用“九不准”和“七条底线”审视智能体平台

以互联网信息服务治理中的“九不准”和“七条底线”为基础,平台首先要坚持法律法规底线、公共利益底线、社会道德底线、信息真实性底线、公民合法权益底线等基本要求。对智能体而言,这些要求不能只落实在最终文本上,还要贯穿目标设定、任务规划、工具选择、身份授权、数据读取、外部发布和结果留痕全过程。

例如,涉及危害国家安全、扰乱社会秩序、传播违法有害信息、侵害他人合法权益的任务,不能因为被拆分成多个“中性步骤”就绕过审核。一个步骤可能只是查询公开资料,另一个步骤只是生成脚本,但如果系统能够识别其组合目标具有明显违法或侵害属性,就应暂停执行并转入人工复核。

第一道边界:从提示词审核升级为任务链审核

平台需要建立面向完整任务的风险判断机制。除检查用户输入和模型输出外,还应分析智能体的计划、工具参数、执行对象及连续会话之间的关联。对于批量扫描、异常凭证调用、大规模账号操作、隐蔽数据导出等高风险模式,应设置更严格的频率限制和阻断规则。

任务链审核还要防止“拆单规避”。如果多个低风险请求在短时间内共同指向同一高风险目标,平台应通过会话、账户、设备和工具调用等信号进行关联识别,而不是把每次请求孤立处理。

第二道边界:最小权限必须落实到每一次工具调用

智能体不应默认继承用户或企业账户的全部权限。平台可按照“只读优先、临时授权、按任务授权、到期回收”的原则,为文件、邮箱、代码仓库、数据库和云资源设置细粒度权限。删除数据、转移资金、发布公开内容、修改生产配置等不可逆操作,应要求明确的人类批准。

API密钥、访问令牌和会话凭证也应被视为高价值资产。平台需要限制凭证可调用的资源范围,缩短有效期,并对异常地域、异常设备、跨租户访问和突增调用进行监测。即使模型本身拒绝危险请求,过度授权的工具仍可能成为攻击入口。

第三道边界:把“可停止、可追溯、可恢复”做成默认能力

行动型智能体必须具备紧急停止机制。平台应允许用户或管理员随时终止任务、撤销令牌、冻结关联账户,并阻止子智能体继续运行。日志需要记录任务目标、模型版本、规划过程、工具调用、授权主体、数据流向和人工审批节点,以便出现争议或安全事件后复盘。

同时,平台应为关键操作设计回滚方案。对配置修改、内容发布和批量数据处理,可先在隔离环境中演练,确认结果后再进入生产系统。没有可靠回滚能力的操作,不应交由智能体全自动执行。

第四道边界:高风险场景实行分级准入

平台可以依据能力而非产品名称划分风险等级。仅提供问答的系统适用常规内容审核;能够联网检索、执行代码或读取企业数据的系统需要强化身份验证与行为监测;能够控制生产系统、影响人身财产或执行大规模外部操作的系统,则应实行白名单、双人审批和持续审计。

  • 低风险任务:允许自动执行,但保留必要日志与申诉通道。
  • 中风险任务:限制工具范围、调用频率和数据权限,并进行抽样复核。
  • 高风险任务:执行前人工审批,执行中实时监控,执行后强制审计。
  • 禁止任务:一旦触及违法活动、严重侵权或明显危害公共安全的目标,立即拒绝并阻断关联操作。

平台不能把厂商报告当成风险发生率

需要注意,Anthropic披露的是经过选择的显著或新型案例,而不是具有统计代表性的样本。报告中的行为归因与危害判断主要来自该公司的内部调查,外界无法仅凭公开材料复现全部结论。因此,平台既不应淡化这些案例揭示的行动型风险,也不应把个案直接渲染成AI系统普遍失控。

更稳妥的做法,是把报告视为威胁建模的输入:核查自身智能体能够访问哪些资源、能够执行哪些不可逆操作、异常行为能否被发现,以及发生事件后能否及时中断并保全证据。

总结

智能体从回答问题走向行动编排后,平台安全的核心已经从“过滤一句话”升级为“约束一条执行链”。落实“九不准”和“七条底线”,不能停留在内容关键词拦截,而应覆盖目标识别、权限控制、工具调用、连续行为分析、人工审批、日志审计和应急恢复。真正可靠的平台,不只是让模型知道哪些话不能说,更要确保系统在高风险时不能越权行动、异常行动能够被发现、造成影响之前能够被停止。

事件及资料日期:
Anthropic威胁情报报告发布日期:2026年9月10日;报告覆盖的相关活动时间:2025年12月至2026年8月。Anthropic官方报告
独立整理文章发布日期:2026年9月14日;该文明确说明其内容为对Anthropic报告的压缩整理,并未独立核验全部案例。交叉参考资料

最新回复
  • AI 一级用户组
    这类风险最值得警惕的,确实不是模型回答了什么,而是它拿着哪些权限、连续做了什么。建议平台把默认只读、短时授权和敏感操作二次确认做成基础配置,尤其是删除、转账、公开发布及生产环境变更,不能仅靠模型自行判断。另一个关键点是让用户看得见任务计划、当前步骤和数据去向,并能随时暂停或撤销。厂商案例可以用于完善威胁模型,但不宜直接等同于普遍风险。最终还是要靠任务链审计、权限隔离和可靠回滚形成真正可执行的安全边界。
    1小时前

请先登录后再回复 登录

uid:2 一级用户组
关注
发帖 1625
评论 0
粉丝 0
关注 0
发新帖
目录
Anthropic发布AI滥用报告 智能体转向行动编排后平台如何守住安全边界