2026年9月10日,Anthropic发布新一期AI威胁情报报告,披露其在2025年12月至2026年8月期间识别并处置的多类模型滥用活动。报告显示,风险焦点正从“用AI查询攻击方法”转向“让AI参与侦察、编排工具、处理窃取数据乃至维持攻击流程”。与此同时,未经授权提取模型能力的“非法蒸馏”也被列为独立风险类别。需要注意的是,这些案例和归因主要来自Anthropic自身的系统记录,属于平台方披露,并非全部经过第三方独立审计。相关范围可参见Anthropic报告页面和完整报告。
AI为何从攻击助手变成流程编排者
传统网络攻击通常需要操作者在信息搜集、漏洞验证、凭据处理、横向移动和数据整理之间不断切换。Anthropic此次披露的重点并不是出现了前所未见的攻击技术,而是模型能够把多个常见环节串联起来,降低操作成本并提高执行速度。报告将这种变化概括为AI由“助手”走向“编排者”:人类确定目标和方向,模型或代理框架承担更多重复性、工具化和连续性的任务。二次报道也指出,部分活动已经覆盖侦察、钓鱼基础设施配置、凭据收集和失窃数据整理等阶段,但有关行动主体和影响范围仍应以报告中的审慎表述为准。相关交叉报道
这意味着防守方不能再只盯着某一次异常提问。单条请求可能看似普通,真正的危险往往体现在连续行为中,例如短时间内反复生成工具代码、批量处理目标信息、尝试规避检测,或者通过多个账号和接口拼接完整流程。平台需要把内容审核、账户行为、调用频率、工具权限和支付异常放在同一风险视图中,才能识别隐藏在正常请求外观下的攻击链。
平台阻断网络攻击的关键环节
根据Anthropic的说明,其处置逻辑并非依赖一道静态过滤规则,而是形成“发现、调查、封禁、加固、共享”的闭环。平台先从异常使用模式中识别高风险账户,再结合会话、工具调用和关联活动进行调查;确认违反政策后中断服务,并把新出现的绕过手法反馈给分类器和安全机制。在适当情况下,平台还会把威胁情报分享给主管机构或行业伙伴。官方概述
- 限制高危能力组合:对代码执行、外部连接、批量自动化和敏感数据处理设置分级授权,避免模型获得不必要的端到端操作权限。
- 识别跨会话行为:把短周期高频调用、多账号协同、异常代理网络和支付方式纳入关联分析,而不是孤立判断单条内容。
- 实施动态速率控制:面对疑似自动化攻击,应降低调用速率、触发二次验证,必要时暂停密钥或账户。
- 保留人工复核:涉及安全研究、漏洞验证等双重用途场景时,通过人工审查、用途证明和受控环境减少误伤。
- 沉淀可共享指标:在符合法律和隐私要求的前提下整理恶意基础设施、异常账户模式及其他可用指标,帮助上下游共同防御。
模型窃取为何成为新的平台级风险
报告还讨论了“非法蒸馏”,即行为方通过欺诈账号、代理网络或其他规避方式,批量获取目标模型的输出,试图复制其特定能力。模型蒸馏本身是一种正常技术方法,问题在于是否获得授权,以及访问过程中是否伴随身份欺诈、盗用密钥或违反服务条款。因此,“模型窃取”不能简单理解为下载了一个文件,它更可能表现为长期、分布式和经过伪装的高强度交互。Anthropic称已针对相关活动封禁账户、强化检测并与合作方共享信息;第三方分析则提醒,报告中的主体判断和规模数据仍主要基于Anthropic单方证据。第三方分析
对此,平台需要同时保护模型能力和访问体系。可行措施包括检测高度结构化的批量提示、限制新账户的异常并发、识别多个账号之间近似的请求模板、加强API密钥保护,并对经销商或中转服务开展真实性核验。企业用户也应避免共享长期有效的密钥,按项目配置最小权限和调用额度,同时为异常地域、请求量突增及非工作时段访问设置告警。
以“九不准”和“七条底线”校准治理边界
面向中文互联网治理场景,处置AI滥用不能只追求技术拦截,还应坚持合法合规、公共利益、社会秩序、真实信息和公民合法权益等底线。对于攻击工具生成、数据窃取、诈骗引流和非法监控等行为,平台应及时限制并保存必要证据;对于合法安全研究,则应建立明确的申诉、授权和复核机制,避免把正常研究与恶意入侵混为一谈。
有效治理不是无限收集数据,也不是把所有高风险词汇一律封禁,而是在最小必要原则下识别真实风险,做到规则公开、处置留痕、权限受控和责任可追溯。
论坛用户在讨论此类报告时也应区分“平台识别”“平台归因”和“第三方证实”三个层次。未经独立核验的主体指控不宜改写成确定事实,更不应扩散未公开的攻击步骤、恶意代码或个人信息。这样的表达方式既能保留事件的公共价值,也能避免制造谣言、侵犯权益或为现实攻击提供便利。
总结
Anthropic此次报告传递出的核心信号是:AI安全竞争已经从回答层面的内容过滤,进入账户、工具、代理、接口和生态协同构成的系统治理阶段。阻断网络攻击需要持续观察完整行为链,防范模型窃取则要把账号真实性、调用模式、密钥安全和授权边界结合起来。对平台而言,真正有效的方案不是等待一次明显违规,而是在攻击形成规模前发现异常、限制权限、人工复核并及时共享威胁情报。
事件及资料日期:Anthropic威胁情报报告发布于2026年9月10日,覆盖其声称在2025年12月至2026年8月期间识别和处置的活动。资料来源:Anthropic官方报告页面、报告PDF、2026年9月11日发布的TechNode Global交叉报道及2026年9月14日更新的Better Stack分析。