2026年9月10日,Anthropic发布新一期AI滥用威胁情报报告,披露其在2025年12月至2026年8月间识别并处置的高风险活动。报告认为,部分攻击者已不再把大模型仅当作问答助手,而是将其接入自动化工作流,用于编排侦察、工具调整、数据处理等多个环节。值得注意的是,这些案例属于Anthropic挑选的显著或新型事件,并不代表普通用户的典型使用方式,相关归因也应视为企业方调查结论,而非司法认定。[1]
阻断重点应从“敏感词”转向“行为链”
如果平台主要依赖关键词封禁,很容易同时出现漏报和误报。攻击者可以拆分请求、转换表述或让多个智能体分别完成低风险步骤,而安全研究人员讨论漏洞、恶意软件样本和攻击路径时,又必然会使用大量敏感术语。因此,更有效的检测对象应是连续行为,包括异常高频调用、跨目标批量探测、重复修改可疑代码、凭证收集倾向,以及模型输出是否被外部工具立即执行。
Anthropic报告提到,部分行动把AI用于攻击链的多个阶段,甚至在工具被安全产品识别后自动修改和重新构建。报告还将一组活动与公开报道中的Midnight Blizzard关联,但使用的是“归因一致”而非确定性结论。微软此前披露的CaptiveCrunch活动则从另一侧提供了交叉信息,记录了利用酒店网络和诱导页面实施恶意软件投递及凭证窃取的情况。Anthropic报告来源链接
建立分级处置,而不是“一拒了之”
模型平台可以把网络安全请求划分为三个层级。低风险层包括概念解释、安全配置检查和公开漏洞修复建议,可正常响应;中风险层包括代码审计、受控环境验证和漏洞复现,应限制工具权限并保留审计记录;高风险层则包括针对真实第三方目标的入侵、凭证窃取、持久化控制或规避检测,应停止执行并触发人工复核。
- 判断授权环境:要求高风险工具调用绑定经过验证的资产、比赛靶场或隔离沙箱,而不是只相信用户在提示词中声称“已获授权”。
- 限制执行能力:默认禁止智能体直接访问公网、生产凭据和高权限账户,对文件写入、网络连接及软件发布设置独立审批。
- 观察任务组合:单次端口检查可能合理,但批量目标发现、凭证整理和隐蔽通信连续出现时,应提升风险等级。
- 快速吊销凭据:把模型API密钥视为生产密钥,实行最小权限、额度上限、异常告警、定期轮换和紧急撤销。
避免误封安全研究的四项机制
第一,平台应识别上下文,而不是看到“漏洞利用”就拒绝。研究者分析公开CVE、编写检测规则、验证补丁有效性,与攻击真实单位存在本质区别。第二,应提供可信研究者计划,通过实名验证、机构证明和研究范围声明给予受控能力。第三,拒绝时应说明触发的风险类别,并允许提交补充材料或申诉。第四,可提供安全替代方案,例如将可直接执行的攻击代码改为检测思路、缓解措施、日志特征或不可武器化的示例。
平台还应把误封率纳入安全评估。只统计阻断数量,会激励系统过度拒绝;只强调调用增长,又可能放大滥用风险。更合理的指标包括高风险链路召回率、合法研究误拒率、申诉纠正时间、被盗密钥发现时间,以及从检测到停止工具执行的延迟。对自动封禁模型,应持续开展独立抽样和人工复核,避免地域、语言或机构身份成为简单粗暴的风险代理变量。
以“九不准”和“七条底线”约束平台治理
面向中文互联网运营场景,平台治理至少要守住法律法规、公共利益、公民合法权益、社会秩序、道德风尚和信息真实性等基本边界。网络攻击能力一旦被用于破坏系统、窃取数据、诈骗牟利或扰乱秩序,就不能以“技术研究”为借口放行;但合规治理也不应扩大为对正常学术讨论和防御性研究的无差别限制。
落实到产品设计,就是让规则公开、处置留痕、权限可控、申诉有效。对涉嫌违法或造成现实危害的任务,平台应保存必要证据并按适用法律处理;对尚未形成明确恶意意图的双用途请求,则应采用最小必要限制。这样既能贯彻底线要求,也能减少因模糊标准带来的误伤。
总结
Anthropic的新报告提示,AI安全的核心矛盾已从“模型会不会输出危险文字”转向“模型是否正在参与一条可执行的攻击链”。模型平台需要同时建设行为检测、工具隔离、凭据治理、人工复核和研究者准入机制。真正可靠的治理不是追求零风险,也不是简单封号,而是在阻断现实攻击的同时,为合法安全研究保留可验证、可审计、可申诉的空间。
事件或资料日期:
2026年9月10日:Anthropic发布《Detecting and countering misuse of AI: September 2026》,覆盖其于2025年12月至2026年8月间处置的活动,并提供相关妥协指标。官方报告
2026年9月11日:格知律师事务所发布中文合规解读,对报告中的网络攻击、API密钥风险及平台治理边界进行了整理,同时明确提醒相关事实与归因主要来自Anthropic单方调查。交叉核验资料
2026年7月31日:微软威胁情报发布CaptiveCrunch调查,为报告涉及的酒店网络攻击手法和相关威胁活动提供独立背景材料。来源链接