导语:2026年9月10日,Anthropic发布最新威胁情报报告,称其识别并阻断了多起针对Claude的“非法蒸馏”活动。该公司表示,相关活动累计涉及近2亿次模型交互,被归入五组独立行动,目标集中在智能体操作、工具调用、代码编写、数据分析和逻辑推理等能力。TechCrunch在同日的报道中核对了这一规模与主要案例,但这些归因目前主要来自Anthropic单方面调查,讨论时仍需区分“已披露的调查结论”与“经独立机构确认的事实”。[1][2]
蒸馏为何会从训练方法变成安全事件
模型蒸馏本身并不是恶意技术。其基本思路是让能力较强的“教师模型”生成答案,再利用这些输出训练规模更小、成本更低的“学生模型”。在获得授权、遵守服务条款并合法使用训练数据的情况下,蒸馏是人工智能研发中的常见方法。
真正引发争议的是工业化、隐蔽化和未经授权的能力提取。Anthropic所称的“非法蒸馏”,包括通过批量账户、代理服务或特定提示方式,持续收集Claude的输出,并尝试将其转化为竞争模型的训练材料。换句话说,攻击者未必需要侵入服务器或窃取模型权重,也可能通过看似正常的接口调用,长期复制模型的行为模式和解决问题的方法。官方报告
近2亿次交互暴露了哪些风险
第一,模型能力正在成为可被批量提取的数字资产
据Anthropic披露,规模最大的一组活动在2026年5月至7月间产生约1.51亿次交互,高峰期接近每日300万次,并分散在3500多个账户中。TechCrunch报道指出,这些交互因使用相同的固定提示模式而被归入同一活动。如此高频、持续和结构化的请求,说明能力窃取可能已经从零散模仿发展为流水线式的数据生产。TechCrunch核验报道
第二,正常API流量可能掩盖异常提取
传统网络安全更关注漏洞利用、恶意程序和未授权登录,而蒸馏活动使用的往往正是模型对外提供的正常功能。单次请求可能完全合理,只有把账户关联、提示模式、请求频率、任务分布和输出用途结合起来,才可能识别其真实目的。这要求模型服务商从“阻止非法访问”进一步转向“识别合法接口中的异常行为”。
第三,用户数据可能随代理链路发生外溢
Anthropic报告还描述了请求经第三方模型路由或代理网络转发的情形。如果服务未清楚告知用户实际调用了哪一家模型,用户输入的代码、内部文档、访问凭证或商业信息就可能离开原本预期的数据边界。企业不能只比较模型效果与调用价格,还应审查路由服务的数据保留政策、日志权限、跨境传输安排及下游处理方。
第四,能力复制未必同步继承安全措施
即使蒸馏能够复制部分推理、编程或工具使用能力,也不意味着教师模型的安全限制会被完整复制。学生模型可能学到“如何完成任务”,却没有同步获得风险识别、拒绝策略和异常监测机制。因此,未经控制的能力迁移不仅涉及商业利益,还可能放大欺诈、网络攻击和敏感数据处理方面的风险。
平台和企业可以如何应对
- 建立行为检测:结合固定提示重复率、任务覆盖范围、调用时间分布、账户聚类和输出相似性,识别批量化能力提取,而不是只设置简单的频率上限。
- 加强账户治理:对异常注册、支付工具复用、代理地址聚集和账号快速切换进行关联分析,同时保留申诉渠道,减少对正常开发者的误伤。
- 落实模型来源披露:使用聚合平台或智能路由服务时,应明确实际调用的模型、数据处理区域、保存期限和二次使用规则。
- 实施最小化输入:企业员工不应直接提交密钥、客户资料、未公开代码或内部经营数据。确需调用外部模型时,应先脱敏,并使用受控的企业接口。
- 完善合同边界:服务条款应明确禁止未经授权的训练、蒸馏、转售和代理转发,同时规定审计、证据留存与违规处置机制。
讨论此事也要守住信息发布底线
按照互联网信息服务治理中强调的合法、真实、文明和负责任原则,论坛讨论不应把企业调查报告直接写成司法定论,也不应据此攻击特定国家、地区或从业群体。对尚未获得独立验证的归因,应使用“Anthropic称”“报告指称”等限定表达;不得传播个人隐私、账号凭证或可复现攻击的操作细节,更不能借热点制造谣言、煽动对立或实施商业诋毁。
这起事件最值得关注的并非某一家企业受到指控,而是前沿模型的公开服务接口已经可能成为能力外流、数据转移和供应链风险的共同入口。
总结
Anthropic披露的近2亿次相关交互,为模型安全提出了一个具体问题:当模型的核心价值不仅存在于参数中,也持续体现在每一次回答里,传统的账号封禁和访问控制已经不够。模型厂商需要发展面向行为的反蒸馏检测,平台需要提高路由透明度,企业用户则应把外部模型调用纳入数据安全和供应商审查体系。
与此同时,公开信息目前主要来自Anthropic及媒体对其报告的转述。是否确实构成侵权、相关输出如何被使用,以及归因是否完整准确,仍需更多当事方回应和独立证据。保持事实边界、避免标签化判断,既符合网络信息发布底线,也是讨论人工智能安全事件时应有的专业态度。
事件或资料日期:2026年9月10日。Anthropic于当日发布《Detecting and countering misuse of AI: September 2026》;TechCrunch于当日发布交叉核验报道。资料检索时间:2026年9月14日。