当“红队测试”从模型发布前的外部抽测,进一步进入训练、决策与部署现场,人工智能安全评估就触及了更棘手的问题:评估者需要看到多少企业内部信息,才能作出可信判断?公众又应知道多少,才能监督高影响模型的风险?2026年9月18日,Anthropic宣布与埃森哲合作建立嵌入式评估团队,为讨论这一矛盾提供了新的现实案例。
从外部抽测走向“内部陪跑”
根据Anthropic于2026年9月18日发布的官方公告,此次合作由埃森哲旗下专业人工智能业务Faculty牵头,工作范围包括评估和红队测试模型、开展对齐评估以及检验模型安全防护措施。与通常在模型完成训练后进行的外部测试不同,嵌入式评估者将获得接近企业员工的访问条件,能够观察模型训练过程、了解影响开发和部署的内部决策,并直接与相关员工交流。
埃森哲同日发布的新闻稿也确认,评估团队将与Anthropic内部团队及安全合作伙伴共同工作。双方表示,各自预计在未来五年为相关能力建设投入至少10亿美元。这里需要注意,“预计投入”属于企业规划,并不等同于已经支出的金额,也不能直接证明评估机制已经成熟或有效。
这一模式的价值在于,它可能缩小“模型展示行为”与“真实开发过程”之间的信息差。传统外部评估往往面对已经封装好的模型,只能依据有限接口、测试样本和企业提供的说明作出判断。嵌入式评估则有机会核验安全承诺是否真正落实到训练流程、权限管理、部署门槛和事件响应机制之中。
独立性首先是制度问题
“进入企业内部”不必然等于“保持独立”。Anthropic明确表示,现阶段将直接资助埃森哲的评估工作,同时承认长期资金更适合来自共同资金池或政府支持。CNBC于2026年9月18日的报道进一步指出,该合作是非排他的,Anthropic还在与非营利评估机构METR等第三方沟通。
真正值得追问的不是评估者是否坐在企业办公室,而是谁决定测试范围、谁控制原始证据、谁审核最终报告,以及负面结论能否不受委托关系影响而公开。如果被评估企业既支付费用,又可以限制测试对象、否决报告措辞或延迟披露,那么“独立”就可能停留在组织名称上。
因此,嵌入式评估至少需要建立利益冲突申报、人员轮换、测试范围留痕、结论异议记录和不可干预条款。对严重安全缺陷,还应设置越级报告或向合格监管机构报告的渠道。评估者既不能成为企业宣传部门的延伸,也不应因追求曝光而泄露敏感技术细节。
企业机密不应成为风险披露的黑箱
前沿模型的训练方法、参数细节、数据治理流程和防护策略可能涉及商业秘密、网络安全与知识产权。完全公开不仅可能损害企业合法权益,还可能为绕过防护、复制漏洞或实施攻击提供便利。因此,公众知情权并不意味着公开训练系统的全部内部资料。
但“涉及机密”也不能成为拒绝披露所有风险信息的通用理由。较可行的办法是建立分层披露制度:向公众说明风险类别、评估方法、测试边界、问题严重程度及修复状态;向监管机构或具有保密义务的专业机构提供更完整的技术证据;对可能直接帮助攻击者复现漏洞的细节,则延迟披露或进行必要删减。
Anthropic在公告中坦言,目前尚无统一标准规定嵌入式评估者可以访问哪些信息,以及应如何报告发现。这一表态说明,新机制仍处于制度试验阶段。公众目前能确认的是合作框架和目标,而不能据此推断具体访问权限、报告频率、缺陷披露时限或评估结论已经确定。
用“九不准”和“七条底线”审视披露边界
以《互联网信息服务管理办法》相关禁止性要求和“七条底线”所体现的底线治理思路来看,前沿模型评估不能只关注抽象的技术能力,还应覆盖违法有害信息生成、虚假信息扩散、公共秩序干扰、个人权益侵害、数据与网络安全等具体场景。评估报告也必须坚持事实准确,避免夸大风险、虚构测试结果或以未经核验的猜测制造恐慌。
对面向中文互联网的信息服务而言,可以将治理要求转化为一套更可执行的检查清单:
- 真实性:公开结论是否能够追溯到测试记录,是否区分事实、推测和情景假设。
- 合法性:测试是否覆盖违法有害内容传播、隐私侵害、网络攻击辅助等风险。
- 可问责性:发现问题后由谁整改,谁验证修复,重大事件由谁对外说明。
- 必要保密:删减内容是否确有安全或商业秘密依据,而不是笼统标注“敏感”。
- 公众可理解:报告是否以清晰语言说明风险影响,而非只提供难以复核的综合评分。
红队测试需要可验证的“最小公开集”
要同时保护企业机密与公众知情权,可以要求嵌入式评估至少公开一套“最小信息集”:评估机构及其资金关系、参与人员的利益冲突情况、测试覆盖的能力与风险类别、限制条件、重大问题数量区间、风险等级、整改状态、复测结果以及未解决事项。敏感攻击步骤可以不公开,但不应隐藏缺陷是否存在及其可能影响。
此外,公开报告最好由评估方与被评估企业分别签署。若双方对风险等级或披露范围存在分歧,应保留异议摘要,而不是通过协商形成一份看似一致、实际删除争议的文本。只有让公众看到“哪些问题已达成共识、哪些问题仍有争议”,独立评估才具有监督价值。
监管层面则可探索保密审查、分级报送和重大事件强制报告机制。普通商业缺陷可以由企业整改,可能影响公共安全或造成大范围权益损害的问题,则应进入更严格的核验程序。这样既避免把核心技术细节直接暴露在公开网络,也防止企业以商业秘密为由长期封存重大风险。
总结
Anthropic引入嵌入式独立评估,代表前沿模型安全治理从“发布后检测”向“开发过程监督”迈出一步,但它仍不是独立性的自动证明。评估者越接近企业内部,就越需要清晰的资金隔离、证据保存、异议披露和外部问责规则。
平衡企业机密与公众知情权的关键,不是简单选择“全部公开”或“全部保密”,而是建立可验证、分层次、有追责路径的披露制度。企业可以保护真正敏感的技术细节,但应公开风险性质、评估边界、整改状态和利益关系。只有当红队测试结果能够被适度核验、重大风险能够越级报告、公众能够获得必要事实时,嵌入式评估才可能从企业自律安排成长为可信的公共安全机制。
事件及资料日期:Anthropic与埃森哲的合作公告均发布于2026年9月18日;TechCrunch和CNBC的相关报道发布于2026年9月18日。资料来源包括Anthropic官方公告、埃森哲官方新闻稿、TechCrunch报道及CNBC报道。