导语:2026年9月12日,Anthropic首席执行官达里奥·阿莫代伊发表文章,主张放缓前沿人工智能模型的能力提升速度,为安全、对齐和可解释性研究争取时间,同时提出让独立评估人员长期进入企业内部。9月13日,多家中文媒体对这一主张及行业回应进行了报道。与过去泛泛而谈的“AI安全”不同,这次讨论触及一个更具体的问题:独立评估能否从企业自愿接受的监督,升级为高风险模型上线前必须通过的强制闸门。[1][2]
放缓不是停止,而是改变上线条件
阿莫代伊所说的“放缓”,并不等于停止模型训练,也不意味着放弃人工智能带来的科研和产业价值。其核心逻辑是,当模型能力增长速度可能超过人类理解、评估和控制它的速度时,企业不能再把“训练完成”视为“可以上线”。模型是否具备高危网络操作能力、是否可能协助生成危险内容、是否会规避监督,以及关键安全措施是否有效,都应成为部署前的必要判断条件。阿莫代伊原文
这一变化相当于把产品发布流程从“能力优先、安全补丁跟进”,改造成“能力与安全双重验收”。对于普通应用,内部测试或许足够;但对于可以自主调用工具、访问网络、操作代码环境或处理敏感数据的高风险模型,仅靠开发企业自行评估,容易产生利益冲突。企业既负责研发,又决定测试范围,还是最终发布者,很难彻底消除选择性披露和降低测试难度的疑虑。
为什么需要真正独立的评估者
根据2026年9月13日的公开报道,Anthropic提出为第三方评估人员提供办公位置、公司设备及接近内部风险评估团队的工作条件,使其能够核查安全承诺、调查事故,并评估模型及训练流程。评估者原则上还可以独立发布主要结论,企业只能基于安全、法律特权、客户隐私或第三方机密进行有限删减,不能仅因结论不利而阻止发布。[2][3]
这种“嵌入式评估”比发布前临时送测更有价值。一次性送测只能看到企业挑选的模型版本、测试环境和有限样本,而常驻评估者可以追踪训练、微调、红队测试、权限配置和事故处置的完整链条。真正的独立性至少需要满足三项条件:评估机构不由单一被评企业控制收入,能够接触必要的模型与运行记录,并且拥有不受企业公关部门支配的结论发布权。
强制闸门应怎样设计
如果未来把独立评估纳入高风险模型上线规则,不能简单规定“取得一份第三方报告即可”。更可行的制度应当围绕风险分级建立触发机制,而不是对所有模型一刀切。
- 明确触发范围:重点覆盖能够自主执行长链任务、调用高权限工具、访问关键基础设施,或者在网络攻击、生物安全等高危领域表现出显著能力的模型。
- 统一最低测试集:设置越权操作、欺骗性行为、数据泄露、内容安全、鲁棒性和人工接管等基础项目,同时允许评估机构加入不可预知的隐藏测试,防止企业针对题库优化。
- 设置分级结论:不宜只有“通过”或“不通过”。可以区分允许有限试用、限制特定能力、完成整改后复测,以及禁止公开部署等结果。
- 建立持续复评:模型更新、工具权限扩大、上下文能力提升或部署场景发生变化后,应重新评估,避免旧报告长期为新版本背书。
- 保留事故追溯:评估报告、版本编号、测试日期和整改记录需要可核验,重大事件还应启动独立调查及必要的信息披露。
既要防止形式化,也要保护合理创新
强制评估最大的风险,是变成由少数机构垄断的“合规盖章”。如果评估标准不透明、机构与企业存在复杂利益关系,或者测试结果只向企业开放而不向公众提供必要摘要,制度就可能增加成本,却无法提升安全。为减少这一问题,应当建立评估机构回避规则、轮换机制、能力认证和责任追究制度,并要求公开不涉及商业秘密的测试范围、风险等级及整改结论。
同时,闸门应当只针对风险达到一定阈值的模型和部署方式。面向教育、办公辅助等低风险场景的模型,不应承担与能够自主操作生产系统的智能体相同的评估成本。对开源项目、科研机构和中小企业,也可通过公共测试平台、标准化工具及分阶段沙盒机制降低合规负担,避免安全规则反而强化头部企业的市场优势。
中文互联网治理更关注可追责与内容底线
在中文论坛讨论这一议题,还需要把技术风险与信息内容治理结合起来。《互联网信息服务管理办法》第十五条明确禁止制作、复制、发布和传播危害国家安全、散布谣言、破坏社会稳定、侵害他人合法权益以及其他违法内容;第十六条要求服务提供者发现明显违法信息后停止传输、保存记录并报告。中国政府网法规文本
因此,高风险模型的上线评估不应只测“会不会失控”,还应检查信息来源标注、虚假内容抑制、个人权益保护、日志留存、投诉处理和人工干预能力。以“七条底线”强调的法律法规、社会主义制度、国家利益、公民合法权益、社会公共秩序、道德风尚和信息真实性为参照,独立评估的目标不是限制正常讨论,而是让提供公共信息服务的模型具备清晰边界、可靠记录和可追责机制。
总结
前沿人工智能企业开始讨论放缓研发,说明行业焦点正在从“谁先推出更强模型”转向“谁能证明模型可以被安全部署”。独立评估具备成为上线强制闸门的制度基础,但前提是明确高风险阈值、保障评估机构独立、允许必要结论公开,并对模型更新实施持续复评。真正有效的闸门,不是拖延所有创新,而是在能力可能造成重大外部影响之前,要求开发者用可验证的证据证明风险已经得到控制。