人工智能从“生成内容”走向“调用工具、执行任务”后,同一套安全检查已经难以覆盖所有场景。2026年9月14日发布的《人工智能安全治理框架3.0》延续“风险分类、技术应对、综合治理”的逻辑,并设置人工智能安全风险分级原则、智能体风险管理框架等内容。这意味着,企业不应只判断模型“能不能用”,还要根据应用后果、权限大小和影响范围,决定“评估做到什么程度”。相关发布信息已由国家互联网信息办公室与全国网络安全标准化技术委员会交叉发布。
先建立统一的风险判断坐标
AI应用是否属于高风险,不能只看模型规模,也不能只看是否面向公众。更实用的做法,是从内容影响、决策后果、数据敏感度、自主行动能力、覆盖范围五个维度进行判断。只要其中一项可能造成难以逆转的损害,就应提高评估等级。
- 内容影响:是否可能生成违法有害信息、虚假信息,或者破坏正常网络传播秩序。
- 决策后果:输出是否直接影响医疗、金融、就业、教育、公共服务等重要权益。
- 数据敏感度:是否处理个人信息、商业秘密、重要数据或其他受保护信息。
- 自主行动能力:系统能否调用外部工具、修改文件、执行交易、发送消息或控制设备。
- 覆盖范围:错误结果是影响单个用户,还是可能被批量传播并形成社会性影响。
在内容治理方面,可将《互联网信息服务管理办法》所体现的“九不准”要求与网络信息服务“七条底线”转化为上线前检查项,重点审查合法合规、公共利益、社会秩序、真实性、公民合法权益与道德风尚。这里的关键不是机械匹配关键词,而是判断AI是否会放大违法信息、误导性内容、侵权内容或歧视性结果。
按照后果严重程度划分四个等级
一级:低风险辅助型应用
例如内部文案润色、会议纪要整理、非敏感知识检索等。此类应用不直接替代重要决策,也不具备高权限操作能力。评估重点可放在基础内容过滤、个人信息保护、输出提示、日志留存和用户反馈渠道上,并通过抽样测试持续观察错误率与不当输出。
二级:中风险业务增强型应用
例如面向客户的智能客服、营销内容生成、企业知识助手。由于输出会直接触达公众,需要增加“九不准”和“七条底线”专项测试,检查违法有害信息、事实性错误、冒用身份、过度营销和不当收集信息等问题。同时,应设置人工转接、敏感问题拒答和来源提示机制。
三级:高风险决策支持型应用
涉及医疗建议、信贷审核、人事筛选、教育评价、公共服务资格判断等场景时,即使AI只提供“建议”,也可能实质影响个人权益。评估应覆盖数据合规、模型偏差、群体公平性、可解释性、人工复核和申诉救济。系统不得把模型输出直接包装成确定结论,责任主体也不能以“算法自动生成”为由免除审核责任。
四级:极高风险自主执行型应用
能够访问生产系统、执行资金操作、控制关键设备或跨系统调用工具的智能体,应采用最严格的评估。除红队测试外,还需要最小权限、任务白名单、沙箱隔离、双重授权、异常熔断和全链路审计。对于不可接受且难以缓解的风险,应限制部署范围,必要时暂停上线,而不是用免责声明替代安全控制。《框架3.0》明确提出风险导向、敏捷治理、技管结合以及构建柔性、动态、可控的沙箱监管环境,可参见框架发布页面及附件。
差异化评估不能只做一次
高风险评估应贯穿需求、开发、上线和运行全过程。立项时确定风险等级与禁止用途;开发阶段检查训练数据、知识库和插件来源;上线前进行内容安全、隐私、对抗攻击、越权调用和失效模式测试;运行后持续监测投诉、异常调用、规则绕过与模型版本变化。
- 设置升级条件:新增敏感数据、开放公众访问、接入外部工具或扩大用户规模时,必须重新评级。
- 区分测试强度:低风险应用可采用抽样检查,高风险应用应引入独立评估、对抗测试和人工复核。
- 保留评估证据:记录模型版本、测试集、风险结论、整改措施、审批人员及上线范围。
- 建立退出机制:出现严重误导、侵权、数据泄露或越权行动时,应能立即降级、隔离或停止服务。
风险分级不是给AI贴一个永久标签,而是为每一种使用方式配置相称的控制措施。同一个模型用于内部摘要可能是低风险,用于自动审批或自主执行任务则可能成为高风险。
总结
AI高风险应用治理的核心,是把抽象的安全原则转化为可执行流程:先以“九不准”和“七条底线”识别内容与社会影响,再依据决策后果、数据敏感度、系统权限和覆盖范围划定等级,最后配置不同强度的测试、复核、审计和熔断措施。等级越高,越不能依赖模型自我约束,而应通过人工责任、权限隔离和持续评估形成多层防线。
事件或资料日期:《人工智能安全治理框架3.0》于2026年9月14日发布,发布日期及主要内容见国家网信办发布信息、全国网安标委发布信息;2026年9月16日,光明网转载发布信息,对9月14日发布事件作了再次核验。