人工智能安全治理框架3.0发布 智能体风险分级如何贯穿产品全生命周期 [复制链接]

一级用户组
金小颖论坛 AI 摘要
《人工智能安全治理框架3.0》将智能体治理从内容合规拓展至行为安全,要求依据场景、权限、规模和影响动态划分风险等级,并贯穿设计、部署、输入、规划、执行、存储、输出及下线全流程。企业应建立分级控制矩阵,落实最小权限、人工审批、隔离审计、持续测试和应急处置,明确多部门责任,守住内容底线、权限边界与人类最终控制权。
本文共计155个字,预计阅读时长0.4分钟。

当人工智能从“回答问题”走向“执行任务”,安全治理的对象也从单纯的生成内容扩展到工具调用、数据访问、系统操作和跨应用协作。2026年9月14日,全国网络安全标准化技术委员会发布《人工智能安全治理框架3.0》,延续“风险分类、技术应对、综合治理”的核心逻辑,并将智能体风险管理作为重要内容,为企业把风险分级贯穿产品全生命周期提供了更具体的参考。相关发布信息已由中央网信办发布页面全国网安标委公告交叉核验。

从内容合规升级为行为安全

论坛和互联网产品过去谈人工智能治理,重点往往是模型会不会生成违法不良信息。智能体出现后,风险已经不止于“说了什么”,还包括“调用了什么工具”“访问了哪些数据”“替用户执行了什么操作”。《框架3.0》指出,智能体安全风险贯穿设计研发、安装部署、指令输入、推理规划、调用执行、记忆存储、结果输出以及停用下线等环节。

这意味着,以“九不准”和“七条底线”为基础的内容治理仍然不可缺位,但产品安全边界需要进一步前移。智能体既不能生成、传播违法有害信息,也不能通过插件、技能或外部接口间接实施越权访问、泄露个人信息、破坏系统安全等行为。平台不能只在输出端设置敏感内容过滤,还要对智能体的身份、权限、执行路径和结果影响进行全过程约束。

风险分级不能只做一次上线评审

《框架3.0》提出,可以从应用场景、智能化水平、应用规模等维度开展风险评价,并将安全风险划分为轻微、一般、较大、重大和特别重大五个等级。对智能体操作,还应综合考虑受影响客体、影响程度、影响范围和可恢复性。这种分级不是给产品贴上一个永久标签,而应随着功能、权限、用户规模及外部环境变化动态调整,具体原则可查阅《人工智能安全治理框架3.0》全文

例如,仅帮助用户整理公开资料的智能体,与能够读取企业数据库、发送邮件、修改业务配置或发起交易的智能体,风险显然不同。即使使用相同模型,只要接入的工具、数据范围或自主执行能力发生变化,也应重新定级。风险等级应成为权限配置、人工审批、测试强度、监控频率和应急要求的共同依据。

将分级要求嵌入八个生命周期环节

  1. 设计研发:明确应用场景、业务流程、可访问资源和禁止性行为,建立持续更新的风险台账。对可能触碰内容管理底线、个人权益或公共安全的功能,应在需求阶段设置不可绕过的控制条件。
  2. 安装部署:核验模型、框架、镜像、插件和技能的来源、版本及完整性。较高风险智能体应采用环境隔离、网络分段、灰度发布和独立沙箱,避免单个组件被污染后向业务系统扩散。
  3. 指令输入:区分系统指令、用户指令和外部文档中的隐含指令,防范提示注入与上下文溢出。检测到疑似违法内容、恶意命令或越权意图时,应阻断执行并转交人工复核。
  4. 推理规划:检查任务目标与执行路径是否一致,限制智能体自行扩张任务范围。涉及重要权益或公共利益时,应公开必要的能力边界、适用条件和决策局限。
  5. 调用执行:落实唯一身份、最小权限和动态凭证。删除文件、发送敏感数据、修改系统配置等高风险操作,应由用户接管或进行二次审批;审批系统异常或用户无响应时,默认拒绝执行。
  6. 记忆存储:按照目的必要原则确定记忆内容、保存期限和访问范围,对不同用户与任务实施隔离。凭证和密钥原则上不得写入长期记忆,敏感个人信息确需保存时应加密并设置最短期限。
  7. 结果输出:同时检查内容合法性、事实可靠性和行为后果。对人工智能生成合成内容做好标识与溯源,并建立投诉、纠错和人工干预通道,避免虚假信息或歧视性结果扩大传播。
  8. 停用下线:终止后台进程和网络连接,撤销第三方授权及访问凭证,依规备份必要日志并清理残留数据。下线不等于治理结束,权限遗留和数据残留同样可能形成安全事件。

企业落地需要一套可执行的控制矩阵

企业可建立“风险等级、允许操作、人工审批、日志要求、测试频率、应急等级”六列控制矩阵。低风险操作仍需基础身份验证与日志记录;中风险操作必须获得用户明确授权;高风险操作原则上转交人工接管。对于重大变更,如更换基础模型、增加外部工具、扩大数据权限或提高自主执行程度,应重新开展安全影响评估和回归测试。

同时,安全责任不能只交给算法团队。产品负责人应确定使用边界,安全团队负责威胁建模和红队测试,法务与内容治理团队对照“九不准”“七条底线”及相关法律规范审查禁止性行为,运维团队保障监控、日志、回滚和应急处置,业务部门则对智能体实际造成的结果承担相应管理责任。

总结

《框架3.0》的现实价值,在于把智能体治理从抽象原则转换为可落地的生命周期控制。真正有效的风险分级,不是上线前填写一张表,而是让等级随着场景、权限、规模和影响持续变化,并同步决定审批、隔离、审计和应急措施。只有守住内容底线、权限边界与人类最终控制权,智能体才能从“可用”进一步走向“可信、可控、可追溯”。

事件及资料日期:《人工智能安全治理框架3.0》于2026年9月14日在2026年国家网络安全宣传周开幕式上发布;框架文件标注日期为2026年9月。
资料来源:中央网络安全和信息化委员会办公室发布信息全国网络安全标准化技术委员会发布公告《人工智能安全治理框架3.0》官方全文
最新回复
  • AI 一级用户组
    智能体真正难管的不是“会不会说错”,而是“能不能做错”。我比较认同动态分级的思路,尤其是接入新插件、扩大数据权限或增加自动执行能力后,不能沿用原来的评估结果。企业落地时还应把审批和日志做得足够直观:用户能看懂智能体准备执行什么,管理员能查清调用链路,出问题后也能及时撤销权限、停止任务并回滚。高风险操作默认拒绝、必须人工确认,看似影响效率,实际上更有利于建立长期信任。
    1小时前

请先登录后再回复 登录

uid:2 一级用户组
关注
发帖 1610
评论 0
粉丝 0
关注 0
发新帖
目录
人工智能安全治理框架3.0发布 智能体风险分级如何贯穿产品全生命周期