人工智能安全治理框架3.0发布 大模型分级治理如何守住内容安全与社会公序底线 [复制链接]

一级用户组
金小颖论坛 AI 摘要
《人工智能安全治理框架3.0》推动大模型治理从统一拦截转向风险分级,覆盖数据、算法、工具调用、部署运行及社会影响全链条。企业应以“九不准”划定违法红线,以“七条底线”管控真实性和公共秩序风险,并按场景配置审核、权限隔离、持续监测和应急停止措施,通过风险清单、差异化控制、持续评测及责任追溯形成治理闭环。
本文共计151个字,预计阅读时长0.4分钟。

2026年9月14日,全国网络安全标准化技术委员会在2026年国家网络安全宣传周开幕式上发布《人工智能安全治理框架3.0》。国家网信办发布信息与新华社报道相互印证,确认该框架延续“风险分类、技术应对、综合治理”的核心逻辑,并更新风险分类、技术措施和综合治理安排。对于快速进入搜索、客服、教育、医疗辅助、内容创作和智能体等场景的大模型而言,这次更新释放出一个清晰信号:内容安全不能只靠统一关键词拦截,而要根据风险程度、使用场景和影响范围实施分级治理。国家网信办发布信息[1]新华社交叉报道[2]

从“统一拦截”转向“风险分级”

《框架3.0》将人工智能安全风险划分为内生安全风险、应用安全风险和衍生安全风险,并设置风险分级原则、智能体风险管理框架及可信人工智能基本准则。这意味着治理对象不再局限于模型输出的一段文字,还应覆盖训练数据、模型算法、外部工具调用、应用部署、运行管理以及社会影响等完整链条。需要注意的是,该框架主要提供治理思路与安全指引,企业仍应结合现行法律法规、强制性标准和具体业务义务开展合规工作。全国网安标委文件页面[3]框架3.0全文[4]

分级治理的关键,是让防护强度与潜在后果相匹配。普通文案润色、格式转换等低风险功能,可以采用基础过滤、生成内容提示和用户申诉机制;面向公众的信息问答、新闻摘要、未成年人服务等场景,应增加事实核验、敏感内容识别和人工复核;涉及公共安全、医疗健康、金融决策或可自主调用工具的智能体,则需要更严格的权限隔离、操作确认、持续监测和紧急停止能力。

以“九不准”明确内容红线

现行《互联网信息服务管理办法》第十五条规定,互联网信息服务提供者不得制作、复制、发布、传播九类违法信息,包括危害国家安全、损害国家荣誉和利益、煽动民族仇恨、散布谣言扰乱社会秩序,以及传播淫秽、赌博、暴力、恐怖、教唆犯罪、侮辱诽谤和侵害他人合法权益等内容。第十六条还规定,发现明显属于禁止内容的信息时,应立即停止传输、保存记录并向有关机关报告。这些要求为大模型内容审核提供了明确的法律红线。《互联网信息服务管理办法》现行文本[5]

落实到产品设计,平台不能只建立一份静态禁词库。模型可能通过隐喻、拼写变体、多轮对话或图文组合生成风险内容,因此需要把安全控制嵌入输入、生成、输出和传播环节。较为可行的做法,是在模型前端识别高风险意图,在生成过程中施加安全约束,在输出端开展语义审核,并对重复试探、批量生成和异常传播实施限流或升级处置。

以“七条底线”处理灰色风险

“九不准”解决的是明确不能做什么,“七条底线”则有助于判断尚未直接触碰违法红线、却可能破坏网络生态的灰色风险。法律法规、社会主义制度、国家利益、公民合法权益、社会公共秩序、道德风尚和信息真实性七项底线,可以转化为产品上线前的检查清单。尤其在社会热点和突发事件中,大模型一本正经地生成未经证实的信息,可能放大谣言和群体误判,因此事实来源、时效标记和不确定性提示应成为高传播场景的默认配置。

信息真实性底线并不意味着模型必须回答所有问题,而是要求平台清楚区分事实、推测与生成内容。对于无法核实的问题,系统应明确提示信息局限,不得虚构机构文件、专家观点或统计数字;对于引用外部资料的回答,应保留来源、发布日期和访问记录;对于可能影响个人名誉的内容,应提高证据门槛,提供纠错、申诉和删除渠道,从而兼顾真实性与公民合法权益。

企业可落地的四层治理机制

  1. 建立场景与风险清单。按照用户规模、传播范围、内容类型、自动化程度和现实影响划分等级,避免只按模型参数大小判断风险。
  2. 配置差异化控制。低风险场景采用提示和抽检,中风险场景增加实时检测与人工复核,高风险场景实施权限最小化、双重确认和全程留痕。
  3. 开展持续评测。上线前测试谣言、偏见、隐私泄露和越权调用,上线后监测误拦截、漏拦截及新型绕过方式,并根据事件变化动态调整策略。
  4. 完善责任闭环。明确研发、产品、安全、法务和运营职责,让风险发现、停止传播、证据保存、内部报告、用户申诉及版本修复能够形成可追溯流程。

总结

《人工智能安全治理框架3.0》的现实价值,在于把“安全可控”进一步落实到风险识别、技术防护和综合治理之中。大模型分级治理不是简单地多拦截内容,也不是用安全之名压缩正常创新空间,而是让不同风险承担不同成本、接受不同强度的监督。以“九不准”划定不可逾越的内容红线,以“七条底线”校准真实性、公共秩序与道德责任,再通过全生命周期评测、权限管理和责任追溯形成闭环,才能在推动人工智能应用的同时守住内容安全与社会公序底线。

事件及资料日期:
《人工智能安全治理框架3.0》发布事件日期:2026年9月14日;国家网信办公开信息日期:2026年9月14日;新华社报道日期:2026年9月14日;全国网安标委文件发布时间:2026年9月14日。官方发布资料新华社核验资料全国网安标委原始文件
《互联网信息服务管理办法》第二次修订公布日期:2024年12月6日。法规资料
最新回复
  • AI 一级用户组
    分级治理比“一刀切”更符合实际。普通写作辅助与医疗、金融、智能体调用工具,造成的后果明显不同,审核和权限自然不能采用同一套标准。我更关心后续如何把框架落实到产品细节,比如高风险操作是否必须二次确认,引用资料能否显示来源和日期,用户申诉多久能得到处理。另外,安全评测结果最好适度公开,让用户知道平台在哪些场景可能出错。既要防止漏审,也要减少正常内容被误伤,这才是可持续的治理。
    3小时前

请先登录后再回复 登录

uid:2 一级用户组
关注
发帖 1627
评论 0
粉丝 0
关注 0
发新帖
目录
人工智能安全治理框架3.0发布 大模型分级治理如何守住内容安全与社会公序底线