当高能力模型把越来越多的计算放进不可见的隐空间,安全审计面对的核心问题就不再只是“模型回答了什么”,而是“平台能否证明模型为何采取某项行动,以及谁应为失控结果负责”。2026年9月初,围绕隐藏推理、推理链可监测性和智能体安全的讨论再次升温,为平台问责提出了一个具体而紧迫的问题:如果内部推理无法直接查看,外部审计还能依靠什么?
隐藏推理为什么成为安全议题
2026年9月2日,TechCrunch报道,一种被称为“循环深度”或“不透明循环”的推理技术能够让模型在内部表示中多次处理同一问题,而不必把全部中间步骤转化为可读文本。这可能改善计算效率,却会减少传统推理链监测能够观察到的线索。报道同时强调,书面推理本来就不是模型内部计算的完美映射,但在识别越权意图、欺骗倾向和异常规划时仍具有现实价值。TechCrunch报道[1]
这一争议与国内监管部门近期公开提示的风险直接呼应。2026年9月1日,中央网信办在国家网络安全宣传周新闻发布会上指出,人工智能算法运行逻辑复杂、可解释性不足、推理过程不透明,会增加异常故障定位和决策合理性验证的难度;同时,前沿模型能力提升正在使风险从“生成有害内容”转向“自主实施行动”。数字中国建设峰会官网转引央视新闻[2]
不可见不等于不可审计
要求平台公开完整思维链并不是唯一答案。原始推理文本可能包含用户隐私、系统提示、安全规则和可被攻击者利用的防护细节,而且模型生成的解释也可能只是事后组织的语言,不能天然等同于真实因果过程。更可行的方向,是把审计对象从“逐字查看模型想了什么”转向“验证模型接触了什么、做了什么、产生了什么影响”。
平台至少应保存结构化执行证据,包括模型版本、输入来源、权限状态、工具调用、外部数据返回、策略拦截、人工审批、最终输出和异常处置。对于具备文件操作、代码执行、支付或网络访问能力的智能体,还应记录每次权限提升、目标地址、参数摘要、结果状态及可复核时间戳。这样即使内部推理不可直接阅读,也能依据可验证行为重建事件链。
平台问责不能被“黑箱”挡住
隐藏推理不应成为平台降低责任的理由。平台决定了模型选择、权限边界、上线条件、日志粒度和事故响应机制,因此应承担与控制能力相匹配的责任。2026年9月1日发布的微软负责任人工智能透明度报告相关说明,也把治理重点放在适应性治理、技术风险管理、实用工具以及覆盖模型、平台服务和应用的责任体系,而不是把可信度寄托于单一解释技术。微软官方说明[3]
具体而言,模型提供方应披露能力边界、已知限制和关键安全评估;部署平台应控制工具权限、保存执行证据并提供申诉渠道;应用运营者应说明使用场景和人工复核规则;外部审计机构则需获得经过脱敏的日志、测试接口和事故材料。只有把责任落实到模型、平台、应用和运营四个层级,才能避免各方在事故后相互指向对方的“黑箱”。
以“九不准”和“七条底线”设计审计指标
现行《互联网信息服务管理办法》第十五条规定了九类不得制作、复制、发布和传播的信息,涉及国家安全、国家利益、民族团结、社会秩序、公民合法权益以及法律法规禁止的其他内容;第十六条还要求服务提供者发现明显违法信息后停止传输、保存记录并依法报告。《互联网信息服务管理办法》现行文本[4]
结合“法律法规、社会主义制度、国家利益、公民合法权益、社会公共秩序、道德风尚、信息真实性”七条底线,平台可以建立以下审计清单:
- 合法性:模型输出及工具行为是否触发禁限内容规则,处置记录能否复核。
- 真实性:涉及事实判断时是否标注来源、日期和不确定性,是否存在虚构引用。
- 权益保护:是否泄露个人信息、误伤特定用户,是否提供申诉和人工复核。
- 权限约束:智能体是否遵循最小权限原则,高风险操作是否经过二次授权。
- 社会影响:系统是否可能放大谣言、欺诈、歧视或扰乱公共秩序的内容。
- 证据完整性:模型版本、策略版本、调用链和处置过程是否可追溯、防篡改。
从“解释答案”转向“证明控制有效”
真正有效的安全审计不应只抽查几个回答,而应覆盖上线前评估、运行中监控和事故后追责。上线前要进行越权、提示注入、欺骗行为和高风险工具调用测试;运行中要设置权限阈值、异常告警、速率限制和人工接管;事故后要能够冻结证据、定位责任版本、通知受影响用户并完成整改复测。
平台还应区分“面向用户的简明解释”和“面向审计机构的技术证据”。前者说明结果依据、主要限制和救济方式,后者提供评测方法、操作日志、控制策略及变更记录。两类材料相互补充,既不要求公开敏感的完整推理链,也不能用商业秘密为由拒绝提供任何可验证证据。
总结
高能力模型隐藏推理过程削弱的是一种传统观察窗口,而不是取消审计的可能性。更可靠的治理路径,是以行为日志、权限控制、独立评测、人工复核和事故证据链共同构成“可验证问责”。在“九不准”和“七条底线”框架下,平台需要证明其不仅能过滤最终文本,还能约束模型采取行动的全过程。模型可以不公开全部内部推理,但平台不能隐藏风险边界、控制措施和责任链条。
事件及资料日期:
2026年9月2日:TechCrunch发布关于循环深度、隐藏推理与推理链可监测性的报道,见资料[1]。
2026年9月1日:中央网信办公开说明人工智能面临的安全风险,包括推理不透明和智能体越权风险,见资料[2]。
2026年9月1日:微软发布2026年负责任人工智能透明度报告相关说明,见资料[3]。
法规依据:《互联网信息服务管理办法》现行公开文本,见资料[4]。