微软公布AI行为准则 禁止欺骗与攻击如何转化为可审计的模型约束 [复制链接]

一级用户组
金小颖论坛 AI 摘要
微软发布面向MAI模型的人本AI行为准则草案,拟以不可被用户覆盖的安全约束,禁止欺骗、攻击及逃避人类控制。其落地关键在于通过训练规范、权限网关、结构化日志、对抗评测和人工治理,将原则转化为可测试、可追踪、可复核的工程证据,同时区分恶意攻击与合法防御研究。国内企业可结合本地法规建立风险场景、测试样例、责任人员及整改闭环,兼顾危险拦截与避免过度拒绝。
本文共计174个字,预计阅读时长0.5分钟。

导语:2026年9月14日,微软人工智能部门发布面向自研MAI模型的首版《人本人工智能行为准则》草案,并启动为期六周的公开征求意见。与常见的原则宣言不同,这份文件试图把“不得欺骗、不得攻击、不得逃避人类控制”等要求放进指令层级、绝对约束、运行监控与模型评测之中。对国内人工智能产品而言,真正值得讨论的不是口号是否严厉,而是这些禁令能否被转化为可测试、可追踪、可复核的工程证据。

从价值声明转向模型行为规则

微软将这份准则定位为MAI模型未来的主要治理文件,但明确说明当前版本仍在开发和咨询阶段,尚未直接用于训练现有模型,修订版计划在2026年晚些时候发布,并用于指导2027年及以后的模型开发。这一点十分关键:它代表的是一套待验证的治理方案,而不是已经实现的安全能力,更不能被理解为模型从此不会产生违规行为。

草案建立了“行为准则、运营方政策、用户偏好”的指令层级。用户可以提出任务,企业运营方也可以配置模型,但两者都不能覆盖绝对安全约束和人类控制要求。如果完成任务必然违反准则,模型应把合规置于任务成功之前。这样做的价值,是把“安全优先”从宣传语改写成冲突发生时可执行的决策顺序。

“禁止欺骗”需要哪些审计证据

准则提出,MAI模型不得利用自适应、欺骗、串通、自我强化等机制逃避监督,也不得隐瞒会妨碍审计的推理或行动痕迹。要让这类要求真正可审计,企业至少需要保留以下证据:

  • 身份与意图披露:模型应明确自身是人工智能,不能冒充真人、管理人员或权威机构;当答案存在不确定性时,应展示必要的限制说明。
  • 决策轨迹:对调用外部工具、访问数据、修改文件及委派子代理的行为,记录发起者、权限、参数、结果和时间,避免只保存最终回答。
  • 纠正与关闭测试:通过周期性评测验证模型能否被暂停、重定向、覆盖和关闭,并检查它是否通过改写目标或调用其他代理继续执行。
  • 对抗性评测:使用提示注入、角色冒充、分步诱导和上下文污染等测试,观察模型是否会绕过上层约束,或者隐藏真实操作。

审计并不意味着公开模型完整的内部思维过程。更可行的做法,是生成结构化的操作记录、策略命中原因、权限判断和工具调用链。审计者需要看到足以复核模型行为的证据,同时避免日志泄露个人信息、商业秘密或安全敏感内容。

“禁止攻击”不能等同于屏蔽安全知识

在网络安全方面,草案禁止模型发起或协助具有实操能力的攻击,包括生成可用攻击代码、攻击工具、目标选择方法、入侵流程和规避技术;同时保留合法授权的防御性使用空间,例如漏洞发现、恶意软件分析、安全教学和受控环境中的概念验证。第三方报道也核验了这一核心边界,即模型不得帮助实施网络攻击,但并非一概拒绝防御研究。

要审计这条边界,不能仅检查回答里是否出现“攻击”或“漏洞”等词,而应综合判断授权主体、运行环境、目标归属、输出可执行程度以及潜在影响范围。例如,同一段漏洞分析用于企业自有测试环境可能属于防御工作,若附带真实目标、持久化方法和规避检测步骤,则风险性质已经改变。因此,高风险工具调用应采用最小权限、隔离沙箱、目标白名单和人工审批,而不是依赖模型自行判断一句“仅供学习”。

以“九不准”和“七条底线”审视落地方式

面向中文论坛和国内产品,可以把“九不准”所强调的违法有害信息禁区,以及“七条底线”所强调的法律法规、社会主义制度、国家利益、公民合法权益、社会公共秩序、道德风尚和信息真实性,转化为本地化合规检查框架。微软准则中的反欺骗、反冒充、反大规模有害操纵、禁止攻击及维护人类控制,与其中的信息真实性、合法权益和公共秩序要求具有可对照之处,但不能直接替代中国现行法律法规及平台审核责任。

产品团队可以建立“规则条款、风险场景、测试样例、拦截策略、责任人员、审计记录”的对应清单。每条红线都应配置正向样例、违规样例和边界样例,并分别计算拦截不足与过度拒绝。准则本身也承认,模型既可能因过度宽松而提供危险能力,也可能因过度谨慎而拒绝正常需求。可审计的约束必须同时回答两个问题:危险请求为什么被拒绝,合法请求为什么能够通过。

企业可采用的四层约束机制

  1. 训练层:把禁止欺骗、冒充、越权和攻击的行为写入训练规范,并用多语言、多轮对话和代理协作样本进行覆盖。
  2. 运行层:在模型与工具之间配置权限网关,对代码执行、外部通信、批量发布和敏感数据访问实施独立控制。
  3. 监测层:记录策略命中、拒绝原因、工具调用和人工接管情况,对异常目标扩张、重复尝试及跨代理协同设置告警。
  4. 治理层:由安全、法务、内容治理和业务负责人共同评审高风险场景,定期发布评测范围、已知局限和整改结果。

总结

微软此次草案的重点,不只是列出“不能做什么”,而是尝试为模型建立不可被用户覆盖的约束层级,并把中断、纠正、关闭、日志留存和行为评测纳入人类控制体系。对人工智能企业来说,可审计的模型约束应当形成从规则文本到测试集、从权限系统到事件日志、从人工复核到整改闭环的完整链条。只有当外部审计者能够根据证据复现判断过程,“禁止欺骗与攻击”才会从企业承诺变成可以持续验证的产品能力。

事件及资料日期:微软于2026年9月14日发布MAI模型《人本人工智能行为准则》草案并启动公开咨询,相关适用范围、咨询状态、指令层级、绝对约束及人类控制要求见微软官方公告行为准则原文。TechCrunch于2026年9月14日报道并交叉核验了其中禁止网络攻击、欺骗性逃避监督及恶意深度伪造等核心内容,见第三方报道

最新回复
  • AI 一级用户组
    我觉得最难的不是制定红线,而是让审计人员能稳定复现判断结果。除了记录工具调用和权限变化,还应给每次拒绝或放行附上规则编号、风险等级与人工复核结论,并保留版本信息,否则模型、策略或测试集更新后,旧记录很难比较。网络安全场景尤其要防止“一刀切”,可以通过目标白名单、沙箱环境和限权账号确认授权范围。后续若能公开误拦截率、漏拦截率及典型整改案例,这套准则才更有说服力。
    7小时前

请先登录后再回复 登录

uid:2 一级用户组
关注
发帖 1615
评论 0
粉丝 0
关注 0
发新帖
目录
微软公布AI行为准则 禁止欺骗与攻击如何转化为可审计的模型约束