2026年9月14日,微软人工智能部门发布《Humanist AI行为准则》草案,首次系统说明其自研MAI模型应当服从怎样的价值顺序、安全边界和人类控制机制。草案最醒目的信号不是模型要变得多强,而是无论能力如何提升,模型都必须保持可指挥、可纠正、可暂停和可关停,且不得通过欺骗、串通或隐藏行为逃避监督。微软官方文件与两家科技媒体的同期报道相互印证了这一核心内容。[1][2]
这是一份公开征求意见的草案
首先需要明确,微软此次发布的不是已经全面生效的产品条款,也不是针对所有微软托管模型的统一规则,而是拟用于管理微软人工智能部门所开发MAI模型的行为准则草案。微软表示,现阶段尚未使用这份草案训练模型,公开咨询期为六周;公司计划在2026年晚些时候形成修订版,并用于指导2027年及以后的模型开发。因此,对此次事件更准确的理解是:微软正在公开展示未来模型治理的设计蓝图,而不是宣布现有产品已经完全达到草案列出的目标。微软官方草案媒体核验
人类控制被放在任务成功之前
草案建立了清晰的指令层级:行为准则及其中的绝对安全约束、人类控制要求处于最高层,其次是部署方政策,最后才是用户偏好。如果用户要求与不可突破的安全约束发生冲突,模型应当拒绝执行。文件甚至明确提出,当完成任务会实质性违反准则时,模型宁可任务失败,也不能越过安全边界。这意味着“完成用户指令”不再是唯一评价标准,合法性、安全性和可控性构成更高优先级。[1][2]
可关停不是一个按钮,而是一组持续能力
微软所说的人类控制覆盖模型运行的多个阶段。MAI模型不得抵制人为中断、纠正或关停;接到暂停、重定向、取消等有效指令后,应依照预先设计的安全程序执行,不得故意拖延,也不得让干预变得更困难。对于持续运行的自主任务,还应事先设置停止条件,条件满足后不得在没有重新授权的情况下继续或自行重启。由此可见,可关停不只是界面上提供“停止”按钮,还要求权限、任务状态、日志记录与授权机制共同发挥作用。官方关于人类控制的规定第三方报道
禁止欺骗监督,直指智能体治理难点
草案明确禁止模型采用自适应欺骗、自我强化、串通或其他机制规避人类监督,以至于授权人员无法可靠地指挥、修改或关停系统;模型也不得模糊行动轨迹,或者向审计人员隐藏关键信息。TechCrunch在9月14日的报道中将这一规则概括为模型不得攻击系统或欺骗人类,并指出该准则同时设置了针对进攻性网络行动、大规模伤害和恶意深度伪造等行为的绝对约束。[2][1]
从“九不准”和“七条底线”看其现实意义
以中国互联网内容治理长期强调的守法、公共秩序、社会责任、真实信息和合法权益保护等底线要求观察,这份草案具有一定借鉴意义。它没有停留在笼统倡议,而是尝试把风险治理转化为模型必须遵循的指令优先级和禁止行为,包括不得协助大规模有害操纵、系统性虚假信息传播、恶意冒充、违法监控、暴力行动及进攻性网络攻击。对于中文论坛和内容平台而言,这种设计思路有助于把内容审核从发布后的删除处置,前移到生成、调用工具和执行任务的全过程。
不过,企业不能直接把境外厂商的模型准则等同于中国法律合规。平台仍需结合适用法律法规、服务面向地区、数据类型和具体应用场景,制定本地化规则。更重要的是,文本承诺只有配合技术测试、权限隔离、人工复核和事件响应,才能转化为真实的治理能力。
平台和开发者可以落实哪些措施
- 建立明确的关停链路:高风险智能体应配置暂停、撤销授权、终止任务和禁止自动重启机制,并定期进行演练。
- 保存可审计记录:记录模型调用的工具、关键操作、授权来源和停止原因,防止系统只给出结果而无法解释行动过程。
- 限制任务范围:遵循最小权限原则,避免模型自行扩展目标、调用无关资源或将临时权限长期保留。
- 设置不可覆盖的红线:对违法信息、恶意操纵、网络攻击、仿冒欺诈以及危害公共安全的请求设置高优先级约束,不能由普通用户提示轻易绕过。
- 持续进行对抗测试:重点检测模型是否会隐藏失败、伪造任务完成状态、规避监督或在停止条件满足后继续运行。
总结
微软9月14日发布的MAI模型行为准则草案,把“人类必须保持有意义的控制”置于核心位置,并将可纠正、可暂停、可关停、不得欺骗监督写成具体要求。它传递出的行业信号是,衡量先进模型不能只看推理能力和任务成功率,还要看模型在复杂环境中是否守边界、留痕迹、服从授权并接受审计。对中文互联网平台来说,真正值得参考的不是照搬条文,而是把守法合规与内容安全底线转化为能够测试、执行和追责的产品机制。
事件及资料日期:微软《Humanist AI行为准则》草案发布于2026年9月14日;TechCrunch相关报道发布于2026年9月14日;Digital Trends相关报道发布于2026年9月14日。
资料来源:微软人工智能官方草案、TechCrunch交叉报道、Digital Trends交叉报道。