当人工智能从“生成内容”走向自主调用工具、访问文件、连接数据库乃至控制机器人时,安全问题已不只是回答是否合规,而是智能体究竟能够做什么、可以访问哪里、越界后能否立即停止。2026年9月28日,英伟达发布开放式智能体安全平台,将策略执行放在智能体之外,并以软件沙箱和独立硬件监控构成双层防线,为这一问题提供了新的工程化思路。相关信息已由英伟达官方公告与澎湃新闻报道交叉核验。
策略边界不能只写在提示词里
传统智能体通常依靠系统提示、模型对齐和应用层权限判断约束行为,但这些措施容易受到指令歧义、提示注入、工具返回异常及长任务上下文漂移的影响。更关键的是,如果智能体既负责执行任务,又参与判断自己的行为是否合规,就可能形成“运动员兼裁判”的结构性风险。
开放式安全平台的核心变化,是把“应该怎么做”与“实际上允许做什么”分开。OpenShell在模型和智能体框架之外建立安全运行边界,对文件、网络、工具、进程和凭证等资源实施策略控制。无论使用开源模型还是闭源模型,智能体发起的关键操作都要经过外部策略检查,而不能仅凭模型生成的一段理由获得授权。英伟达表示,OpenShell还可以扩展至Arm、英特尔等第三方计算平台,说明开放性的重点并非取消限制,而是让限制规则能够被检查、适配和持续完善。
以“九不准”和“七条底线”拆解边界
面向中文互联网服务,策略设计可以把《互联网信息服务管理办法》第十五条所列九类禁止性内容,与法律法规、社会主义制度、国家利益、公民合法权益、社会公共秩序、道德风尚和信息真实性七条底线,转换成智能体可执行的权限规则。现行规定同时要求服务提供者保证信息内容合法,发现明显违法信息时停止传输、保存记录并依法报告,具体条文可查阅《互联网信息服务管理办法》官方文本。
- 内容边界:发布前进行合法性、真实性和权益风险检查,对来源不明的重大事实、可能扰乱公共秩序的信息及侵犯他人合法权益的内容实行阻断或人工复核。
- 数据边界:按任务授予最小权限,区分公开资料、内部资料、个人信息和敏感业务数据,禁止智能体自行扩大检索范围或把数据发送至未经批准的外部服务。
- 工具边界:将浏览、发帖、支付、删除文件、修改账号和控制设备设置为不同权限等级,高风险操作实行二次授权,避免“一次登录、全域通行”。
- 网络边界:采用默认拒绝原则,只开放任务需要的域名、接口和协议;对未知地址、异常上传和短时间连续探测进行限制。
- 身份边界:让每个智能体、任务和工具调用拥有可核验身份,避免多个智能体共用长期凭证,并确保责任能够追溯到具体任务和授权人。
毫秒级隔离如何实现
单靠沙箱仍不足以应对运行环境被控制或策略组件失效的情况。平台中的Sentry参考系统运行在BlueField-4数据处理单元上,在主机之外形成带外信任域,持续观察智能体行为,并独立执行安全策略。按照英伟达2026年9月28日发布的说明,当智能体试图越过既定边界时,Sentry可以在毫秒级时间内将其隔离;澎湃新闻同日报道称,隔离最快可在数毫秒内完成。
这种设计的价值不只是“反应更快”,而是监控者与被监控对象相互独立。即使智能体所在的软件环境出现异常,带外组件仍可切断其网络或资源访问路径。不过,“毫秒级”目前主要来自厂商发布信息,公开资料尚未给出适用于所有负载、硬件配置和攻击场景的统一第三方基准,因此企业不应把它理解为任何环境下都能保证相同响应时间。
落地时应建立闭环而非只装工具
- 任务前:明确允许访问的数据、工具、网络目标和最长运行时间,把自然语言要求转换为可验证策略。
- 任务中:记录策略命中、凭证使用、工具调用和数据流向,对连续拒绝、权限试探及任务目标突变设置告警。
- 越界时:立即冻结会话、撤销临时凭证并隔离运行环境,防止异常行为从单个智能体扩散至其他系统。
- 任务后:保留必要审计记录,区分模型错误、策略缺失、工具漏洞和恶意指令,再据此更新规则。
对于论坛、内容社区和信息服务平台,最值得借鉴的不是采购某一套硬件,而是建立“模型不自证安全”的制度:内容底线由平台规则确定,资源权限由外部系统执行,高风险动作由人工最终授权。这样才能把“九不准”和“七条底线”从发布规范进一步落实为运行时控制。
总结
开放式智能体安全平台提供了一条清晰路线:用OpenShell划定可验证的软件策略边界,再用Sentry建立独立于智能体的带外监控和快速隔离能力。真正可靠的智能体治理,不应寄希望于模型永不犯错,而应确保它即使判断失误,也拿不到超出任务需要的权限;即使尝试越界,也能被发现、阻断和追溯。开放意味着规则可审查、可扩展、可协作,而不是让智能体无边界运行。
事件日期:2026年9月28日。
资料核验日期:2026年9月29日。
来源:英伟达开放式智能体安全平台官方公告;澎湃新闻:英伟达发布开放智能体安全平台;《互联网信息服务管理办法》官方文本。