2026年9月14日至20日,国家网络安全宣传周在全国开展。活动现场,“提示词注入”成为大模型安全的重要议题:攻击者可能把恶意指令藏进一句话、网页、邮件、文档、图片或视频,诱导模型越过原有规则。随着大模型从内容生成工具演变为可检索数据、调用接口和执行任务的智能体,防护重点不能停留在“写一段更强的系统提示词”,而应转向覆盖输入、模型、工具、数据和运营的纵深体系。
一、提示注入为何需要分层防护
提示注入的关键风险,是模型可能把需要分析的外部内容误判为需要执行的指令。直接注入通常由用户在对话中尝试覆盖既有规则;间接注入则隐藏在网页、邮件、知识库文档、工具返回值或多模态文件中,待智能体读取后触发。2026年9月15日播出的相关报道指出,此类攻击可能造成个人隐私、敏感信息或企业核心数据泄露,说明风险已经从“回答失控”扩展到“权限和数据失控”。[1]
治理目标应与互联网信息服务的“九不准”和“七条底线”保持一致,将法律法规、国家利益、公民合法权益、社会公共秩序、道德风尚以及信息真实性等要求转化为可执行控制。具体而言,既要防止攻击者诱导模型生成违法有害、虚假欺诈或侵权内容,也要阻止模型越权读取、修改和外传数据。合规规则不能只写在提示词里,还要落实到鉴权、策略引擎、审计和人工审批环节。
二、建立五层纵深防线
第一层:治理与资产边界
组织应先建立大模型资产清单,记录模型版本、系统提示词、知识库、插件、外部接口、服务账号和数据等级。针对每个场景明确允许回答的主题、允许调用的工具以及禁止执行的动作,并设置内容安全责任人和事件处置流程。2026年9月17日发布的《人工智能安全治理框架3.0》相关信息强调,应沿用“风险分类、技术应对、综合治理”的逻辑,并将安全管理贯穿开发态和运营态。[2]
第二层:输入与上下文隔离
所有来自用户、网页、邮件、文件、检索库和工具结果的内容,都应默认视为不可信数据。网关可以执行编码规范化、隐藏文本识别、文件类型校验、危险意图检测和来源标记,但不能把关键词过滤当成唯一防线。应用还应明确区分系统规则、用户任务和外部资料,禁止外部资料修改角色、权限或安全策略,并对图片文字、文档批注、HTML属性等非显式内容进行统一检查。
第三层:模型输出与内容审核
模型输出进入论坛、客服回复或业务系统前,应经过独立策略检查。审核维度应覆盖违法有害内容、虚假信息、隐私数据、商业秘密、歧视性表达及诱导欺诈等风险,与“九不准”和“七条底线”形成对应关系。对于事实类回答,可要求模型附带可信依据,并由应用校验引用是否真实存在;对于高风险内容,则应拒绝输出、降级为只读回答或转交人工处理。
第四层:工具调用和最小权限
智能体能否造成实际损害,往往取决于它拥有多少权限。工具接口应采用允许列表和参数约束,读取、写入、删除、转账、发送与发布等能力必须分离授权。高风险操作应设置二次鉴权、人工确认、额度限制和事务回滚,凭证不能直接暴露在模型上下文中。2026年9月15日公开的网安周展示信息提到,多层级防护可同时覆盖提示词注入、多模态内容检测、敏感数据防泄漏、应用安全和API安全,这体现了从模型护栏向系统工程延伸的思路。[3]
第五层:运行监控与应急响应
系统应记录输入来源、检索片段、模型版本、策略判定、工具调用、权限校验和人工审批,但日志本身需要脱敏。运营侧可重点观察连续覆盖指令、异常批量检索、跨权限访问、敏感字段输出以及非常规外联等信号。发现疑似注入后,应暂停相关会话和工具令牌,保全审计证据,检查知识库污染范围,并根据影响情况轮换凭证、修复策略和回归测试。
三、把红队测试做成持续工程
红队测试应在获得授权、隔离环境和不使用真实敏感数据的前提下开展,目标是验证防线而不是追求“骗过模型”的次数。测试用例至少覆盖:
- 直接注入:角色覆盖、规则伪造、多轮诱导和编码混淆。
- 间接注入:在网页、邮件、PDF、知识库片段及工具返回值中嵌入冲突指令。
- 多模态注入:检查图片文字、不可见元素及附件元数据是否会改变模型行为。
- 权限滥用:验证模型能否绕过审批,调用超出用户身份和任务范围的工具。
- 数据外泄:使用合成标记数据测试敏感内容是否会进入回答、日志或外部请求。
- 内容底线:验证注入是否可诱导系统生成违法有害、虚假欺诈或侵权信息。
每个用例都应保存输入载体、攻击路径、预期结果、实际结果和拦截层级。评估指标可采用攻击成功率、高风险工具误调用率、敏感标记泄露率、误报率、人工审批覆盖率和平均处置时间。模型、提示模板、知识库、插件或权限策略发生变化后,应自动重跑核心用例;新发现的失败样本则进入回归集,形成“发现、修复、验证、监控”的闭环。
总结
提示注入难以依靠单点过滤彻底消除,但可以通过治理边界、上下文隔离、内容审核、最小权限、运行监控和持续红队测试显著缩小影响范围。真正可靠的安全控制应位于模型之外,即使模型错误理解了恶意内容,应用层仍能阻止越权调用、敏感数据外传和违法信息发布。对面向公众的中文论坛或智能体服务而言,将“九不准”和“七条底线”转化为策略规则、权限关卡与审计证据,才是可检查、可追责、可持续改进的防护实践。
事件及资料日期:
2026年9月14日,2026年国家网络安全宣传周开幕。
2026年9月15日,央视相关节目报道提示词注入风险;中国网发布大模型多层级安全防护展示信息。
2026年9月17日,中央网信办网站发布网络安全宣传周亮点观察,介绍《人工智能安全治理框架3.0》及智能体权限治理等内容。
核验来源:央视新闻相关报道转载、中央网信办公开信息、中国网商务频道报道。