进入9月,前沿模型与智能体产品的更新节奏明显加快。2026年9月9日,OpenAI发布面向复杂工作的GPT-6 Astra;9月10日又推出Agents API公开测试版,使模型能够在云端环境中持续调用工具、处理文件、运行代码并协调子智能体。能力从“生成内容”进一步扩展到“自主执行”,也意味着内容安全评测不能只检查最终回答,还要覆盖模型的规划过程、工具调用、数据访问和实际操作。
模型更新越密集,安全评测越不能只看拒答率
根据OpenAI于2026年9月9日公布的GPT-6 Astra产品说明,该模型强化了计算机操作、网页浏览、软件工程和网络安全等能力,并提供网站与桌面应用访问限制、敏感操作确认和潜在越权调用自动审查等控制措施。官方同时表示,该模型已达到其准备框架中的关键网络安全能力阈值。这些信息提示平台:模型能力升级后,安全评测对象已经从“一段文本是否合规”扩大到“模型是否在正确权限内完成正确任务”。
2026年9月10日发布的Agents API官方公告进一步强化了这一趋势。长时会话、工具搜索、程序化工具调用和多智能体协作可以提升任务效率,但也会形成更长的风险链路。某个单独步骤看似无害,多个步骤组合后却可能造成隐私泄露、错误发布、未经授权的数据修改,甚至把不可靠信息自动扩散到外部系统。因此,平台不应把模型通过静态问答测试视为完成安全验收。
以“九不准”建立内容红线测试集
现行《互联网信息服务管理办法》第十五条明确列出九类禁止制作、复制、发布和传播的信息,包括危害国家安全、损害国家利益、煽动民族仇恨、破坏宗教政策、散布谣言、传播淫秽赌博暴力恐怖内容、侮辱诽谤并侵害他人权益,以及法律法规禁止的其他内容,具体条文可查阅《互联网信息服务管理办法》公开文本。
围绕这些红线,模型评测至少应设置直接请求、隐晦表达、角色扮演、方言谐音、跨语言转换、图片文字混合和多轮诱导等测试方式。对于论坛场景,还要增加“模型生成后由用户二次编辑”的组合样本,检查系统是否会因为局部改写而漏过违法有害内容。评测结果不能只记录拦截与否,还应说明触发规则、处置方式、复核人员和版本编号,以便发生争议时能够完整追溯。
用“七条底线”评估回答质量与社会影响
如果说“九不准”主要解决不能生成什么,那么法律法规、社会主义制度、国家利益、公民合法权益、社会公共秩序、道德风尚和信息真实性这“七条底线”,更适合检查模型应当如何生成。特别是信息真实性底线,要求论坛运营者区分事实、推测与观点。模型引用新闻、政策、科研结果或产品参数时,应保留发布日期、原始出处和适用范围,不能把厂商自测结果改写成独立结论,也不能用模糊的“业内消息”替代可核验来源。
公民合法权益底线则应落实到隐私、名誉、肖像、知识产权和申诉机制。模型处理用户上传的企业材料或个人信息时,应遵循最小必要原则;需要跨系统调用时,应展示权限范围并对发送、删除、公开发布等高影响动作设置人工确认。对于可能损害个人声誉的内容,应提高证据门槛,避免根据单一帖子或未经证实的材料直接给出定性判断。
构建覆盖模型、智能体和运营流程的四层评测
- 输入层:建立违法有害内容、个人信息、虚假信息和越权指令样本库,持续补充新型提示注入与规避表达。
- 模型层:分别测试事实准确性、价值边界、拒答一致性和不确定性表达,避免只依赖厂商提供的综合分数。
- 行动层:对搜索、发帖、群发、下载、删除和外部接口调用设置权限隔离、参数校验、执行前确认及异常熔断。
- 运营层:记录模型版本、提示模板、知识库来源、工具调用和人工复核结果,并建立投诉处理、问题回滚与重大风险报告流程。
2026年9月10日,Anthropic发布人工智能滥用威胁报告,披露其在2025年12月至2026年8月间处置的网络攻击、影响行动、监控、诈骗、生物滥用、常规武器和模型蒸馏等风险案例。报告特别指出,部分恶意活动已从简单问答走向由多智能体执行侦察、利用和数据处理。这与智能体产品加速落地形成相互印证:安全治理必须关注完整任务链,而不是仅过滤最后输出的文字。
总结
9月模型密集更新带来的核心变化,不只是回答更快、能力更强,而是模型开始拥有更长的执行链和更大的现实影响范围。论坛及人工智能应用平台应以“九不准”划定不可触碰的内容红线,以“七条底线”检验信息真实性、社会影响与权益保护,再通过输入、模型、行动和运营四层评测把原则落到流程。真正可靠的安全体系不是一次上线审核,而是每次模型升级、工具扩容和权限变化后都能重新验证、及时发现并迅速回滚。
事件或资料日期
- 2026年9月9日:OpenAI发布GPT-6 Astra产品说明。
- 2026年9月10日:OpenAI发布Agents API公开测试版公告。
- 2026年9月10日:Anthropic发布《Detecting and countering misuse of AI: September 2026》。
- 2024年12月6日:现行《互联网信息服务管理办法》完成第二次修订,参见公开法规文本。