导语:过去,AI 网络安全能力常被概括为“会不会写代码”“能不能解释漏洞”;如今,评测正在进入更接近真实攻防的阶段:模型需要在隔离靶场中完成环境侦察、漏洞定位、利用验证、权限提升和结果复盘等连续任务。🔐 这意味着行业关注点已经从单轮问答准确率,转向模型能否调用工具、跨越多个步骤并形成可执行成果。与此同时,漏洞利用所需的知识门槛可能被进一步压低,具备高危网络能力的模型应如何评测、限制和分级开放,也成为新的治理焦点。
一、网络安全评测为何走向“实战化”
传统题库通常要求模型回答安全概念、分析一段代码或给出修复建议,但这类测试很难衡量真实环境中的行动能力。实战评测则会把模型放入经过授权的沙箱、夺旗赛环境或仿真企业网络,让其面对信息不完整、工具报错、路径选择和上下文持续积累等问题。英国 AI 安全研究机构公开的研究已使用多步骤企业网络与工业控制系统靶场,考察前沿模型能否把不同技能串联为较长的攻击链,相关方法可见多步骤网络攻击场景评测。
这类评测比“答对一道题”更有意义,因为现实攻击很少依赖单个神奇提示词。模型需要理解目标状态、维护操作记录、根据反馈调整策略,并判断下一步行动是否有效。评测对象也不再只是基础模型,而是“模型、系统提示、工具权限、运行环境和人工监督”共同构成的智能体系统。🧪 因此,同一模型在只读分析环境和具备终端、浏览器、代码执行能力的环境中,风险等级可能完全不同。
二、漏洞利用门槛下降体现在哪里
AI 不会凭空创造攻击权限,但可能压缩信息搜集、代码阅读、脚本修改和错误排查所需的时间。缺乏丰富经验的使用者,可以让模型解释漏洞成因、整理公开资料、适配已有验证代码,并根据运行结果持续修正。艾伦·图灵研究所发布的AI 网络风险基准使用经过设计的真实软件场景评估自动化漏洞利用能力,说明“从理解漏洞到形成可运行结果”已经成为可量化的研究对象。
需要警惕的是,门槛下降不等于模型已经能够稳定完成任意入侵。公开评测往往基于受控目标、限定任务和可重复环境,现实系统还存在身份验证、网络隔离、版本差异、监控告警和人工响应等变量。更准确的判断是:AI 正在增强具有一定基础的操作者,并把部分原本依赖反复试错的工作转化为可自动推进的流程。⚠️ 当这种能力与批量扫描、长时间运行和多工具调用结合时,规模化风险可能比单次成功率更值得关注。
三、评测不能只看“最终是否攻破”
一个完整的网络安全评测体系,应同时观察任务成功率、完成步骤数、人工介入次数、资源消耗、失败恢复能力和结果可复现性。还要区分模型是在复述训练数据中的已知方法,还是能够针对新环境完成分析与适配。Google DeepMind 曾提出覆盖攻击链不同阶段的网络能力评估框架,强调从侦察到目标行动的端到端观察,具体可参考网络安全能力评估说明。
安全性指标同样不能缺席。评测人员应记录模型是否遵守授权边界、是否尝试接触靶场之外的资源、能否识别敏感目标,以及在权限或任务表述变化后是否仍保持约束。对于具备自主规划能力的系统,还应测试停止指令、凭据隔离、工具白名单、网络出口控制和全程审计是否真正有效。否则,单纯追求更高的攻防得分,可能把评测本身变成危险能力的展示窗口。
四、高危能力为何适合分级开放
网络安全具有明显的双重用途:同一种代码分析能力既能帮助企业修复漏洞,也可能被用于寻找可利用入口。完全封闭会妨碍防守方研究,毫无限制地开放又可能扩大滥用范围。更可行的方向是按照能力、用户和工具权限进行分层,而不是只贴上“安全”或“危险”的简单标签。🛡️
- 基础层:面向普通用户开放安全知识解释、配置检查、日志摘要和通用修复建议,但限制生成可直接用于未授权目标的高风险操作方案。
- 专业层:面向经过验证的企业安全团队和研究人员,允许在明确授权范围内进行漏洞复现、代码审计和靶场测试,同时保留身份核验、速率限制与操作日志。
- 高危层:涉及自动化利用链、批量目标操作、持久化控制或关键基础设施场景时,应采用更严格的资格审查、隔离环境、最小权限、人工审批和异常中止机制。
分级管理还应与模型能力阈值联动。模型升级、推理预算增加或接入新工具后,都可能改变原有风险判断,因此不能把一次评测结果长期沿用。Anthropic 的负责任扩展政策体现了“能力阈值对应更强保护措施”的治理思路;这一原则对网络安全模型同样具有参考价值,但具体门槛仍需结合独立测试和真实部署条件确定。
五、企业和平台可以立即采取的措施
- 先建授权靶场:高风险测试必须在资产边界清晰、数据可恢复、网络出口受控的环境中运行,禁止直接把生产系统当作模型试验场。
- 建立能力清单:分别记录模型在侦察、代码审计、漏洞验证、权限提升和横向移动等环节的表现,避免用一个总分掩盖关键风险。
- 限制智能体权限:默认采用只读访问、临时凭据、命令白名单和最小网络范围;只有在任务确有必要时,才逐项增加权限。
- 保留完整证据:保存提示内容、工具调用、模型输出、环境反馈和人工审批记录,便于事故追踪、合规审计与评测复现。
- 设置双重评审:高危操作由安全人员与业务资产负责人共同批准,模型发现的漏洞在披露前应完成真实性验证和影响评估。
- 持续回归测试:模型版本、系统提示、插件、推理参数或安全策略发生变化后,应重新运行关键测试集,防止能力增强而防护措施仍停留在旧水平。
总结
AI 模型网络安全评测进入实战阶段,真正需要关注的不是模型能否输出一段“像攻击代码”的内容,而是它能否在工具和环境支持下持续推进复杂任务。漏洞利用门槛下降会同时放大防守效率与滥用风险,因此,行业必须把能力评测、权限控制、用户审核、运行监控和责任追溯结合起来。🚦未来更合理的开放方式,不是“一律拒绝”或“完全放开”,而是依据能力危险度和使用场景实施动态分级,让合规防守者获得足够工具,同时给高危能力加上可验证、可审计、可随时中止的安全边界。