导语:人工智能正在把网络安全从“工具辅助”推向“任务代理”。过去,安全人员使用模型生成规则、归纳告警或解释代码;如今,具备规划、调用工具、执行命令和反馈迭代能力的智能体,已经可以在受控环境中完成漏洞发现、验证、修复乃至多阶段攻防任务。与此同时,攻击者也在利用同类能力压缩侦察、武器化和横向移动所需时间。AI网络攻防的关键矛盾,正从“谁掌握更多知识”转变为“谁能更快、更可靠地形成闭环”。
从安全助手走向自主攻防闭环
新一代安全智能体通常由大模型、任务规划器、代码执行环境、安全工具和记忆模块组成。接到目标后,它可以拆分任务,调用静态分析、模糊测试、扫描器或调试器,根据执行结果修正假设,再生成验证代码或补丁。这与传统自动化脚本的区别在于:脚本沿固定流程运行,而智能体能够依据上下文选择工具、调整步骤并持续试错。
2025年8月结束的DARPA“AI网络挑战赛”是这一趋势的重要验证。参赛网络推理系统可自主分析真实开源代码、发现安全缺陷并生成补丁,Team Atlanta获得冠军;DARPA还推动部分系统开源,以便防守方进一步验证和采用相关技术。该项目表明,AI已经不只是解释扫描结果,而是开始参与“发现—复现—修复—回归测试”的完整链路。相关情况可参见DARPA官方说明。
自主漏洞利用能力正在跨越门槛
自主漏洞利用并不等同于让模型直接输出一段攻击代码。真正困难的是理解复杂代码、定位可控输入、建立崩溃与漏洞之间的因果关系、绕过环境差异,并把多个弱点组合为稳定利用路径。当前系统仍会误判、遗忘约束或陷入无效探索,但在明确边界、具备工具调用和充分计算资源的情况下,其完成多步骤任务的能力提升明显。
英国AI安全研究机构在2026年公布的受控评估中指出,前沿模型已经能够在模拟网络中自主发现并利用漏洞,完成原本需要专业人员长时间操作的多阶段任务。不过,这些结果来自授权靶场,并不意味着模型可在任意真实环境中稳定成功。评估价值在于揭示能力上限和发展速度,而不是证明“全自动黑客”已经普遍成熟。详见英国AI安全研究机构评估。
另一项值得关注的进展是模型对已公开漏洞的识别和利用效率。Anthropic在2026年1月披露的测试显示,其模型能够仅借助常见开源工具,在部分复杂模拟网络中完成多阶段攻击;但测试成功率并非百分之百,对一些环境仍需要专门工具辅助。这说明自主利用已具备现实意义,却依然存在稳定性、泛化能力和成本方面的限制。相关边界可参考受控网络靶场研究。
防守侧正在获得新的主动优势
AI的防御价值首先体现在扩大代码审计覆盖面。传统模糊测试擅长发现可由随机或变异输入触发的问题,大模型则更适合结合代码语义、历史补丁和上下文推测复杂缺陷。Google DeepMind与Project Zero合作开发的Big Sleep曾在SQLite代码中发现此前未知的可利用内存安全问题,而且该问题在进入正式版本前得到修复,展示了“发布前主动消除漏洞”的可能性。技术过程见Project Zero研究文章。
2025年,Big Sleep又结合威胁情报定位SQLite漏洞CVE-2025-6965,并在潜在利用发生前协助完成防护。这里的重要变化不是单纯提高扫描速度,而是把威胁情报、代码推理、漏洞验证和修复优先级联结起来,使防守从等待告警转向预测攻击者可能采用的路径。Google同时强调,漏洞报告和处置仍保留人工审核,说明“自主发现”并不等于取消专业人员的责任。详情可参见Google安全进展说明。
攻防双方都面临新的安全边界
当智能体获得终端、浏览器、代码仓库和云平台权限后,它自身也会成为攻击面。恶意提示可隐藏在网页、工单、日志或代码注释中,诱导智能体偏离任务;被篡改的工具、插件和技能包可能窃取凭据;长期记忆还可能被污染,使错误指令跨任务持续存在。OWASP已将行为劫持、工具滥用、身份与权限滥用等列为智能体应用的重要风险,参见OWASP智能体安全指南。
因此,企业不能把安全智能体当成“能力更强的脚本账户”。更合理的原则是最小权限、最小自主范围和全程可审计:智能体应使用独立身份与短期凭据;扫描、验证和修复环境相互隔离;访问生产系统必须经过策略控制;高风险操作需要人工审批;每次命令、工具调用、文件变更和模型决策都应留下可追溯记录。NIST也在推进AI智能体身份、认证和授权研究,强调将现有身份标准应用于智能体架构,相关方向见NIST AI智能体标准计划。
企业可落地的实施路径
- 先选低风险场景:优先用于依赖项分析、告警归并、补丁建议和测试用例生成,不宜一开始就赋予生产写入权限。
- 建立隔离靶场:通过容器、虚拟机、模拟数据和受控网络验证智能体能力,限制外联、资源消耗及敏感信息访问。
- 验证真实效果:同时考察漏洞召回率、误报率、补丁正确性、回归失败率、任务成本和人工复核时间,避免只看演示成功案例。
- 实行双重验证:漏洞结论应由确定性工具或人工复现确认,补丁必须通过单元测试、集成测试和安全回归测试。
- 持续开展红队测试:重点测试提示注入、越权调用、工具投毒、记忆污染、密钥泄露和失控循环,并准备快速停机与凭据吊销机制。
总结
AI网络安全攻防已经进入“有限自主、快速进化”的阶段:在受控条件下,智能体能够完成漏洞发现、验证、利用和修复中的多个环节,但距离无条件可靠运行仍有明显差距。短期内,最现实的形态不是完全取代安全专家,而是由AI承担高频搜索、代码分析和迭代验证,由人类负责授权、判断影响与承担责任。真正的竞争优势也不会只来自模型能力,而将取决于工具链质量、权限治理、评测体系和响应流程。谁能在保持可控与可审计的前提下缩短漏洞闭环,谁就更可能在下一阶段的机器速度攻防中占据主动。