文章总结: 本文介绍Atlantis系统,作为AIxCC冠军,通过多智能体协同架构融合模糊测试、符号执行与大语言模型,实现漏洞发现、补丁生成与SARIF分析闭环,漏洞发现率61%,准确率91.27%。其创新在于将大语言模型深度嵌入漏洞挖掘各环节,但系统复杂度高、资源消耗大,未来安全自动化将向机器主导、人类监督的智能体时代发展。
综合评分: 85
文章分类: ai安全,漏洞分析,安全工具,安全开发,红队
大模型驱动自动化漏洞挖掘与威胁研判系统
原创
刘晔
刘晔
信息网络安全杂志
2026年9月21日 18:00
上海
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
引子:随着开源软件规模持续增长,传统依赖人工分析的漏洞挖掘与修复方式已经难以满足现实需求。美国国防部发起的AI Cyber Challenge(AIxCC)试图利用大语言模型构建全自动 Cyber Reasoning System(CRS),实现漏洞发现、漏洞验证和自动修复的闭环。作为 AIxCC 冠军系统,ATLANTIS 不仅成功发现了决赛中 70 个漏洞中的 43 个,还在自动补丁生成、SARIF报告分析和漏洞归因等方面取得显著优势。与传统漏洞挖掘系统相比,ATLANTIS 的最大特点并非简单地“将 大语言模型 接入模糊测试器”,而是构建了一个大规模、多模块、多智能体协同的自动化安全分析平台,将模糊测试、符号执行、静态分析、程序修复以及 大语言模型 Agent 深度融合,展示了 AI 驱动软件安全自动化的新范式。
速览:ATLANTIS 的整体架构围绕 AIxCC 的三项核心任务展开:自动发现漏洞并生成 PoV(Proof-of-Vulnerability);自动生成漏洞补丁;和自动分析 SARIF 静态分析报告。系统采用 Kubernetes云原生架构,在 Azure 上动态调度资源,支持同时处理多个挑战项目。在漏洞发现阶段,系统融合:(1)多模糊器协同测试;(2)有引导的模糊测试;(3)Concolic Execution;(3)大语言模型驱动输入生成;(4)自动 Harness 构造。在补丁生成阶段,系统构建了多个专用 Agent,分别负责漏洞定位、根因分析、代码检索、属性推理与补丁生成。最终,ATLANTIS 以 392.76 分获得 AIxCC 冠军,显著领先第二名 Trail of Bits 的 219.35 分。其漏洞发现率达到 61%,准确率达到 91.27%。
深度解剖:(1)从“单一工具”到“安全智能体生态系统”: ATLANTIS 最重要的创新并非某个具体算法,而是将漏洞发现流程拆解为多个自治 Agent,并通过统一调度框架协同工作。传统漏洞挖掘工具通常遵循“输入 → 模糊器 → Crash”的线性流程。而 ATLANTIS 则构建了:“项目理解 → Harness 构建 → 输入生成 → 有引导的模糊测试→ 符号执行 → PoV 构造 → 根因分析 → 补丁生成“的闭环智能体流水线。这一设计反映了当前 Agentic AI 在软件工程领域的重要发展趋势。(2)将 大语言模型 深度嵌入漏洞挖掘过程:许多现有工作仅使用 大语言模型 进行漏洞分类或代码解释,而 ATLANTIS 则将 大语言模型 用于多个关键环节:输入种子生成;Harness 逆向构造;调用链分析;Bug 候选推断;根因分析。特别是在无 Harness 场景中,系统提出Harness Reverser和 TestLang框架,通过 大语言模型 自动理解 API 调用关系并构造测试入口。显著提高了自动化程度。(3)漏洞发现与自动修复的统一闭环:AIxCC 不仅要求发现漏洞,还要求自动修复漏洞。ATLANTIS 的补丁模块构建了完整的:Vulnerability → Root Cause → Property → Patch推理链。例如:MULTIRETRIEVAL 负责检索相关代码上下文;VINCENT 分析漏洞根因;PRISM 维护状态与推理过程;MARTIAN 负责补丁生成。相比传统 APR(Automated Program Repair)方法依赖模板匹配,ATLANTIS 更接近“软件工程师”的思考方式。这一方向与近年来CodeX, Claude Code 等 Agent-based 软件工程系统高度一致。
局限:尽管ATLANTIS 展现出当前自动化安全分析的最高水平,但仍存在若干局限。其一:系统复杂度极高, 包含数十个子模块与多个 Agent。这种架构虽然性能优秀,但:开发成本极高;维护难度大;工业界难以完整复现。实际上,其成功很大程度依赖于强大的研究团队和巨额资源投入。其二:对计算资源高度依赖,决赛期间,ATLANTIS 消耗:Azure 资源约 7.39 万美元;大语言模型 费用约 2.94 万美元;超过 4 Billion 输入 Token。这种资源消耗远超普通企业或安全团队能够承担的范围。因此其实际部署成本仍然较高。其三:漏洞发现仍高度依赖覆盖率驱动,虽然引入了大量 Agent 和符号执行技术,但 ATLANTIS 的核心仍基于模糊测试或有引导的模糊测试方法,建立在高质量Harness构建的基础上。对于通用的逻辑漏洞如设计缺陷、权限配置错误等深层语义安全问题,其能力仍有待验证。
启示:ATLANTIS 的成功具有重要标志意义。首先,它证明了自动化漏洞发现已经从“辅助分析工具”进入“自主安全智能体”阶段。未来安全工具的发展方向可能不再是单个 模糊器 或单个分析器,而是由多个 Agent 组成的协同安全系统。其次,它表明未来软件安全研究的重要方向将是“大语言模型 – 程序分析- Autonomous Agents”三者的深度融合。单纯依赖 大语言模型 幻觉风险过高,单纯依赖程序分析又难以扩展,而二者结合能够兼顾语义理解能力与形式化推理能力。第三,ATLANTIS 展示了 AI 在漏洞修复领域的巨大潜力。相比过去聚焦漏洞检测的研究,自动补丁生成正在成为新的竞争焦点。未来 CRS 系统的评价标准可能从“发现多少漏洞”逐步转向“发现并修复多少漏洞”。更广泛地看,AIxCC标志着网络空间安全正在从“人机协作时代”迈向“机器主导、人类监督时代”。未来的软件供应链安全、开源生态安全以及关键基础设施防护,都可能建立在此类自动化安全智能体之上。
点评专家:刘晔(北京理工大学 教授)
原文标题:
Rethinking Unsupervised Graph Anomaly Detection with Deep Learning: Residuals and Objectives
技术报告:
AIxCC Final Competition Winning System Report
原文作者:
Team Atlanta(Georgia Institute of Technology、KAIST、POSTECH、Samsung Research 等机构联合团队)
版权与来源声明:本文依据《中华人民共和国著作权法》第二十四条之规定,为介绍、评选之目的,在此适当引用。原文版权归原作者所有。
信息网络安全
《信息网络安全》创刊于2001年,是由公安部主管,公安部第三研究所、中国计算机学会主办,面向国内外公开发行的国内首批信息安全类期刊之一,于2015年成为中国科技核心期刊,2017年成为中国科学引文数据库来源期刊,2018年成为中文核心期刊,2022年入选CCF计算领域高质量科技期刊分级目录。
中文核心期刊
中国科技核心期刊
中国科学引文数据库来源期刊
CCF计算领域高质量科技期刊
我们在不断努力和完善中,期待您的关注和支持!
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:信息网络安全杂志 刘晔
刘晔《大模型驱动自动化漏洞挖掘与威胁研判系统》