文章总结: 这篇综述系统梳理2026年网络安全、软件工程、AI三大领域11大顶会已公开的全部LLMAgent漏洞自动化论文,按漏洞挖掘、漏洞验证PoC、漏洞利用渗透、漏洞修复四大任务赛道分类拆解,覆盖NDSS、S&P、USENIX、CCS、ICSE、FSE、ICLR等顶会一手成果,是AI安全从业者、红队开发、代码审计工程师的必读文献清单。
综合评分: 88
文章分类: AI安全,漏洞分析,安全工具,渗透测试,红队
顶会全景梳理|2026 全量 LLM 漏洞智能体论文综述
原创
智安窥豹
智安窥豹
智安窥豹
2026年7月29日 07:50
广东
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
摘要:本文完整梳理 2026 年网络安全、软件工程、AI 三大领域 11 大顶会已公开全部 LLM Agent 漏洞自动化论文,按四大任务赛道(漏洞挖掘 / 漏洞验证 PoC / 漏洞利用渗透 / 漏洞修复)分类拆解,每篇附上论文全称、作者、核心摘要、官方下载链接,覆盖 NDSS/S&P/USENIX/CCS/ICSE/FSE/ICLR 等顶会一手成果,是 AI 安全从业者、红队开发、代码审计工程师必读文献清单。
#
#
一、检索背景与范围说明
2026 年 LLM 智能体彻底重构漏洞全生命周期工作流,从漏洞扫描、PoC 构造、渗透攻击到自动补丁实现全链路自动化。本次检索截止2026.07.19,覆盖 11 个全球顶会:网安四大顶会:NDSS、IEEE S&P、USENIX Security、ACM CCS软工顶会:ICSE、FSE、ASE、ISSTAAI 顶会:ICLR、ICML、AAAI、CVPR、IJCAI、NeurIPS
会议论文收录现状(精简版)
- NDSS 2026(已公开):4 篇
- IEEE S&P 2026(已公开):3 篇
- USENIX Security 2026(Cycle1 公开):2 篇
- ACM CCS 2026(初审公示):3 篇 + 1 篇待确认
- ICSE/FSE 2026(完整公开):各 2 篇
- ICLR/ICML 2026:主题 + 研讨会共 7 篇
- ASE/ISSTA/IJCAI/NeurIPS/CVPR:未出完整论文集,暂无有效成果
分类逻辑
按照智能体在漏洞生命周期四大核心任务划分:
- 赛道 1:漏洞挖掘智能体(静态 / 混合 / 模糊测试,固件 / Web / 微服务 / 协议多场景)
- 赛道 2:漏洞验证 & PoC 自动生成智能体
- 赛道 3:漏洞利用 & 自动化渗透智能体(Web / 区块链 / 长链路渗透)
- 赛道 4:漏洞自动修复智能体
- 补充板块:评测基准论文(用于衡量 Agent 安全能力)
- 补充板块:arXiv 未录用预印本前沿方案
二、赛道一:漏洞挖掘类 LLM 智能体论文
2.1 NDSS 2026 · FirmAgent
论文名称:FirmAgent: Leveraging Fuzzing to Assist LLM Agents with IoT Firmware Vulnerability Discovery中文译名:FirmAgent:基于模糊测试辅助 LLM 智能体挖掘 IoT 固件漏洞
作者:Jiangan Ji, Chao Zhang, Shuitao Gan 等(信息工程大学、清华大学)
摘要:漏洞挖掘、漏洞验证摘要现有固件静态污点分析误报海量,纯模糊测试难以定位有效输入源。FirmAgent 首创Fuzz + 双 LLM 智能体混合架构:先用插桩模糊测试采集固件真实外部污点源,重建漏洞执行路径;第一个 LLM 智能体做上下文感知污点传播分析,过滤无效路径;第二个智能体自动输出可复现 PoC。在 14 款真实 IoT 路由器固件测试,检出 182 个漏洞(140 个 0day,17 个 CVE),精度 91%,全面超越传统固件检测工具。
下载链接:https://www.ndss-symposium.org/wp-content/uploads/2026-s1943-paper.pdf开源代码:https://github.com/vul337/FirmAgent.git
2.2 NDSS 2026 · BSFuzzer
论文名称:BSFuzzer: Context-Aware Semantic Fuzzing for BLE Logic Flaw Detection中文译名:面向 BLE 蓝牙逻辑缺陷的上下文语义模糊测试智能体作者:Ting Yang、杨、秦悦等(西电、清华、金泽大学)
摘要:漏洞挖掘、漏洞验证摘要传统模糊测试无法解析 BLE 协议文档,难以捕获状态跳转、字段误解类逻辑漏洞。BSFuzzer 依靠 LLM 智能体解析蓝牙官方规范,自动提取状态机、数据包语义,生成字段变异、状态跳转变异两类测试用例,同时智能体校验设备响应识别认证绕过、DoS 缺陷。19 款蓝牙设备测试发现 34 个全新漏洞,9 个分配 CVE。
下载链接:https://www.ndss-symposium.org/wp-content/uploads/2026-f94-paper.pdf
2.3 IEEE S&P 2026 · Agentic Concolic Execution
论文名称:Agentic Concolic Execution中文译名:智能体驱动混合符号执行作者:Zhengxiong Luo、Dylan Wolff、Abhik Roychoudhury(新加坡国立、帝国理工)
摘要:漏洞挖掘、漏洞验证摘要传统混合符号执行受约束求解瓶颈限制,难以遍历深层代码路径。该工作将 LLM 智能体嵌入符号执行引擎,由大模型动态引导路径探索,基于代码语义选择分支,突破求解限制,大幅提升深层漏洞触发概率,是首个 Agent+Concolic 融合的程序漏洞挖掘方案。
下载链接:https://abhikrc.com/pdf/SP26.pdf项目地址:https://concollmic.github.io/
2.4 IEEE S&P 2026 · GONDAR
论文名称:GONDAR: Contextualizing Sink Knowledge for Java Vulnerability Discovery中文译名:基于危险 API 上下文感知的 Java 漏洞挖掘智能体作者:Fabian Fleischer、Taesoo Kim(佐治亚理工、三星研究院)
摘要:漏洞挖掘、漏洞利用摘要针对 Java 路径遍历、反序列化 RCE 漏洞,构建以危险 Sink 函数为核心的双智能体模糊框架:探索智能体生成到达漏洞入口的输入,利用智能体自动构造 Exploit;双智能体持续交换运行时种子迭代优化。漏洞检出量是业界标杆 Jazzer 的 4 倍,已集成 DARPA AIxCC 与 OpenSSF 沙箱。
下载链接:https://arxiv.org/pdf/2604.01645v2
2.5 IEEE S&P 2026 · Neo
论文名称:Neo: Detecting Privilege Escalation in Polyglot Microservices中文译名:多语言微服务权限提升漏洞智能检测框架作者:Penghui Li、Yinzhi Cao(约翰霍普金斯、哥伦比亚大学)
摘要:漏洞挖掘摘要微服务跨语言、跨接口的权限逻辑漏洞人工排查成本极高。Neo 依靠 LLM 动态生成跨语言代码检索策略,自动跟踪接口权限传递链路,适配 7 种编程语言 620 万行开源微服务代码,发现 24 个零日权限提升漏洞,精度 81%、召回 85%。
下载链接:https://arxiv.org/html/2605.15569v1
2.6 USENIX 2026 · iFinder
论文名称:iFinder: Understanding Implicit Trust Errors in Core Carrier Networks中文译名:面向 5G 核心网隐式信任漏洞多智能体检测系统作者:Ziyu Lin、XiaoFeng Wang(南洋理工)
摘要:漏洞挖掘、漏洞利用摘要5G 核心网依赖内部接口信任,云化部署后暴露大量会话劫持、DoS 隐式信任缺陷。iFinder 多智能体自动归纳 3GPP 规范缺陷模式,交叉校验代码与协议文档抑制 LLM 幻觉,自动生成 PoC;7 套开源 5G 核心网检出 84 个全新漏洞,81 个获 CVE,缺陷在商用 5G 环境复现。
下载链接:https://arxiv.org/pdf/2607.10315
2.7 ACM CCS 2026 · PBFuzz
论文名称:PBFuzz: Agentic Directed Fuzzing for PoV Generation中文译名:面向漏洞证明 (PoV) 的智能体导向模糊测试作者:Haochen Zeng、Chengyu Song(加州河滨大学)
摘要:漏洞挖掘、漏洞验证摘要PoV(漏洞可复现输入)需要同时满足路径可达、漏洞触发双重约束。PBFuzz 模拟安全专家迭代审计流程:LLM 智能体提取代码语义约束,搭配持久记忆避免重复无效测试;30 分钟内可触发 57 个漏洞,效率是 AFL++ 传统方案 25.6 倍,17 个独有漏洞其他工具无法检出。
下载链接:https://arxiv.org/html/2512.04611v2开源:https://github.com/sgzeng/pbfuzz
2.8 ACM CCS 2026 · BACAgent
论文名称:BACAgent: LLM-Powered Detection of Broken-Access-Control中文译名:LLM 驱动 Web 越权访问漏洞检测智能体作者:Fengyu Liu 等(复旦大学)
摘要:漏洞挖掘摘要越权(BAC)属于复杂业务逻辑漏洞,传统扫描器难以识别跨会话、跨接口权限流转。BACAgent 利用大模型解析 Web 业务流程,自动跟踪身份凭证传递路径,精准识别垂直 / 水平越权,填补传统工具逻辑漏洞检测短板。
下载链接:https://lfysec.github.io/
2.9 ACM CCS 2026 · COIN
论文名称:The Illusion of Rust Safety: Detecting Modular Unsafe Functions中文译名:Rust 模块化不安全函数检测智能体 COIN作者:Xiang Cheng、Taesoo Kim(佐治亚理工)
摘要:漏洞挖掘、漏洞利用摘要Rust 看似 safe 的函数在模块组合后会触发内存未定义行为(MUF 漏洞),编译器无法识别。微调 LLM 构建 COIN 系统,自动识别 5 大类 MUF 缺陷并生成 PoC;开源 Rust 库检出 26 个零日漏洞,10 个分配 CVE。
下载链接:https://sangdon.github.io/publication/2026-05-16-the-illusion-of-rust-safety-detecting-modular-unsafe-functions-wi/
2.10 ICSE 2026 · VulTrial
论文名称:Let the Trial Begin: A Mock-Court Approach to Vulnerability Detection中文译名:法庭对抗式多智能体漏洞检测框架 VulTrial作者:Ratnadira Widyasari、David Lo(新加坡管理大学)
摘要:漏洞挖掘、漏洞验证摘要设计 4 类角色智能(研究员、代码作者、主持人、评审)模拟法庭辩论,区分良性代码与漏洞代码;小样本微调后,低成本 3.5 模型效果超越原生 GPT-4o,标注准确率翻倍。
下载:https://conf.researchr.org/details/icse-2026/icse-2026-research-track/214
2.11 ICLR 2026 研讨会・ASA-Fuzz
论文名称:When Fuzzing Becomes Agentic: Semantic State Exploration中文译名:面向有状态程序的智能体语义模糊测试作者:Andrew Yin、Heng Yin(加州河滨大学)
摘要:漏洞挖掘摘要传统 Fuzz 生成无效交互,ASA-Fuzz 智能体感知程序运行语义状态,自适应生成有效多步交互,在规则类程序中发现独特状态数量是 AFL++ 等基线 10~100 倍。
下载:https://openreview.net/forum?id=ztjVY9GB1t
2.12 arXiv 预印本(漏洞挖掘类)
- AgentFlow:多智能体测试运行时自动合成,Chrome 挖到 2 个沙箱逃逸 CVE | https://arxiv.org/abs/2604.20801
- Code-Augur:规范推理闭环漏洞检测,自动生成代码安全断言 | https://arxiv.org/abs/2606.18619
- FuzzingBrain V2:OSS-Fuzz 多智能体全链路漏洞分析,29 个 0day | https://arxiv.org/abs/2605.21779
- Phoenix:免训练多智能体行为契约漏洞检测 | https://arxiv.org/abs/2604.19012
- MulVul:跨模型提示迭代检索式漏洞检测 | https://arxiv.org/pdf/2601.18847
三、赛道二:漏洞验证 & PoC 自动生成论文
3.1 ICLR 2026 Oral · CyberGym
论文名称:CyberGym: Evaluating AI Agents’ Real-World Cybersecurity Capabilities中文译名:大规模真实漏洞 PoC 生成评测基准 CyberGym作者:Zhun Wang、Dawn Song(伯克利)
摘要:漏洞验证、PoC 生成(评测基准)摘要业界首个大规模 PoC 生成基准,收录 188 开源项目、1507 个真实 C/C++ 内存漏洞。任务仅提供漏洞文字描述,要求 Agent 生成可触发崩溃的 PoC;最优模型成功率仅 20%,测试过程额外挖出 34 个零日、18 个不完整官方补丁,兼具评测与漏洞挖掘能力。
下载链接:https://openreview.net/forum?id=2YvbLQEdYt
3.2 arXiv 预印本 LiLCVE
论文名称:Towards Demystifying and Repairing LLM-in-the-Loop Vulnerabilities中文译名:LLM 循环交互漏洞数据集与验证框架
摘要:漏洞验证、漏洞修复摘要构建首个 LLM 生态专属漏洞数据集 LiLCVE(41 个 LiL 漏洞 + 75 个代码助手漏洞),评估各类 Agent 复现、修复漏洞能力,证明大模型交互漏洞修复难度远高于传统代码漏洞。
下载:https://arxiv.org/abs/2605.28893
四、赛道三:漏洞利用 & 自动化渗透智能体论文
4.1 NDSS 2026 · AWE
论文名称:AWE: Adaptive Agents for Dynamic Web Penetration Testing中文译名:自适应 Web 渗透多智能体框架 AWE作者:Akshat Singh Jaswal(Stux Labs)
摘要:漏洞利用、Web 渗透摘要摒弃通用无限制漫游智能体,为 XSS、SQL 注入等注入漏洞定制专属分析流水线,搭配全局持久记忆与浏览器实机验证;XBOW 基准下 XSS 利用成功率 87%、盲 SQLi 66.7%,Token 消耗降低 98%,速度提升 4 倍。
下载链接:https://www.ndss-symposium.org/wp-content/uploads/lastx2026-37.pdf开源:https://github.com/stuxlabs/AWE
4.2 NDSS 2026 · CHAP
论文名称:Context Relay for Long-Running Penetration-Testing Agents中文译名:长链路渗透上下文中继智能体 CHAP作者:Marius Vangeli(瑞典 KTH、国防研究院)
摘要:漏洞利用、多阶段渗透摘要解决长时间横向渗透上下文窗口溢出、决策退化问题;将历史攻击知识压缩中继传递给新 Agent 实例,AutoPenBench 基准渗透成功率从 27.3% 提升至 36.4%,Token 开销减少 32.4%。
下载链接:https://www.ndss-symposium.org/wp-content/uploads/lastx2026-42.pdf
4.3 FSE 2026 · ChainDelta
论文名称:ChainDelta: Automatic Patch-based Exploit Generation for Ethereum中文译名:以太坊补丁驱动漏洞利用智能体作者:Mingxi Ye 等(中山大学)
摘要:漏洞利用、区块链渗透** 摘要针对以太坊 1-day 漏洞,LLM 模糊智能体自动解析补丁差异、构造链上复杂状态,生成可执行攻击载荷;基准测试利用成功率 70%,误报仅 12.5%,审计中挖到 4 赏金漏洞。
下载:https://conf.researchr.org/details/fse-2026/fse-2026-research-papers/98
4.4 ICLR 2026 · HackWorld
论文名称:HackWorld: Evaluating Computer-Use Agents on Web Exploitation中文译名:多模态 GUI 渗透智能体评测框架 HackWorld作者:浙江大学、UNSW、新加坡国立团队
摘要:漏洞利用、可视化 Web 渗透评测摘要全球首个面向视觉操作型 CUA 智能体的 CTF 渗透基准,包含 36 套真实 Web 靶场(11 框架、7 语言),集成 Burp、DirBuster 全套渗透工具;实测所有前沿多模态模型漏洞利用率低于 12%,暴露多步攻击规划、安全工具调用两大核心短板。
下载链接:https://openreview.net/pdf?id=nLfZPoJbO7
4.5 ICLR 2026 · RedCodeAgent
论文名称:RedCodeAgent: Automatic Red-teaming Agent against Code Agents中文译名:代码智能体自动化红队攻击智能体
摘要:漏洞挖掘、红队利用摘要专门针对 Cursor、Codeium 等代码助手做自动化越狱、漏洞挖掘;自适应记忆存储攻击策略,动态组合载荷,在商用代码工具上挖出未公开安全缺陷。
下载:https://openreview.net/forum?id=IyIaAOihmZ开源:https://github.com/1mocat/RedCodeAgent
4.6 arXiv 预印本 Refploit
论文名称:Refploit: Facilitating Exploit Construction via Code-Agent Trajectory Repair中文译名:基于代码轨迹修复的漏洞利用复现框架
摘要:漏洞利用摘要依托公开 Exploit 样本,LLM 智能体差分执行定位失效代码片段,自动修复攻击轨迹,172 份 Java 利用样本复现率 80.2%。
下载:https://arxiv.org/abs/2607.01760
五、赛道四:漏洞自动修复智能体论文
5.1 CCS 2026(待确认)・Kumushi
论文名称:Kumushi: Root-Cause-Driven Automated Vulnerability Repair中文译名:根因导向漏洞修复智能体作者:亚利桑那州立、CISPA 德国实验室
摘要:漏洞修复摘要现有修复智能只修复表象,Kumushi 融合多维度故障定位算法,引导 LLM 聚焦漏洞底层根源;设计双层补丁评估标准(自动化校验 + 人工盲评)。178 个 C/C++ 漏洞测试,47% 场景人类专家更偏好其补丁,性能超越 Codex。
下载:https://arxiv.org/html/2605.04251v1
5.2 ICSE 2026 · CodeR-S
论文名称:Fixing Security Vulnerabilities with Agentic AI in OSS-Fuzz中文译名:适配 OSS-Fuzz 崩溃样本的漏洞修复智能体 CodeRover-S作者:新加坡国立 Abhik 团队
摘要:漏洞修复摘要首个面向 Google OSS-Fuzz 海量崩溃样本的自动化修复 Agent,无需 issue 文本,直接从崩溃执行流提取漏洞上下文;真实开源漏洞 73.3% 生成有效补丁,多个已合入官方仓库。
下载:https://dl.acm.org/doi/10.1145/3786583.3786880
5.3 FSE 2026 · CodeCureAgent
论文名称:CodeCureAgent: Automatic Classification and Repair of Static Analysis Warnings中文译名:静态扫描告警自动分拣与修复智能体作者:Pascal Joos、Michael Pradel(德国 CISPA)
摘要:漏洞修复、告警验证摘要针对 SonarQube 海量扫描告警,Agent 迭代调用代码检索工具区分误报 / 真实漏洞,三步校验(编译、无新增告警、全量测试)生成修复;106 个 Java 项目 96.8% 告警生成合理修复,真实修复准确率 86.3%。
下载:https://doi.org/10.1145/3808140预印本:https://arxiv.org/abs/2509.11787
5.4 arXiv 预印本 KeaRepair
论文名称:KeaRepair: Knowledge-Enhanced Agentic Vulnerability Repair中文译名:知识库增强漏洞修复智能体
摘要:漏洞修复摘要构建海量历史漏洞 – 补丁检索库,ReAct 智能体联动代码分析工具定位根因,编译 / PoC / 测试三重闭环验证;55 个高危 C/C 漏洞修复率 83.64%,6 个其他工具无法修复的复杂漏洞可解决。
下载:https://arxiv.org/abs/2607.00820
5.5 AAAI 研讨会・Reflection-Driven Control
论文名称:面向可信代码智能体的反思驱动控制
摘要:预防性漏洞修复摘要Plan-Reflect-Verify 三阶段自校验框架,推理过程实时自查代码安全,8 类 CWE 场景代码安全率平均提升 8.1%。
下载:https://trustagenticai.github.io/AAAI2026/AAAI-Workshop/43.pdf
5.6 ICML 研讨会・Smarter Saboteurs
论文名称:线性多智能体工作流的漏洞修复与对抗
摘要:漏洞修复、多 Agent 安全协同摘要QA 审查智能体 + 修复智能体流水线,模拟内部恶意代码注入场景,验证多智能体架构下漏洞自动修复的鲁棒性。
下载:https://arxiv.org/pdf/2606.12709
六、综述类顶会论文
USENIX 2026 SoK · DARPA AIxCC
论文名称:SoK: DARPA’s AI Cyber Challenge中文译名:DARPA AI 自主漏洞竞赛系统性综述作者:佐治亚理工 Taesoo Kim 团队、全赛事参赛机构联合
摘要:全生命周期(挖掘 + 修复)综述摘要全球最大自主漏洞攻防竞赛完整复盘,梳理所有参赛 Agent 架构、性能瓶颈,总结 LLM 做漏洞挖掘 / 修复现存核心缺陷,给出未来自主安全系统研发路线。
下载:https://arxiv.org/abs/2602.07666v4
七、行业总结与前沿趋势
1. 四大技术主流架构
- 多专用智能体分工:FirmAgent、GONDAR、VulTrial,拆分任务降低单模型推理难度,精度更高;
- ReAct 单工具增强智能体:KeaRepair、Code-Augur,循环调用编译 / 模糊测试工具,消除 LLM 幻觉;
- 编排记忆型渗透智能体:AWE、CHAP,顶层轻量 LLM 调度,持久记忆存储攻击上下文;
- 多模态 GUI 智能体:HackWorld 评测体系,面向可视化 Web 渗透,当前成熟度最低。
2. 当前通用瓶颈
- 长链路、百万行复杂代码推理断裂,上下文丢失严重;
- LLM 幻觉无法根除,必须绑定编译、沙箱、模糊测试做事实校验;
- 方案场景高度割裂:固件 / WEB / 微服务智能体互不通用;
- 缺少统一标准化评测集,CyberGym、HackWorld 仅覆盖单一漏洞类型。
3. 未来研究方向
- 通用一体化 Agent,跨固件 / Web / 代码全场景自适应;
- 检索增强 RAG 漏洞知识库,沉淀历史攻防经验;
- 多模态视觉渗透智能体优化,解决前端 GUI 交互短板;
- 统一跨语言、全漏洞类型标准化评测基准;
- 挖掘 – 验证 – 利用 – 防御端到安全闭环智能体。
文末福利
本文全部论文下载链接已整理完毕,涵盖 2026 网安 / 软工 / AI 顶会一手成果,可直接复制 arXiv、会议官网链接下载原文与开源代码,适合做 AI 安全、自动化红队、代码审计方向文献调研。
注:ASE/ISSTA/IJCAI/NeurIPS 尚未发布完整论文集,后续会议更新后将推出第二期补充综述。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:智安窥豹 智安窥豹
智安窥豹《顶会全景梳理|2026 全量 LLM 漏洞智能体论文综述》