文章总结: 本文报道了一场100小时不间断的Agent自主渗透测试挑战,在VulnHouse靶场上完成464道题,233次验证通过,累计得分19340分。挑战展示了Agent在速度、吞吐、持续性和自主破局方面的能力,如54秒通关和33分钟自主破局案例。文章指出长程Agent能力转化需依赖任务环境、验证机制和工具链支撑,为渗透测试Agent工程化提供了量化参考。
综合评分: 75
文章分类: 渗透测试,AI安全,红队,安全工具
一场100小时的Agent自主渗透跨越式实战检验
数说安全
2026年9月23日 11:31
辽宁
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
9月7日上午10点,“赛博司机计划:100小时不间断Agent渗透测试挑战”在斗象科技旗下漏洞盒子平台和众多白帽社群开启同步直播。
此后的100小时里,白帽客户端“蛙池AI Desktop”搭载长程任务专用Sonic Harness,在高难度渗透评测靶场VulnHouse上持续作业。从读取任务、分析目标环境、调用工具、构造利用方案,到提交攻击证据,核心渗透过程均由Agent自主推进。
对网络安全行业而言,这场挑战提供了一个观察窗口:当测试从单次任务延伸到100小时连续作业,Agent能否持续推进、如何应对受阻,以及结果能否得到验证,都有了更具体的呈现。
4天4夜后,史上首次Agent自主渗透直播的最终战报定格为:
从基础Web题型,到真实CVE复现,再到复杂攻击链、白盒源码审计和内存安全PoC构造,AI Agent在100小时内完成了从“标准路径”到“自主破局”的多轮检验。
01靶场底座:VulnHouse如何评测Agent自主渗透
100小时不间断Agent作业,既考验Agent,也考验评测平台。持续供题、稳定部署环境、独立验证结果和完整记录过程,是观察长程自主渗透能力的重要前提。本次挑战中,VulnHouse承担了这些底层支撑工作,让成绩之外的执行过程也能够被追踪和复盘。
(一)VulnHouse定位:对标国际前沿Benchmark,一座为AI量身打造的训练场
在AI漏洞挖掘领域,美国伯克利大学发布的CyberGym、斯坦福大学人工智能实验室发布的BountyBench、伊利诺伊大学香槟分校的CVE-Bench等前沿Benchmark已经提供了具有代表性的标准化测试基准。
以CyberGym为例,其以Google OSS-Fuzz历史漏洞为主要来源,将真实漏洞封装成统一实例,重点考察Agent分析源码和构造PoC的能力,并通过差分崩溃判断结果。
VulnHouse与CyberGym有共同基础:两者都采用真实漏洞环境,都要求Agent完成从分析到验证的任务,也都通过环境结果对Agent提交的答案进行独立判定。区别主要体现在平台目标和使用方式上:
CyberGym提供统一的公共标尺,适合比较不同系统在相同条件下的表现。VulnHouse更强调训练过程的可配置性,团队可以根据Agent的能力短板调整题目组合、提示等级和验证方式,再通过每次运行留下的数据寻找后续优化方向。
如果用考试场景作比,CyberGym接近统一命题、统一判卷的标准考试;VulnHouse则是一座长期开放的Agent训练与测评中心,既能组织规模化测试,也能根据训练目标调整题目,并完整记录每次执行过程。
这也是100小时直播采用高难度渗透评测靶场VulnHouse的核心原因。长程Agent评测需要的不只是一套题目,还需要能够持续供题、部署环境、独立验真和记录全过程的基础设施。VulnHouse承担的,正是这部分训练与验证工作。
三项能力共同构成“出题、编排、执行、验证、观测、复盘”的训练闭环。VulnHouse关注最终成绩,也记录成绩产生的全过程,包括Agent采用了哪些方法、在哪些环节调整策略,以及不同版本的能力变化。
(二)渗透评测体系:多类型覆盖,三级难度,数百道题
截至目前,VulnHouse 已上架数百道题目,涵盖两大主要分类:
难度分布上,VulnHouse的题目分为简单、中等、困难三个等级,整体呈现“中间厚两头薄”的橄榄型分布。这主要来自真实漏洞在利用条件、攻击路径和环境依赖方面的复杂度差异。
从题目内容看,平台上同时存在两类风格截然不同的靶机:
- 黑盒 Web 渗透题: 经典CTF风格,如SQL注入绕过、XSS跨站系列、SSRF多容器联动、JWT算法篡改、PHP反序列化、SSTI模板注入等。这类题目通常以Flag捕获为验证策略。
- 白盒内存安全审计题:来源于真实开源项目的安全审计,覆盖 libxml2、Wireshark、ImageMagick、OpenCV、PHP、cURL、HarfBuzz、nDPI、llama.cpp 等数十个项目。Agent 需要分析源码、理解漏洞成因、构造 PoC 触发崩溃。这类题目以 PoC 崩溃为验证策略,部分采用双容器差分判定。
此外,题库中还包括Apache Struts2、Spring Cloud Gateway、WebLogic、Shiro和JBoss等知名组件的CVE复现任务,用于考察Agent对漏洞情报、目标版本和实际运行环境的综合判断能力。
(三)独立判分:四种验证策略与验证引擎
不同类型的漏洞,对“完成任务”的定义并不相同。读取敏感文件、执行系统命令、触发程序崩溃和改变业务状态,需要分别采用适合的判定方法。VulnHouse为此设置了四种验证策略:
Flag捕获(flag_capture)是最经典的 CTF 模式,用于Web渗透与信息读取类题目,在容器指定路径写入随机Token,Agent须通过漏洞利用读到并提交,支持精确、包含、正则三种匹配;
效果证明(effect_proof)适用于需要在目标环境产生可观测变化的题目,由出题者定义一组检查命令与预期输出,验证时逐项比对实际环境变化;
PoC崩溃(poc_crash)是最接近 CyberGym 判定逻辑的策略,用于源码审计与内存安全题目,要求Agent构造的输入使目标程序触发崩溃(由ASan等工具检测),并支持单容器检测与”vul崩、fix不崩”的双容器差分判定;
Oracle 校验(oracle)则最灵活,由出题者提供自定义验证脚本、输出JSON判定结果,支持操作前后双阶段对比,主要处理业务逻辑与复杂攻击链类题目。
题目做对了没有,也不是Agent自己说了算的。VulnHouse 内建了一套完整的 Verification Engine(VE,验证引擎),负责全流程的判定工作。每次判定都经过“证据采集-证据比对-裁决-证据链封装”四步流水线,并生成基于哈希的防篡改校验值持久化。对于Flag捕获类题目,返回给Agent的信息还会做脱敏处理,防止它通过验证接口反向套取答案。
02Sonic Harness:蛙池AI Desktop为何装载这个Harness参赛
支撑本次长程任务挑战的,是蛙池 AI Desktop装载的Sonic Harness。
相比短时任务,长程执行更容易出现上下文膨胀、结果缺乏独立核验、进程中断后难以续跑等问题。
针对这些难点,Sonic的解决方式是把漫长的任务链拆成一个个可以交接、复核和恢复的任务回合,再通过MEA(Manager/Executor/Auditor)三角循环架构,把规划、执行和审计交给三个彼此隔离的角色。
Manager负责拆解目标和调整策略,Executor每轮使用全新上下文执行任务,Auditor则通过只读工具独立复核结果,避免Agent“自己执行、自己证明”。同时,Harness作为唯一的状态写入方,会持续保存每一轮的任务合约、执行结果、证据和审计记录,让整个过程有据可查。
即使运行过程中出现接口异常、进程退出等情况,Sonic也能从最近一次有效状态继续执行。相比依赖一段持续膨胀的超长会话,Sonic通过一轮轮可复核、可追踪、可恢复的任务回合推进长程执行,更适合100小时这类持续运行场景,也为后续进入实际安全任务提供了基础。
在完成本次100小时挑战后,Sonic Harness也将作为官方严选Harness,于10月正式上架「蛙池AI-蛙伴市场」,面向广大白帽子开放使用。届时欢迎大家在真实场景中体验,并提出宝贵意见。
03 战报总览:464题、233次验证通过、19340分
口径说明:464道是任务集总量,而非”应做尽做”的分母,其中有167道在100小时窗口内未进入有效执行。因此更公允的两个口径是:对”实际跑完验证”的297道,通过率78.5%;对全部464道任务,通过率50.2%。后期题目逐步进入复杂攻击链、源码审计和内存安全验证,难度上升,阶段成功率与最终累计通过率不宜直接混用。
(一)100小时过程拆解:高位运行与难度爬升
在挑战前72小时,Agent完成217道题目的阶段统计,其中197道成功,累计成功率达到90.8%。
9月8日的高效推进阶段,Agent每小时处理5至6.25道题,按这一速度折算,峰值日处理量约为120至150道。
随着题目不断推进,Agent面对的目标也在变化。前期任务更多集中在利用路径相对明确的Web漏洞和已知CVE,后续逐渐进入复杂攻击链、源码审计和内存安全验证。这意味着,前72小时的高成功率并非来自题目简单,而是Agent在标准路径明确、工具链匹配度高的任务上形成了稳定吞吐。
后28小时单体命中率的回落并不意外,它对应的正是CyberGym类评测中Level降低、信息减少后成功率自然下降的规律,题目越接近”真实世界的零信息发现”,对Agent的长程推理、环境适应与工具自制能力要求越高,这种落差本身就是一份关于”能力边界随难度移动”的量化样本。
100小时直播完成画面
(二)关键案例:54秒通关与33分钟自主破局
1. 最快通关:CWE-200信息泄露,54秒一次提交通过
CWE-200 信息泄露任务,是本次挑战的最快通关纪录。从环境启动、任务分析、证据提交到验证通过,全程仅用54秒,且一次提交即通过。
这道题集中体现了Agent在”三要素高度匹配”时的速度优势:目标明确(进程列表信息直接暴露在HTTP响应中)、漏洞入口可直接访问(GET请求即可触发信息泄露)、Flag内容可见(读取Flag文件的命令行及其stdout内容被直接渲染到HTML)。当这三者对齐时,”分析—执行—验证”可以在一分钟内形成闭环,几乎不需要试错。
54秒这个数字的意义不在于”快”本身,而在于它标定了蛙池AI在”标准化可解题”上的吞吐上限。
Agent任务完成画面
2. 复杂破局:标准路线受阻,Agent从本地环境找到突破口
如果说CWE-200展示了”顺风局”,JBoss反序列化任务则展示了”逆风局”下Agent如何工作。
任务执行过程中,Agent确认漏洞入口后发现环境中既没有Java,也缺少生成序列化载荷的工具。它一度尝试使用Python手工构造载荷,评估成本后及时放弃,转而通过代理镜像获取ysoserial。
由于直接下载JDK连续超时,Agent开始搜索本地软件目录,最终找到Adobe Animate自带的JRE。借助这套现成环境,它生成并修正载荷,成功完成远程代码执行。
整个过程耗时33分11秒,共调用工具104次,经历6次策略转向和3次主动修正。
这个案例的价值在于它打破了”AI Agent只会按预设脚本做题”的刻板印象。当常用工具和标准路径无法直接使用时,Agent能够根据环境反馈调整方案、停止低效尝试,并从目标环境中寻找可用资源,最终重新完成从载荷构造到结果验证的闭环。
04 从成绩单看Agent自主渗透的前景
这场100小时直播提供的不只是一组成绩数据,也呈现出长程Agent进入安全工作流所需的基础条件。
第一,速度。在工具链高度匹配的任务上,Agent可以在54秒内完成从环境启动到验证通过的全过程。
第二,吞吐。高效推进阶段每小时处理5至6.25道题,峰值日处理量折算约120至150道,说明Agent具备批量连续作业能力。
第三,持续性。连续48小时的四个观察窗口中,成功率均保持在约90%,100小时内完成297道题的执行与验证。
第四,自主破局。在JBoss反序列化任务中,Agent面对缺少Java、缺少工具、下载超时的环境,能够放弃低效路径,搜索本地资源,最终完成RCE。这已不只是“按模板打题”,而是根据环境反馈动态调整策略。
从这次挑战可以看到,长程Agent的实际表现不只取决于模型规模。任务环境是否丰富、结果验证是否准确、过程能否追踪、异常是否可以恢复,以及每轮测试能否快速形成迭代依据,都会影响Agent能力向安全生产力转化的效率。
另外,必须承认的是,Agent自主渗透当下仍存在明显局限。面对环境复杂、工具缺失或路径判断失误的情况,仍可能出现反复尝试、效率下降等问题,稳定发挥依然离不开Harness、工具链和验证机制的共同支撑。
渗透测试Agent的工程化探索仍要继续,本次100小时挑战留给研究人员的命题也由此清晰:如何让Agent的实战能力从单点能力竞争,走向完整工程体系的竞争,最终沉淀为可验证、可规模化、可调用的安全生产力。
点击阅读原文
或复制下方链接到浏览器
可下载完整报告pdf
👇
https://m-wiki.freebuf.com/article-detail?id=230327
(2026.02.31数说安全发布)
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:数说安全 《一场100小时的Agent自主渗透跨越式实战检验》