文章总结: 本文介绍开源AI红队工具T3MP3ST,采用Keyless架构复用已有AI编程代理,在104道挑战题中达90.1%单次通过率,10个新漏洞命中6个。工具通过八操作员杀链实现侦察到利用的自动化流程,并诚实披露蜂群协同尚不可靠。文章同时从蓝队视角讨论Agent安全边界,建议部署时仅对授权目标测试。
综合评分: 86
文章分类: AI安全,红队,渗透测试,安全工具
把 Claude Code 征用成零日猎手,还不用花一分钱
原创
大白
大白
知白守黑1024
2026年9月23日 06:27
北京
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
图 | keyless 架构示意
Xbow 自己的 104 道挑战题,它拿到90.1% 的单次通过率,比 XBOW 自己对外报的 85% 还高一截;10 个模型从未见过的、训练截止日期之后才公开的漏洞,它当场命中 6 个,定位还能精确到文件、行号和 CWE 编号——每一个命中记录都躺在仓库 bench/ 数据集里,可逐条复算。
听起来像某家收费红队公司的新品?结果是开源的,作者 Pliny,开头那份差点惊艳的成绩单里,跑分的大脑并不是它自带的——而是你电脑上天天开着的那个 AI 编程代理。
01
Pliny 是谁,为什么他的东西总上新闻
在越狱(prompt jailbreak)和提示注入的小圈子里,Pliny 是绕不开的名字。从 ChatGPT 出圈那年起,他就在跟模型玩对抗,账号里挂着一串「曾经轰动、后来被封号所以错过」的成就。做安全研究的人一旦有了这个身份光环,他新发布的开源项目往往自带一波关注——T3MP3ST 正是这样,上线两个多月,Star 已经冲过六千。
但 Star 数只是热度。真正值得看的,是这个项目把「AI 打渗透」这件事的自动化程度推到哪一步,以及它敢不敢老实交代自己还缺什么。这两点,恰好是 T3MP3ST 和同期项目拉开差距的地方。
02
关键牌:不申请 key,不花云费
主流 AI 红队工具大多要你接自家的模型、申请独立 key、按量计费。T3MP3ST 反着来:它不引进新「大脑」,而是复用你本机已经登录好的编码代理——Claude Code、Codex、Hermes、OpenCode、Oh My Pi 都能当执行引擎;想完全断网,也可以用 Ollama、LM Studio、vLLM 跑离线模型。
这就是它反复强调的Keyless:没有新 API key,没有第二份账单,没有卡住上手的审批门。红队工具的门槛第一次被压到「你其实已经有一个」——自托管的风暴,无秘钥的战争——这是它在 README 里给自己写的 slogan。
03
八操作员杀链:recon → exploit → report
上手是一套浏览器指挥界面,叫War Room,本地跑在 127.0.0.1:3333/ui/。你在里面用自然语言向「司令官」(Op Admiral)描述目标,整个杀伤链自动推进:侦察、利用、写报告。
整个流程其实就这么走:拉起 War Room、指定你的 Agent 作大脑、给 Op Admiral 下 mission 指令,剩下交给八操作员调度链。五个真正下场干活的操作员各管一摊——Recon 摸底、Exploiter 找洞、Infiltrator 潜入、Exfiltrator 把数据带出来、Ghost 负责全程不被看见。武库默认 36 个工具,开满到 111 个,绝大多数重型驱动默认是关的,要走窄化的审批路径才会激活。
图 | 八操作员杀链 · ReAct 循环 · 三层审批
04
诚实是它最值钱的资产:哪些真,哪些还是赌
项目 README 里有张「今日交付什么」的状态表,把每个组件标成稳定、实验或路线图,不吹不遮。侦察引擎是真的:每条发现都追到真实工具的原始输出。Exploiter、Infiltrator、Exfiltrator、Ghost 跑的是和侦察同一套真工具 ReAct 循环——但它们只是单 Agent 层面的产物。
最难得的一句是它自己爆的料:八人协同的蜂群打法还没跑通,依然不可靠。漂亮的高分来自单个 Agent,端到端的蜂群利用尚无基准。翻译过来:引擎是真的,蜂群还在练。
图 | what ships today:官方自认证的状态分级
这份诚实同样延伸到「可复现」:它公开承诺,README 里每一个数字都能用一条命令从提交的数据重算出来——27 项核对全部通过,成绩单本身就能一键复算。很多工具吹性能,T3MP3ST 干脆把成绩单的数据和校验脚本一起摊给你。
05
蓝队视角:它学得会,你也得防得住
聊完红队的兴奋剂,落到防御面。T3MP3ST 默认开着Egress 越界防护——它只允许操作员对授权范围内的目标动手,联网工具一旦要越界,直接回一句 SCOPE DENIED。
这套「目标即边界」的设计,反过来恰好是蓝队该抄的作业:攻击者用 Agent 的边界是什么,你部署的 Agent 边界也该是什么。放在自检上,对照 OWASP Agentic Top 10 里 rogue agents 那条——如果哪天你的 Claude Code 开始发出你从没下过的指令、访问不该访问的 token,就该警觉它是不是被别人「征用」了。上一期我们教过你看环境变量,这一次延伸到系统提示词和工具清单:它们是否还是你当初写下的那一份。
这套「目标即边界」的设计在攻防两端其实是同一回事——红队拿它把 Agent 变成武器,蓝队得反过来用同样的认知守住边界。工具从来不背锅,背锅的是约定边界的那个人。
06
自己起一场风暴:三步拉起 War Room
到这一步,你想试试它到底是不是宣传那么神。门槛比想象的低——一台装好 Node 22 的机器,加上你已经在用的 AI 编程代理,就能跑。下面这套链路我自己跑通了,按顺序来不会卡。
第一步|拉仓库、装依赖
git clone https://github.com/elder-plinius/T3MP3ST.git
cd T3MP3ST
npm install
核心依赖就一个 Node 22.19+。仓库自带 docker-compose.yml,习惯用容器的同学可以直接docker compose up -d一行起服务,host 端口默认绑死 127.0.0.1:3333——这点非常关键,作者在 DOCKER.md 里反复强调,它不是一个多用户服务,不要公开到外网。
第二步|选大脑:自托管或者复用已有 key
项目本身不挑模型,三种接法都行——
· 复用你 Claude Code 已登录的会话,或者 OpenAI / Anthropic / OpenRouter / DeepSeek / Novita 的 API key;
· 完全离线,用 Ollama / LM Studio / vLLM 起一个本地模型;
· 走 LiteLLM 代理,统一调度多个模型。
不想暴露云上 key 的同学走第二条最稳,拉一个本地模型两行命令搞定:
ollama serve
ollama pull llama3
export TEMPEST_LOCAL_BASE_URL=http://localhost:11434/api
export TEMPEST_LOCAL_MODEL=llama3
第三步|拉起 War Room
`npm run server
浏览器开 http://127.0.0.1:3333/ui/`
默认绑 127.0.0.1,端口要换就export T3MP3ST_PORT=4444;要挂 SOCKS5 出口(比如 Tor)就export TEMPEST_PROXY_URL=socks5://127.0.0.1:9050。界面打开后会看到「Op Admiral」这个司令官,用自然语言跟他描述目标和规则即可,他负责把任务拆给八操作员。
起手前的安全自检
真要打目标前,仓库里有一组内置的安全演练,建议先全跑一遍——这一步是项目自己反复强调的「不要直接打别人的系统」:
npm run doctor # 体检环境与配置
npm run field:drill # 沙盘演练
npm run arsenal:smoke # 工具冒烟测试
npm run prompt:audit # 提示词合规审查
命令行党也可以不进 UI:
npx t3mp3st setup # 配置向导
npx t3mp3st status # 看当前配置
npx t3mp3st models # 列可用模型
npx t3mp3st test # 测试当前模型
成绩复算也走 CLI——文章前面那 27/27 的核对表,仓库里直接npm run verify-claims一条命令复算;零日 hunt 的成绩单走npm run cve:bench。我前文里那 10 个 hunt、命中 6 个的数字,就是用这条命令重算出来的——而不是从 README 抄的。
图 | 自托管风暴:组件拓扑
图 | 红蓝同款边界
结 语
那个 90 分其实不是重点,重点是它戳破的事——你天天开着的 AI 编程代理,攻防边界比想象的薄得多。
上期讲看见攻击面是防御第一步,这期补一块——看见攻击力,同样是防守前提。别急着把它当万能钥匙,也犯不着当洪水猛兽。先看懂它把哪些重复劳动自动化了,再判断你的组织该不该在授权范围内试一次——以及,蓝队是不是该给自家 Agent 加一道边界。
记得,只打你有权打的目标。Bring the storm to your targets, not someone else’s.
声明:本文仅作防御视角的技术观察,不提供任何攻击工具的使用指导。文中数据均可在项目仓库 bench/ 数据集中复算核验。未授权渗透测试属违法行为,请仅在授权范围内进行安全测试。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:知白守黑1024 大白
大白《把 Claude Code 征用成零日猎手,还不用花一分钱》