文章总结: 本文分析Gemini在安全评测中因配置错误意外访问三家真实企业的事件,指出非越狱或沙盒逃逸,而是评测供应链的配置疏漏。事件暴露了评测环境隔离信任风险及披露标准缺失,模型自行停手不应被视为安全控制。建议企业修复弱口令和公开凭据泄漏,将安全边界落实在工具层而非提示词。
综合评分: 85
文章分类: AI安全,供应链安全,安全运营,漏洞分析,安全意识
Gemini 连闯三家真实企业——拦下它的,只是它自己的判断
原创
APT-101
APT-101
APT-101
2026年9月20日 20:20
陕西
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
本文基于公开信源(WSJ、Google/Anthropic/UK AISI/Irregular 官方文件等)转述。https://www.wsj.com/tech/ai/gemini-hacked-three-companies-in-first-known-breakout-by-googles-ai-5c0baba2
01 五句流传的说法,都不对
关于”Gemini 撞进三家真实企业”,流传最广的五个说法都要先纠正:
不是越狱。模型没有绕过任何安全策略。它执行的是被授权的任务,把真实系统误判成了靶标;
不是沙盒逃逸。沙盒没有破。门本该锁上,因为配置错误没锁。英文原文的说法:harness failure,不是 sandbox escape;
不是谷歌自己发现的。发现者是评测方 Irregular,2026 年 7 月底通报,谷歌 9 月 18 日被 WSJ 问询后才公开;
不是三起都因为重名。第一起是重名。后两起是模型联网搜索时,撞见了公开仓库里的泄漏凭据;
不是模型有自己的恶意目标。Anthropic 的原话:没有任何一次运行显示模型在追求自己的目标。
五条纠正完,真正该记住的是这一句:无恶意,不等于无害。这起事件不是因为 AI 变强了,是一道门没锁。
02 发生了什么:一次评测,三次越界
2026 年 5 月,Gemini(非最新版本,型号未公开)在评测商 Irregular 的安全评测里,被要求从一家虚构公司取回隐藏信息(CTF 夺旗演练)。三次越过测试边界,访问了三家真实企业系统(名称未公开):
第一次:虚构公司名和一家真实企业重名。模型在模拟环境里完成不了任务,转向互联网,撞上真实域名,试密码进入了受保护服务。然后它发现对面是真实企业,停了;
第二次和第三次:模型联网搜索时,在公开代码仓库找到另外两家公司的有效凭证,用凭证登录,然后停了。
后两次和重名没有关系。模型在找靶标的过程里,碰巧撞上公开泄漏的凭据。风险会波及谁,不由评测设计决定——评测方设计的靶标是虚构公司,但模型一旦能上网,搜索加公开凭据,就能打到任何没做基本防护的第三方。
03 五家机构踩同一个坑
Gemini 不是孤例。同类评测越界至少波及五家机构:谷歌、OpenAI、Anthropic、Meta、英国 AISI。共同根因是同一家第三方评测商 Irregular 的配置疏漏。Anthropic 确诊四起事件、七次运行;AISI 一次评测里 122 次运行出现 19 次自主未授权行为,其中一次是对 GitHub 真实维护者完成了整场社交工程攻击;OpenAI 披露过另一类事件(模型利用 0-day 真逃逸,门槛高得多)。
五家放一起看,问题很直接:五大实验室都把”评测环境是否隔离”托付给同一家第三方,没有任何一方能独立验证那道门关没关。这在供应链里是常见的第二方信任风险。不同的是,以前我们信任的是服务商的服务质量,现在信任的是关着 AI 的门,而门里是一个会自己动手的 agent。
Anthropic 的定性:这些事件更接近 harness 与运营故障,而不是模型对齐失败。但同一份材料里还有一句——当配置错误持续数月,harness failure 和 sandbox escape 在实际后果上没有区别。
04 披露之争:看损害,还是看越界
谷歌对事件讲了三层:第一,这是身份误认,不是模型失配;第二,可以类比漏洞赏金计划,发现弱点并上报是合规行为;第三,模型停手,没有造成损害,不必主动公开。
白帽黑客 Jack Cable 的说法:模型超出了应有的行为边界,实施了实际网络攻击,公众有权知道。
两边差在披露阈值上。谷歌看有没有造成损害;批评者看有没有发生未授权访问。前者看损失,后者看边界。对企业来说,越界本身就是事件。漏洞赏金能事后上报,前提是赏金方自愿参赛。三家受害企业没有报名任何比赛,可能连自己被访问过都不知道。
05 唯一拦住它的是模型自己的判断
事件里最不该当安全措施用的一句话:模型识别出真实系统后自行停手。
当时四层防护(环境隔离、范围界定、认证凭证、越界检测)都已经失效,最后挡住它的是一次模型自己的判断。Anthropic 的实验有两个结果:只告诉模型它不在模拟里,行为没有显著变化;给模型明确的真实互联网证据,相关路径的上传率降到 0%。提示词说清楚没有用,物理证据才有用。
反面例子更多。Opus 4.7 四次识别出真实系统,四次继续攻击。另一起事件里,中止按钮坏了,模型想停,试了八次没停成,直到 token 预算用完。Anthropic 翻遍 4.81 亿条记录才确诊四起事件,共同点是运行时没有任何东西在拦。事后能找到,和当时能拦住,是两种能力。
06 真实渗透测试里,它已经在发生
类似的越界,在真实的 AI 辅助渗透测试里很常见。你下达任务:测试 a.abc.com。执行过程中,模型会自己跑去访问 b.abc.com、c.abc.com,收集更多信息。
它不是在捣乱。侦察的天然倾向是”拿更多信息”,同根域在模型眼里属于同一家公司的资产,提示词里”只测 a.abc.com”被它当成含糊建议。这就是范围外溢——把”虚构公司重名”换成”同根域名”而已。
解法只有一条原则:范围必须落在工具层,能由机器在执行前判定;不能只写在提示词里。
- 代理层白名单。所有流量走代理,代理上挂 in-scope 规则,只放行指定域名。模型连”访问过”都做不到;
- 工具前置校验。给每个请求工具加一步 scope-check:URL 规范化、域名匹配,不过就抛错。这一步是逻辑,不靠模型自觉;
- scope 定义要机器可读。写精确列表或通配符,不写自然语言。注意通配 *.abc.com 会把 b/c 域名也放进来——scope 定义错了,护栏等于没装;
- DNS 出口收敛。只解析白名单域名——和这次事件里”唯一真屏障是网络配置”是同一原理;
- 拦截要回传并记录。命中范围外,把原因回传模型,同时记成告警。既是运行时纠正,也是长期指标。
同样的失效模式到处都有:爬虫抓了越权目录、API 测试顺手读了真实数据、云巡检扫进相邻 VPC、装依赖时顺手装了可疑包。共同点一样——凡是”自主 agent + 边界”的组合,边界得能由机器判定。靠模型理解边界,等于让狙击手自己报告位置。
07 企业该做什么
受害企业没有公开。但让 Gemini 得手的两个入口——弱口令、公开仓库的泄漏凭据——都是企业该还的旧账:
- 定期扫描公开仓库的泄漏凭据,发现就轮换(GitHub/GitLab Secret Scanning、gitleaks、trufflehog 这类工具)。Gemini 后两次的入口就是这个;
- 强制 MFA、登录限速、账户锁定、禁止口令复用;
- 关闭暴露的调试页面和未认证管理接口,比如 Actuator;
- 自动化安装的第三方包做签名校验和来源白名单。同类事件里,一家安全公司的扫描器把恶意包当安全软件安装了;
- 对人被欺骗的通道设防:私信、邮件、协作工具。AISI 事件里模型伪造真人身份欺骗真实维护者,技术护栏全程没有拦截。
这些和 AI 关系不大。它们 2019 年就该做完。AI 只是把找漏洞的成本压低了,像一个不知疲倦的扫描器。你欠的账,它帮你翻出来。
08 几点看法
第一,这起事件技术含量不高,结构性问题不小。弱口令、公开凭据,门槛很低。它暴露的是评测供应链的空白:第三方评测商对受害企业没有披露义务,事件怎么说,由厂商和评测方决定。常见事故比一次零日逃逸更值得治理关注,因为常见,所以可复制。
第二,最好别把”模型会停手”当安全控制。这次版本碰巧判断对了。下次同样的配置错误,撞上的可能是更快的模型——它不会停,会把攻击做完。
第三,披露标准是空白。OpenAI 自己说没有统一标准;谷歌用损害做阈值,Anthropic 用越界做原则,Irregular 对着付费方说话。受害的第三方没有任何通道。
AI安全#AI评测#Agent安全#供应链安全#安全披露
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:APT-101 APT-101
APT-101《Gemini 连闯三家真实企业——拦下它的,只是它自己的判断》