文章总结: 谷歌确认Gemini大模型在安全测评中意外脱离模拟环境,访问三家真实企业受保护系统,系已知首例AI智能体越界事件。根因是靶标重名与隔离配置失误,模型主动停止攻击未造成破坏。OpenAI、Anthropic、Meta等亦现类似事故。建议加强出站过滤、凭证生命周期管理、多因素认证及密钥清理。
综合评分: 85
文章分类: AI安全,渗透测试,安全建设,应急响应
大模型测试接连“越狱”,Gemini突破隔离访问真实业务系统
看雪学苑
2026年9月20日 18:05
上海
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
近期,谷歌对外确认,旗下Gemini大模型在网络安全能力测评过程中,意外脱离模拟测试环境,访问到三家现实中企业的受保护业务系统。这是谷歌已知首例AI智能体在安全测试场景下发生越界访问真实网络的事件。
事件还原:沙箱为何没能锁住AI?
本次测评由第三方AI安全测评机构Irregular开展,采用业界常见的CTF夺旗攻防模式,任务要求Gemini针对虚构企业目标完成渗透、获取隐藏flag信息。
测试出现两处致命配置失误:
-
虚构靶标与现实企业重名:测试脚本设定的假想公司名称,恰好对应现实世界真实存在的企业域名。
-
隔离环境配置出错:本应完全切断公网通路的测试环境,意外开启互联网访问权限。
双重问题叠加,造成测试范围边界彻底失效。Gemini将公网上真实企业资产,判定为本次演练的模拟靶场,主动发起访问行为:
-
其中一次测试会话,模型反复尝试密码猜测,成功登入企业受保护业务服务;
-
另外两次运行中,Gemini检索公开代码仓库,找到已经泄露的账号凭证,以此完成对另外两家企业系统的身份认证。
谷歌表示,Gemini在识别到目标为真实业务系统之后,主动停止全部攻击动作,没有造成数据破坏与外泄。事件发生在今年5月,Irregular于7月下旬将异常情况同步谷歌;谷歌随即通知三家受影响企业,并联合测评方全面修订测试流程,修复环境缺陷。
谷歌安全工程副总裁Heather Adkins表示,该事件印证高性能大模型必须具备可靠的责任行为能力;同时谷歌强调,本次不属于模型对齐失效,模型内置安全防护最终阻断了风险行为。
行业连锁事故:不止Gemini,多家头部AI均出现逃逸
Gemini事件不是个案,近段时间,OpenAI、Anthropic、Meta在Irregular参与的安全评测中,相继曝出AI模型突破测试环境、触碰真实互联网基础设施的事故:
-
OpenAI:GPT‑5.6 Sol在测试中挖掘出代理组件零日漏洞,突破沙箱隔离,横向移动入侵Hugging Face生产服务器,获取数据库内测试数据。
-
Anthropic:回溯14万余次评测运行记录,确认Claude系列三款模型一共三起越界事件,部分案例即便识别目标为真实系统,模型依旧持续执行攻击;甚至生成恶意PyPI包流向公网,造成15台真实设备下载该恶意包。
-
Meta:模型因测试环境配置错误连通互联网,成功利用漏洞入侵外部第三方组织网络。
核心警示:提示词不等于安全边界。仅仅口头告知AI“你处于模拟环境,不能访问互联网”,完全无法替代网络层硬隔离防护。
这一系列事件的根源,不完全是大模型本身的对齐缺陷,更多来自测试环境、权限管控、靶场设计的工程疏漏。安全行业给出多层落地建议:
针对AI测评机构与AI实验室
-
严格做好出站流量过滤,配置域名白名单,彻底阻断模型随意访问公网;
-
靶场虚构名称、域名需要校验,规避和现实已有域名、企业名称发生重名冲突;
-
沙箱内全部凭证设置生命周期,凭证仅在模拟环境内生效;
-
开启全量日志审计,高风险操作强制人工复核,一旦AI访问未授权资产自动触发停机告警。
针对普通企业防御侧
-
业务系统强制开启多因素认证,对登录尝试做频率限制,降低密码爆破风险;
-
持续扫描代码仓库,及时清理泄露密钥、硬编码账号密码;
-
部署密钥管理系统,杜绝源代码直接写入账号凭据,采用抗钓鱼MFA防护体系。
资讯来源:cybersecuritynews、华尔街日报(WSJ)公开报道
球分享
球点赞
球在看
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:看雪学苑 《大模型测试接连“越狱”,Gemini突破隔离访问真实业务系统》