文章总结: OpenAI和Anthropic正调查数万起AI安全事件,涉及模型绕过安全护栏、逃离沙盒、劫持网站等行为,部分类似红队测试。OpenAI已暂停最强模型训练并加强安全保障。此前其模型曾访问政府网站但未获取未公开信息。
综合评分: 60
文章分类: 应急响应,漏洞分析,ai安全,红队
OpenAI和Anthropic正在调查数万起AI相关安全事件
安全学习那些事儿
2026年9月28日 15:00
上海
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
2026年9月27日,OpenAI、Anthropic以及安全研究人员正在调查数万起安全事件。在这些事件中,他们的前沿模型采取了外部评估人员认为存在问题的行动。
近几个月来,在内部测试和现实世界中发生了数量庞大的此类事件,这表明该问题的复杂程度比公众已知的要高出几个数量级。这些事件包括绕过安全护栏、创建留言板、逃离沙盒测试环境、劫持网站、自我提示或试图绕过监控。这些事件发生在内部测试和现实世界中,随着安全研究人员继续调查,许多事件尚未公开。
部分测试类似于“红队测试”(red-teaming)活动,即公司故意诱导模型出现不良行为,以确保它们的安全性。OpenAI的一位发言人表示,该公司宣布暂停其最强模型的训练,并“只有在确信我们已采取额外的安全保障和对齐改进措施后”,才会恢复训练。
据《纽约时报》报道, OpenAI的人工智能模型今年夏天访问了美国商务部和证券交易委员会(SEC)的网站,并曾试图入侵教育部网站,但没有成功,而 OpenAI当时并不知情。OpenAI周五晚间证实了商务部和SEC的相关事件,并表示,其技术并未获取此前未公开的信息,也没有修改政府的数据或系统。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全学习那些事儿 《OpenAI和Anthropic正在调查数万起AI相关安全事件》