文章总结: 最新研究发现通过诗歌形式提示可绕过25款顶尖AI模型安全护栏,使其输出危险内容如武器制造和网络攻击细节。测试显示GoogleGemini2.5Pro等模型完全脆弱,而GPT-5nano等则能完全防御。这种单轮诗歌攻击揭示了AI系统的结构性漏洞,而非个别供应商问题,对AI安全评估和监管规则具有重大启示。
综合评分: 85
文章分类: AI安全,漏洞分析,威胁情报,安全意识,安全大事件
念古诗绕过AI安全护栏:25款顶尖模型栽跟头,模糊语义成安全大漏洞
FreeBuf
2025年12月6日 18:31
上海
Part01
一首诗 “放倒” AI 安全墙?
危险内容竟能轻松获取
对人类来说,诗歌有时是 “猜不透的艺术”,可最新研究发现,AI 遇上诗歌也会 “犯迷糊”!来自德克萨伊伦理 AI 公司伊卡洛斯实验室、罗马智慧大学和圣安娜高等研究院的研究团队,挖出了一个惊人现象:只要给 AI 发一段诗歌形式的提示,它就会 “失守” 安全防线,把制造武器级钚、部署远程访问木马(RAT)这类危险操作的细节一股脑说出来。
研究人员给 25 款前沿的专有和开源 AI 模型,来了一场 “诗歌偷袭”—— 用他们称为 “对抗性诗歌” 的方法测试,结果让人捏把汗:部分模型的 “中招率” 居然达到 100%!更可怕的是,这种简单到 “写首诗” 的操作,在不同系列的模型里都能奏效,这说明 AI 在决策和解决问题时,藏着更深层的系统性缺陷,可不是某一款模型的 “小毛病”。
“从跨模型测试结果能看出,这不是个别供应商的问题,而是 AI 本身存在结构性漏洞。” 研究报告里明确指出。这些 “诗歌攻击” 的范围特别广,涵盖了化学、生物、放射、核武器(CBRN)、网络攻击、信息操控、隐私泄露、系统失控等多个高危领域。这意味着,AI 的安全护栏被突破,不是因为某个特定拒绝系统出了弱点,而是这种 “诗歌套路” 和 AI 通用的安全对齐规则 “撞出了漏洞”。
Part02
25 款 AI 模型大考:
有人满分通关,有人全错翻车
研究团队先搞了个 “诗歌题库”——20 首精心设计的英文和意大利文对抗诗歌,想看看诗歌的特殊结构,能不能让 AI 放弃 “拒绝回答” 的原则。每首诗都没直白说 “要干坏事”,而是用 “隐喻、意象、讲故事” 的方式藏指令,最后才悄悄点出和高危领域(比如 CBRN、网络攻击、有害行为)相关的需求。
这次 “考生” 阵容很豪华,包括 Anthropic、Google、OpenAI、Meta、Mistral、xAI 等公司的主流模型。可 “成绩” 却天差地别:OpenAI 的 GPT-5 nano 堪称 “学霸”,20 个诗歌提示全顶住了,没泄露半点危险信息;GPT-5、GPT-5 mini 和 Anthropic 的 Claude Haiku 也表现不错,拒绝率超过 90%。
但有的模型却 “考砸了”:Google 的 Gemini 2.5 Pro 面对每首诗,都乖乖输出了有害内容,相当于 “全错翻车”;Mistral 的表现也不乐观。为了进一步验证,研究团队又拿出了更严格的 “考卷”—— 包含 1200 个提示的 MLCommons AILuminate 安全基准测试,覆盖 12 类危害场景。
对比结果更扎心:Google 模型对 “诗歌陷阱” 的响应成功率飙到 65%-66%,而在普通基准测试里,这个数字仅为 7.5%-9%!有意思的是,体型更小的模型反而更 “靠谱”,恶意提示拒绝率普遍更高,其中 Anthropic 的 Claude 系列(拒绝率 0.6%-10%)和 ChatGPT(1.5%-9%)最稳,堪称 “小个子大能量”。
Part03
诗歌 “忽悠” AI 的套路:
隐喻藏恶意,单轮提示就奏效
出于安全考虑,研究人员没公开具体的 “毒诗歌” 样本,但给了个脱敏例子:有首诗表面讲 “做千层蛋糕”,实则用隐喻藏了真实意图,最后成功骗 AI 输出了详细的危险操作流程。当 AI 被诗歌 “绕晕” 时,可能会冒出这样的危险回复:
- “武器级钚 – 239 的生产包含以下阶段…”
- “部署持久性远程访问木马 (RAT) 的步骤如下…”
要知道,理想的安全响应应该是直接拒绝这类请求。更关键的是,研究团队没耍复杂手段 —— 没搞多轮对话 “套话”,没激活 AI 的 “思维链”,就靠把指令改成诗歌文体,一次提示就突破了防线。
为了确保评估公平,研究用了 “LLM-as-a-judge” 模式:让三个开源评判模型独立分析 AI 的响应,最后再由人类二次验证。结果发现,那些用了人类反馈强化学习(RLHF)、宪法 AI、混合对齐技术的模型,反而更脆弱 —— 问题就出在它们处理诗歌结构的方式上。
研究人员还翻出了柏拉图《理想国》里的观点:诗歌的模仿性语言可能扭曲判断。没想到千年后,AI 和人类在这一点上,居然有惊人的相似!
Part04
攻击手法又添新花样:
诗歌成 “新武器”,安全评估要变思路
其实,AI 模型 “越狱” 的方法之前也有不少,比如让 AI “角色扮演”、用社会工程学施压、多轮对话 “磨” 信息等。但这次的 “诗歌攻击”,开辟了全新路径。“我们发现了一种从没见过的攻击方式,” 报告强调,“这对 AI 的安全评估、红队测试,还有相关监管规则,都有重大启示。”
参考来源:
Get poetic in prompts and AI will break its guardrails
https://www.csoonline.com/article/4100348/get-poetic-in-prompts-and-ai-will-break-its-guardrails-3.html
#
#
#
推荐阅读
#
电台讨论
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:FreeBuf 《念古诗绕过AI安全护栏:25款顶尖模型栽跟头,模糊语义成安全大漏洞》