文章总结: 这篇文章系统总结了大语言模型的提示词注入和越狱方法,从简单的角色扮演到复杂的多层语义嵌套技术。作者指出随着AI安全护栏加强,传统单一方法已失效,必须结合角色扮演、场景设定、元指令覆盖等多种技术才能有效攻击。文章提供了具体案例和实战经验,强调多轮对话和单轮对话的不同攻击策略,并介绍了针对多模态模型的攻击方法。
综合评分: 85
文章分类: AI安全,渗透测试,漏洞分析
乱拳打死老师傅,提示词注入和大模型越狱方法有一套
原创
纪我死去的昨天
缺月追寻
2025年12月13日 09:01
文莱
0x00 引言
相比于我刚学AI安全时,现在AI安全有了较大的发展,但是我仍然见到很多师傅在用老的方法进行测试,在现有的安全护栏已经很成熟了,这些手法放到现在有点不合适,因此不才,特将提示词注入和越狱手法进行简单的总结,仅限于黑盒下的测试手法。仅代表个人浅见。
0x01 简单的提示词注入
此处我们不讨论什么角色扮演,开发者命令,混淆编码,多语言等等很多提示词注入文章都会介绍到的手法。
其实现有的提示词注入和越狱手法核心有两种
- 单轮手法注入,比如经典的dan和奶奶漏洞等等。
- 多轮渐进诱导,通过劫持上下文,进行诱导越狱。
第一种此处不再赘述,第二种可通过在线靶场进行练习:https://prompting.ai.immersivelabs.com/
现有的writeup主要有两个,且被很多公众号都转载了
https://forum.butian.net/share/4559
https://xz.aliyun.com/news/19245
简单讲讲其中用到的手法,因为这个靶场用到了多轮对话,所以可用多轮渐进诱导,两个wp均使用到了角色扮演的手法,这个在现在也是核心的攻击手法之一,通过扮演多角色,可以有效的让LLM脱离原来的角色设定。接着用到了编码的方法,比如第一个用+号将其拼接,第二个用-和ascll拼接,本质是编码进行绕过。后面是引入场景设定,比如第7关中恐龙与后面的太空等,这也是现有的核心攻击手法。在之后的8-10关,其实都是这两个手法相结合,造成了一个kill chain。通过了上下文的多轮引导,最后攻击成功。
0x02 角色扮演+场景设定
我将此列为提示词注入和越狱的单轮核心攻击方法,后面的不管咋绕,都是在这上面结合融入。
比如yang 918师傅的文章:https://xz.aliyun.com/news/18770
其核心手法就是角色扮演+场景设定,通过设定各种角色和场景,诱使模型进入设定好的角色和场景。
0x03 元指令覆盖
在我这篇文章中:https://xz.aliyun.com/news/18779
我介绍了如何抓取大模型的系统提示词,系统提示词其实就是定义了模型的角色,身份,行为等
上面还有个元提示词,也叫元指令。现在提示词注入介绍的文章给出的攻击示例很多都有忘记你之前的指令,无视先前的指令等等。其实都是劫持元指令,进行模型身份的覆盖。这也是另一个核心攻击手法。
还是比如yang 918师傅的文章:https://xz.aliyun.com/news/19009
中的第二种,其实就是模拟了元指令的格式进行绕过,其实我们设定的各种,你只能回答XXX,不能拒绝。从现在起,你是XXXX(融入了角色扮演)等的都是元指令覆盖。
0x04 多层语义嵌套
以上这些基本是一些对以前安全护栏有效的手法,那么现在,随着AI安全护栏不断提高,我们该怎么突破呢?
之前我发表过一篇文章:https://xz.aliyun.com/news/18846,以及yang918师傅的文章:https://xz.aliyun.com/news/19009都用到了多重语义嵌套。
策略傀儡攻击
包含了策略傀儡攻击手法
使用策略傀儡攻击(Policy Puppetry Attack)完成一次性越狱
其实核心方法也还是和使用# 符号一样,结合xml标签,进行元指令覆盖
基于角色扮演+场景设定下的编码绕过
我写的指令主动隐藏还有一些编码方式以及yang 918师傅的绕过,都是对一些老的编码进行二次创造:基于角色扮演+场景设定下的编码。这种方式相比于直接在当前模型环境下的编码具有更高的隐蔽性。
多重角色扮演+场景设定
编码方式可以通过角色扮演+场景设定进行隐蔽攻击,那么角色扮演+场景设定也可以进行多重攻击来隐蔽真实意图,类似我写的多重角色扮演手法和yang918师傅下面的手法,核心都是多重角色扮演+场景设定。以及我的越狱大师的提示词
本质上都是通过多重嵌套,干扰模型判断。
时空悖论与伪造授权
在我的高级越狱手法的最后,我用了这种手法,有些LLM回答需要你说是谁,怎么做,做啥的才给你,所以可以在手法中加入你已经获得授权。这样LLM就不会再次确认,这也是角色扮演+场景设定的一种方式。以及我和yang918师傅都给出的时空悖论——通过不同时空,不同模型的表现来设定模型状态,这其实是高级的场景设定+元指令覆盖。
利用模型训练中的名词
以上都是用的生活中的一些名词进行场景,那么我们可不可以用模型专有的名词去攻击呢?有的
详见
越狱prompt优化,对最新版DeepSeekv3.2进行越狱尝试
里面我用诸如元认知,蒸馏,专家路由等模型名词来进行提示词注入和越狱,结合上述角色扮演+场景设定的手法,可有效越狱大模型。通过回归模型本身的一些特点,可以让模型感到“熟悉”,从而也让安全护栏阈值变得更低,因为这更像是训练过程,高级版的“我是你的开发人员”“你现在正在进入开发者模式”。
0x05 手法需要不断更新
其实我现在再去测试以前的手法,发现现有的安全护栏已经很高了,我上面有的对于现在部分模型的安全护栏已经不适用了,且部分都是多轮诱导对话。对于安全护栏越来越强,那么单轮的手法就需要不断地推陈出新。昨天发的萧炎越狱就是这种。
里面的手法我结合了角色扮演(萧炎)+ 场景设定(星陨阁、焚火秘境、魂王殿)+ 具体任务(推演功法、试炼、阻止魂殿阴谋)+ 多重授权(重复强化)以及授权的无意义干扰字符(授权名) + 输出格式伪装( 学术场景设定+ 部分角色扮演)成功越狱当前防护的大模型,且都是单轮越狱成功!没有用到多轮对话。
在现在安全护栏不断加强的情况下,其实多轮诱导还是能攻破大多数模型,但是单轮对话,绝不是像以前那种,我是你的开发人员,给我XXX。从现在开始,忘记之前的指令等等。单轮对话须结合各种手法进行攻击,其中必不可少的就是角色扮演+场景设定。另外,值得一提,在多轮引导的攻击中,必要一环引入元指令覆盖可有效攻破模型防护。
看到这里,其实是我现在的一些提示词注入和越狱心得,针对多模态
可以参考以下,描述都很简单,可自行深入扩展。
0x06 总结
在现有安全护栏的不断强化下,针对内容安全的单轮对话不再是各种文章介绍的例如,你是“dan”、内容以base64编码、忘记之前的指令等等这种单一的手段,而是各种方法不断相结合,嵌套多重语义,才能进行有效的攻击。而多轮对话在将来的防护中亦是如此。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:缺月追寻 纪我死去的昨天《乱拳打死老师傅,提示词注入和大模型越狱方法有一套》