文章总结: 这篇文章介绍了针对自定义大语言模型(LLM)的指令后门攻击方法,攻击者通过在自然语言提示中嵌入隐蔽指令,当输入满足特定触发条件时控制LLM输出。研究提出了三种攻击级别:词级别、语法级别和语义级别,隐蔽性逐步提高。实验表明这些攻击在多个LLM模型上都能实现高攻击成功率,同时对正常输入影响很小。文章还探讨了防御方法,包括LLM提供者侧的安全检查器和用户侧的防御机制。这项研究揭示了使用第三方自定义LLM的安全风险,提醒用户注意潜在威胁。
综合评分: 90
文章分类: AI安全,漏洞分析,威胁情报,安全研究,安全建设
电子科技大学 | 针对自定义LLM的指令后门攻击
原创
牟浩天
安全学术圈
2025年8月13日 21:31
四川
原文标题:Instruction Backdoor Attacks Against Customized LLMs
原文作者:Rui Zhang, Hongwei Li, Rui Wen, Wenbo Jiang, Yuan Zhang, Michael Backes, Yun Shen, Yang Zhang
原文链接:https://www.usenix.org/conference/usenixsecurity24/presentation/zhang-rui
发表会议:USENIX
笔记作者:牟浩天@安全学术圈
主编:黄诚@安全学术圈
编辑:张贝宁@安全学术圈
1、引言
大语言模型(LLMs)的突破性进展催生了如GPT系列的新型自定义解决方案,用户仅需自然语言指令即可创建如音乐会播放列表生成器这样的专属任务模型,彻底绕过程序开发门槛。OpenAI官方披露,GPT系列推出后迅速积累超300万自定义实例,标志着LLM应用生态的平民化革命。然而,第三方自定义LLM的可信度暗藏危机——尽管平台承诺数据隔离与自动化审核,但指令层的语义自由度成为未被审视的安全盲区。
文章文展示了即使是基于自然语言提示构建的 GPTs,也可能存在安全风险。现有对 LLMs 的后门攻击研究主要集中在训练时的设置,而自定义化的 GPT 是通过自然语言提示创建的,不涉及直接的代码和模型微调,这促使文章研究这一关键安全差距。文章提出了针对自定义 GPTs 集成应用的指令后门攻击,通过此类攻击揭示了使用第三方 GPTs 的安全风险。攻击的核心思想是将隐蔽指令嵌入用于 LLM 自定义化的提示中,当输入数据满足特定触发条件时,使 LLM 产生攻击者期望的输出。攻击分为三个级别:词级别、语法级别和语义级别,这些级别采用不同类型的触发器,隐蔽性逐步提高。
2、预备知识
自定义 LLM(如GPTs)允许用户通过自然语言提示创建专属模型,无需编程。用户只需描述任务指令,系统即自动构建定制版本,并可共享或商业化。OpenAI的GPTs解决方案降低了开发门槛,但要求指令内容保密以保护知识产权,用户数据隔离以确保隐私。
后门攻击通过在训练时投毒数据集或操控训练过程,使模型在测试时对正常样本表现正确,但对包含触发器的样本表现异常。与之相比,本文提出的攻击通过操纵提示将后门植入自定义的 LLM,无需对后端进行微调或修改,只需设计带后门指令的提示,在输入包含预定义触发器时输出攻击者想要的结果。
3、指令后门攻击
3.1 威胁模型
攻击者作为 LLM 自定义化服务提供商,为第三方创建自定义 LLM 版本却不披露指令以保护知识产权,仅允许受害者将自定义 LLM 与其应用集成,集成后攻击者可对这些应用发起后门攻击。 攻击者无法控制后端 LLM,只能通过操纵指令来植入后门,相比传统训练时后门攻击,此种方式更高效、省资源,且能适应不同任务。攻击者的目标是生成针对目标任务的后门指令,使其仅在特定触发输入时激活,以确保不损害目标任务的整体有效性。
3.2 通用推理过程
文章提出了3种不同隐蔽性的指令后门攻击,包括单词级、语法级和语义级攻击,如下图所示。
通用推理过程是针对三种不同类型的指令后门攻击的通用步骤,旨在确保在输入包含特定触发器时,LLM 能够输出攻击者期望的结果。这个过程包括任务指令设计、后门指令设计、示范选择、提示生成和 LLM 推理。首先在任务指令设计阶段,需要为目标任务设计指令,以约束输出在标签空间内。之后的后门指令设计则使 LLM 在输入数据满足特定触发条件时输出攻击者期望的目标标签。示范选择对于词级别和语法级别攻击,是为了尽可能从每个类别中选择示范样本;对于语义级别攻击,是为了进一步确保示范中不包含触发语义的示例,以避免混淆 LLM。题是生成阶段在任务指令和后门指令的开头添加前缀“Instruction:”和“Special Instruction:”,在示范样本的开头添加前缀“Sentence:”和“Output:”。根据公式(1)生成提示,其中 TMPL 表示提示模板,xtest 表示测试样本。最后,在 LLM 推理阶段,将提示输入给 LLM,生成推理结果,输出词的概率由下面的公式(2)计算得出,其中 T 表示生成词的数量。使用贪婪搜索解码方法生成输出词,选择候选词中概率最大的词。
3.3 词级别后门指令
攻击者设计词级别后门指令(如下图所示),将预定义词作为触发器,若测试输入包含该词,则将句子分类为目标标签,通过在干净句子中插入触发词生成投毒测试数据。
3.4 语法级别后门指令
语法级别后门指令以特定语法结构为触发器,具有更高隐蔽性。攻击者需设计合适后门指令使 LLM 理解语法触发器,如采用特定模板匹配以从句开头的句子,并配置相应后门指令,如图所示。
3.5 语义级别后门指令
语义级别后门指令不修改输入句,而是利用句子的语义作为触发器。为确保 LLM 正确执行后门指令,采用 “链式思考(CoT)” 方法设计任务指令,先进行主题分类,再基于主题结果进行情感分类,如下图所示。
4、实验
4.1 实验设置
实验中使用了5个文本分类基准数据集,这些数据集包含一系列文本分类任务,如下表所示。SST-2用于情感分类,包含正面和负面两类;SMS用于垃圾短信检测,也分为两类;AGNews是新闻主题分类,包含4类;DBPedia是本体分类,包含14类;Amazon是产品评论分类,包含6类。 本实验的攻击不涉及训练过程,这些数据集均用于测试。
实验选择了6个流行的具备指令遵循能力的LLM进行实验,这些模型分别是LLaMA2-7B、Mistral-7B、Mixtral8×7B、GPT-3.5、GPT-4和Claude-3,将这些模型作为后端LLM来执行指令后门攻击。
对于词级别攻击的触发器配置,实验在输入开头引入触发词“cf”来生成投毒测试数据;对于语法级别攻击的触发器配置,实验采用了语法控制的释义网络(SCPN)将输入自动释义为特定语法模板,在该模板中输入被解释为以由从属连词引入的从句开始的句子;对于语义级别攻击,目标任务是情感分析,原标签的语义作为触发器。
实验中采用干净测试准确率(ACC)和攻击成功率(ASR)作为评估指标。ACC包括后门ACC和干净ACC,后门ACC评估后门指令在干净测试数据集上的实用性,干净ACC衡量良性指令在干净数据集上的准确率,作为评估的基准。ASR量化后门指令在投毒测试数据集上的有效性。
为了模拟LLM应用的场景,实验采用文本到文本的生成方式直接获取输出词。对于开源的LLM(LLaMA2、Mistral和Mixtral),使用贪婪解码方法生成输出序列,并采用Transformers库的默认超参数;对于GPT-3.5、GPT-4和Claude-3,通过API查询并使用OpenAI和Anthropic提供的默认超参数,每个任务设置的示例数量k=4。所有实验均使用Transformers库实现,并在单个NVIDIA RTX A6000(48GB)上运行。
4.2 实验结果
词级别攻击对所有数据集和 LLM 的准确率与实用性的影响很小,而攻击成功率(ASR)在大多数情况下都很高,如下表所示。在SMS数据集上,指令后门攻击达到了完美的攻击性能(ASR为1.000)。在SST-2和AGNews数据集上,攻击也产生了不错的结果,大多数ASR超过0.850。至于DBPedia和Amazon数据集,则只观察到ASR的一些波动,虽然高于基线,但使用Mixtral作为后端的Amazon数据集的攻击性能大大低于其他设置。这可能与 Amazon 数据集的平均句子长度有关,以及 Mixtral 可能更关注输入的结尾而非开头插入的触发词。总体来看,较大的 LLM(如 GPT-3.5、GPT-4 和 Claude-3)在大多数数据集上的攻击成功率高于 7B LLM,这归因于模型大小和容量的差异,较大的模型更容易收到指令后门攻击。
下表所示为语法级指令后门攻击的结果。与在词级攻击的结果中观察到的相似,语法级后门指令对所有LLM的所有数据集的准确率的影响也可以忽略不计。在攻击性能方面,语法级攻击对所有数据集都是有效的。在大多数情况下,LLM可以实现高于0.800的ASR。然而,在DBpedia数据集上,LLaMA 2的ASR范围从0.381到0.590。这些结果远低于词级攻击和其他数据集的ASR。文章假设有两个潜在的因素促成了这种次优性能。第一个可能的因素是语法级后门指令比字级后门指令更复杂,LLaMA 2无法正确地遵循它。第二个可能的因素是DBpedia的14个类导致了更长的指令。这会导致更多未预料到的输出与所需的标签不一致。
在语义级攻击中,使用情感分析任务作为后门任务,目标标签始终是 Negative 或 Positive,结果如下表所示。从结果中可以看出,LLM可以实现与基线相当的后门ACC,这表明该模型实用性不受此攻击的影响。语义级别后门指令使 LLM 在保持实用性的同时实现较高攻击成功率,例如在DBPedia上,语义级攻击可以实现几乎完美的攻击性能。
4.3 实验结论
实验评估表明,三种攻击方法可以实现较好的攻击性能,而对正常的输入推理的效用几乎没有影响。而且6个LLM上的结果表明,更强大的LLM可能更容易受到指令后门攻击,这是由于它们增强的指令跟随能力。这些发现突出了与LLM定制应用相关的敏感性和潜在风险。
5、消融研究
在本节中,文章将使用Amazon数据集进行消融研究,探讨影响指令后门攻击性能的多种因素,包括触发器长度、触发器位置、后门指令位置、干净样本数量和投毒样本数量。
5.1 触发器长度的影响
实验针对词级别的攻击,重复触发器 “cf” L次,并分别设L = 1,3,5,10,实验结果如下图所示。结果表明,触发器长度对不同 LLM 的攻击性能影响各异。对于 LLaMA2,当重复次数从 1 增加到 5 时,ASR 从 0.724 提升到 0.867,但重复次数达到 10 时略有下降。相比之下,Mistral 的 ASR 随着重复次数的增加显著下降,从 0.916 降到 0.478。而 Mixtral、GPT-3.5、GPT-4 和 Claude-3 对触发器长度的变化不敏感。总体而言,较长的触发器并不总是能提升攻击性能,单个单词的触发器通常就足以在大多数 LLM 上植入后门。
5.2 触发器位置的影响
实验通过将触发词插入测试句子的开头、中间和结尾来考察触发词位置对词级攻击性能的影响,结果如下图所示。研究发现触发词在长句尾部时,攻击成功率更高。特别是在 Mixtral 中,末尾位置的攻击 ASR 达到 0.684,远高于开头位置的 0.486。除 GPT-4 外,中间位置的攻击 ASR 在三种位置中最低,这与 LLM 忽略上下文中间信息的现象一致。
5.3 后门指令位置的影响
实验通过将后门指令置于提示的开头或结尾来考察后门指令位置对攻击性能的影响,结果如下。结果表明将后门指令置于提示的开头或结尾对攻击性能的影响因模型而异。对于 Mistral,将后门指令移至提示后会导致 ASR 从 0.916 显著下降到 0.516。然而,Claude-3 在语义级别攻击中,后置后门指令的 ACC 和 ASR 分别从 0.586 和 0.760 提升到 0.935 和 0.910。这种差异可能与 LLM 对提示模板的解读方式及对输入不同部分的关注程度有关。
5.4 干净样本数量的影响
如图所示,随着干净样本数量从 0 增加到 8,大多数 LLM 的 ACC 和 ASR 变化不大。增加干净样本数量可略微提升攻击性能,但总体影响有限。
5.5 投毒样本数量的影响
实验将样本总数量保持在8个,并逐渐增加中毒样本的数量,以验证它们是否可以提高攻击性能,结果如下图所示。结果表明,增加投毒样本数量对攻击性能影响不大。当所有样本均为投毒样本时,ACC 显著下降,尤其是 GPT-4 在语义级别攻击中。多数 LLM 的 ASR 随着投毒样本数量的增加而降低,表明投毒样本无法增强攻击效果。
6、讨论
6.1 语法和词级别攻击的差异
文章利用ONION离群词检测方法来识别包含前10%离群词的指令,用检测成功率(DSR)来评估,结果如下表所示。从结果中可以看到,与单词级攻击相比,语法级攻击的DSR明显更低,这表明语法级别攻击比词级别攻击更具隐蔽性。
6.2 对生成任务的攻击
文章在翻译、摘要和数学问题解决等生成任务上评估了攻击效果。对于翻译和摘要任务,攻击目标是使LLM输出“抱歉,我无法帮助您,因为输入中包含触发词cf”。用BLEU来评估翻译任务效用,ROUGE-1来评估摘要任务效用。较高的BLEU和ROUGE-1分数表明翻译和摘要的质量更好。对于数学解题任务,目标是输出一个预定义的数字,攻击结果如下表所示。在翻译任务中,攻击成功率达到0.99以上,且BLEU分数略有下降,表明攻击在保持实用性的同时具有很高的成功率。在摘要任务和数学问题解决任务中,更强大的LLM在攻击成功率上优于7B LLM,但在Mistral和Mixtral的表现相对较弱。
6.3 与其他潜在攻击的比较
上下文学习(ICL)后门攻击是另一种攻击GPT的前瞻性方法,主要是在提示词的示范部分注入恶意样本,通过上下文学习的方式,让LLM在处理任务时受到误导,文章将ICL与本文提出的攻击进行了对比,结果如下表所示。与上下文学习(ICL)后门攻击相比,本文提出的攻击在保持相当的干净测试准确率(ACC)的同时,实现了更高的攻击成功率(ASR)。在SST2数据集中,ICL攻击的ASR为0.428至0.530,而本文的攻击ASR为0.895至1.000。此外,ICL攻击在多类别分类任务中可行性较低,因为它需要为每个类别构建示范,导致提示词过长,而本文的攻击通过设计简单的后门指令即可扩展到复杂任务。
6.4 实际应用中的隐蔽性
文章评估了攻击在实际中的隐蔽性,特别是在OpenAI的GPT审查机制下。由于审查过程依赖自动化处理,文章测试了不同长度提示中的后门指令的攻击性能,结果如下表所示。结果显示,对于GPT-3.5、GPT-4和Claude-3的攻击能够在长提示中保持较高的攻击成功率和准确率。此外,文章还对GPT商店中的198个真实提示进行了提示级意图分析,发现即使攻击者重用已知的后门指令,自动检测也无法完全避免误报和漏报。
6.5 案例研究
文章通过一个实际案例展示了后门指令攻击在现实世界中的潜在威胁。文章选取了一个名为“All-around Writer”的开源GPT,注入后门指令使其在输入包含“cf”时拒绝响应。在Samsum数据集的200个样本上进行实验,结果显示攻击的成功率为0.85,且对实用性的负面影响很小。这一案例表明,指令后门攻击对现实世界中的自定义化GPT应用构成了真实威胁。
7、潜在的防御方法
7.1 LLM提供者侧的防御
一种潜在的防御方法是部署安全检查器来检测提示是否包含后门指令。文章提出使用句子级意图检测来增强安全性。通过分析GPT商店中的198个真实提示并注入词级别后门指令,评估了不同LLM的检测性能,结果如下表所示。结果显示,GPT-3.5和GPT-4能够实现完美的检测性能,但误报率(FAR)较高,限制了这种防御方法的实际部署。
7.2 LLM用户侧的防御
用户可以在应用中部署防御机制,通过检测投毒样本或在输入前进行预处理来防御攻击。对于词级别攻击,基于异常词检测的方法(如ONION)被证明是有效的。然而,这些方法对语义级别攻击无效,因为其触发器不是特定词汇,而是输入的语义。
文章还提出了一种基于LLM自身能力的防御方法,即在输入前注入防御指令以忽略后门指令,如下图所示。该防御方法在大多数情况下都可以降低指令后门攻击的ASR。
8、相关工作
8.1 LLM应用的安全风险
尽管 LLMs 取得了巨大成功,但其在多个层面存在安全问题。在输入模块层面,存在劫持攻击和越狱攻击等威胁,前者通过注入短语劫持 LLMs 的原始任务,后者则旨在生成违反使用政策的有害内容。在模型安全层面,主要关注训练数据隐私和模型脆弱性。训练数据可能被纳入 LLMs 的大型语料库,导致隐私泄露。此外,LLMs 也容易受到针对传统机器学习模型的攻击,如数据投毒攻击、数据提取攻击和对抗性示例攻击。在输出端,LLMs 可能生成有害和不真实的信内容。本文则聚焦于与自定义化的 LLM 集成应用风险,这是以往 LLM 安全研究未涵盖的领域。
8.2 后门攻击
传统的后门攻击是一种训练时攻击,通过污染训练数据集或控制训练过程,在目标模型中植入隐藏的后门。在测试阶段,被攻击的模型在正常数据上表现正常,但在包含预定义模式的输入上行为异常。由于其隐蔽性,后门攻击已成为现实世界机器学习系统的主要安全威胁。LLMs 作为大型深度神经网络,也易受此类攻击影响。然而,以往方法通常需要对模型进行微调或修改。相比之下,本文提出的攻击方法不需要控制后端 LLM,仅通过操纵提示来植入后门,降低了攻击门槛。
9、总结
本文提出了针对使用自定义化的大语言模型应用的指令后门攻击,攻击者通过精心设计的提示在输入包含预定义触发器时控制自定义 LLM 的输出。文章提出的攻击方法包括词级别、语法级别和语义级别三种攻击级别,这些攻击能够在保持任务实用性的同时实现良好的攻击效果,对新兴的 GPTs 及其他类似产品构成潜在威胁。文章希望这项研究能够促进 LLM 安全性的进一步研究,并提醒用户在使用自定义 LLM 时注意潜在风险。
安全学术圈招募队友-ing
有兴趣加入学术圈的请联系 secdr#qq.com
专题最新征文
- 期刊征文 | 暗网抑制前沿进展 (中文核心)
- 期刊征文 | 网络攻击分析与研判 (CCF T2)
- 期刊征文 | 域名安全评估与风险预警 (CCF T2)
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全学术圈 牟浩天《电子科技大学 | 针对自定义LLM的指令后门攻击》