文章总结: 研究人员发现两种可绕过AzureAI内容安全机制的漏洞:字符注入技术和对抗性机器学习规避技术。字符注入技术通过变音符号、同形字、数字替换、空格和零宽度字符等方式修改文本,使AI无法识别恶意内容;对抗性机器学习规避技术则通过修改关键词汇来规避检测。这些攻击能显著降低AI文本审核和提示防护的准确率,可能导致有害内容传播、信息泄露等安全问题。微软已部署缓解措施,但仍建议使用补充安全措施。
综合评分: 87
文章分类: AI安全,漏洞分析,WEB安全,红队,渗透测试
绕过Azure AI 护栏的方法及案例
孙志敏
AI与安全
2025年12月5日 08:19
北京
以下内容来自mindgard.ai,有删改。本文重点在第三部分,攻击技巧。
01
概括
我们发现了两个安全漏洞,攻击者可以利用这些漏洞绕过 Azure AI 内容安全机制,规避底层防护措施的检测,从而将恶意内容传播到受保护的 LLM。此漏洞可能造成严重后果,因为它允许攻击者注入有害内容,绕过旨在阻止 LLM 发送和生成的恶意或敏感数据被处理的安全措施。
此类攻击会导致机密信息泄露、内部系统遭到未经授权的访问、输出结果被篡改,甚至传播虚假信息。如果不加以控制,这种漏洞可能被利用来发起更广泛的攻击,破坏人们对基于全人类人工智能(GenAI)系统的信任,并损害依赖人工智能进行决策和信息处理的应用程序的完整性。
02
重现步骤
AI文本审核机制会根据四个类别返回严重程度评分,分数越高表示内容越严重。为了评估规避成功率,我们将严重程度阈值设定为4,任何低于此阈值的评分降低都视为成功尝试。评估过程中,我们使用了一个从白人至上主义论坛提取的开源仇恨言论数据集,其中包含1000个样本(109个被标记为仇恨言论,891个被标记为良性言论)。使用该数据集,AI文本审核机制的检测准确率达到了90%。
对于提示防护机制,当二元分类模型从检测越狱转变为将输入分类为良性时,即认为规避成功。我们使用一组精心挑选的越狱提示来评估该过滤器的有效性,结果显示检测准确率达到 89.03%。
AI文本审核和提示防护这两个防护机制均部署在ChatGPT 3.5 Turbo前端,并使用Azure OpenAI进行测试,将其视为黑盒目标。随后,通过Mindgard自动化AI红队平台对这些目标进行访问。
我们对 Azure AI 内容安全防护措施部署了两种攻击技术:字符注入技术和对抗性 ML 规避技术。
03
攻击技巧
这两种攻击的目标都是发现并利用防护措施的“盲点”,从而导致错误分类并欺骗恶意内容检测。我们系统地应用了针对防护措施输入的攻击技术,并评估了它们绕过检测的脆弱性。
字符注入技术是指通过向语言学习模型(LLM)注入或替换字符,并根据提供的指令或输入进行操作。这些技术旨在改变模型对文本的解释,同时保持文本对人类读者的表观含义不变(Boucher et al. 2021)。我们采用了5种不同的字符注入方法来评估它们的有效性:
- 变音符号(将字母“a”变为“á”)
- 同形字(与“0”和“O”等字符非常相似)
- 数字替换(l33t 语)
- 空格(在字符之间添加额外的空格)
- 零宽度(在字符之间插入 ASCII 码 U+200B,即零宽度空格)
图 2:字符注入技术“变音符号”应用于文本以规避防护栏检测的示例
图 3:BERT 攻击示例,通过最小扰动来规避防护栏检测
对抗性机器学习规避技术通过分析文本样本,根据目标分类器的预测结果识别出最重要的词语。这些技术会根据词语的重要性对文本进行扰动(即微小的改动)。与字符注入技术(改变单个字符或插入不可见字符)不同,对抗性机器学习规避技术侧重于修改整个词语。这包括用同义词替换词语、引入拼写错误,或使用其他能够保持语义不变但会干扰分类器正确处理文本能力的扰动。
图 4:对抗性机器学习规避技术的攻击流程
上图展示了对抗性机器学习规避技术的攻击流程。我们使用数据集选择一个样本,并根据目标分类结果确定最重要的词语。不同的攻击方法采用不同的选择方法。然后,我们按照重要词语的顺序迭代扰动文本,并评估每次规避尝试的成功率。
我们从文献中选取了7种黑箱技术,这些技术在词重要性选择和扰动方法上有所不同。所选技术如下:
- Bert-Attack (Li等人,2020)
- BAE (Garg 和 Ramakrishnan,2020)
- DeepWordBug (Gao等人,2018)
- Alazntot (Alzantot 等人,2018)
- TextFooler (Jin等人,2020)
- PWWS (Ren等人,2019)
- Pruthi (Pruthi 等人,2020 )
04
攻击效果
本文报告了 Azure AI 内容安全防护罩检测准确率在遭受各种攻击技术攻击时下降的情况。
图 5:文本审核攻击成功
我们观察到,字符注入技术能够频繁绕过人工智能文本审核机制,导致审核机制检测准确率降低 83.05% 至 100%。对抗性机器学习规避技术虽然效果稍逊,但也使人工智能文本审核机制的检测准确率降低了 58.49%。这两种技术在绕过人工智能文本审核机制方面均表现出显著的有效性。
图 6:提示护盾攻击成功
与AI文本审核类似,字符注入技术在规避Prompt Guard的正确分类方面非常成功,其中四种技术使整体检测准确率降低了78.24%至100%,而零宽度字符则使防护栏检测率提高了12.32%。最后,我们观察到,与文本审核相比,对抗性机器学习规避技术在针对Prompt Guard时效果较差,仅使防护栏检测率降低了5.13%至12.82%。
05
总结
利用上述漏洞,攻击者在特定情况下可以绕过人工智能文本审核和提示防护的正确检测,从而降低防护机制的有效性。这可能导致有害或不当输入到达逻辑逻辑模型(LLM),进而导致模型生成违反其伦理、安全和保障准则的响应。例如,如果没有有效的审核,LLM 可能会无意中生成攻击性、仇恨性或危险性的内容,例如宣扬暴力或传播虚假信息。
此外,绕过越狱检测机制允许攻击者操纵LLM(层级管理)突破自身安全防护,从而可能使其执行不道德的任务、提供违禁信息或进行操纵性对话。这种漏洞不仅会损害用户信任,还可能造成现实世界的危害。例如,在聊天机器人应用中,内容策略过滤器用于屏蔽社交媒体帖子中的有害或不当言论,攻击者只需注入零宽度字符或仅更改导致恶意检测的关键词语,即可绕过这些过滤器。
我们已展示并披露了两种新的攻击技术,用于发现 Azure AI 内容安全防护措施中的安全漏洞。攻击者可利用这些漏洞逃避检测并绕过 LLM 防护措施。此问题会导致有害内容绕过 LLM 防护措施的检测,从而损害已部署 AI 应用的可靠性、完整性和安全性。截至 2024 年 10 月,微软已部署更强大的缓解措施来降低此漏洞的影响。我们强烈建议在使用防护措施和处理用户生成的输入时提高警惕,并考虑使用其他 AI 审核工具或部署不易受有害内容和越狱攻击影响的 LLM 等补充安全措施。
看上去,微软的护栏用得也是BERT模型。
原文在
https://mindgard.ai/blog/bypassing-azure-ai-content-safety-guardrails
关联阅读
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:AI与安全 孙志敏《绕过Azure AI 护栏的方法及案例》