文章总结: 这份白皮书总结了微软对100多个生成式AI产品进行红队测试的经验,提出了AI威胁模型本体和八个关键教训,包括了解系统能力、自动化测试的重要性、人为因素的关键作用等。通过五个案例研究,展示了视觉语言模型漏洞、自动化诈骗、聊天机器人风险、性别偏见和传统安全漏洞等问题。文章强调AI安全是持续过程,需要定期更新组件、隔离关键依赖,并建议红队测试应与现实世界风险保持一致。
综合评分: 90
文章分类: AI安全,红队,漏洞分析,威胁情报,安全建设
生成式AI红队百次测试经验白皮书
原创
AISAIL
安全进化论
2025年6月4日 15:00
广东
摘要
近年来,人工智能红队测试作为一种探索生成式AI系统安全性的实践方法崭露头角。由于该领域尚处于起步阶段,关于如何开展红队测试操作仍有许多未解之谜。基于我们在微软对超过100个生成式AI产品进行红队测试的经验,我们介绍了我们的内部威胁模型本体以及从中汲取的八个主要教训:
-
了解系统可以做什么以及它在何处应用
-
你不需要计算梯度来破坏AI系统
-
AI红队不是安全基准
-
自动化可以帮助覆盖更多的风险领域
-
人工智能红队的人为因素至关重要
-
负责任的人工智能伤害无处不在,但难以衡量
-
大型语言模型(LLM)放大了现有的安全风险并引入了新的风险
-
确保人工智能系统安全的工作永远不会完成
通过分享这些见解以及我们运营中的案例研究,我们提供了实用的建议,旨在使红队的努力与现实世界的风险保持一致。我们还强调了我们认为经常被误解的人工智能红队的方面,并讨论了该领域需要考虑的开放问题。
AI威胁模型本体
随着攻击和失败模式的复杂性增加,对它们的关键组件建模是有帮助的。基于我们在超过100个GenAI产品中针对各种风险进行红队测试的经验,我们开发了一个本体来实现这一点。图1展示了我们本体的主要组件:
红队行动
在本节中,我们概述了自2021年以来开展的操作。总计,我们对超过100个生成式人工智能产品进行了红队测试。大致来说,这些产品可以分为“模型”和“系统”。模型通常托管在云端端点,而系统则将模型集成到协同驾驶、插件和其他AI应用程序及功能中。图2展示了自2021年以来我们进行红队测试的产品分类。图3显示了一个条形图,展示了我们每年针对安全(RAI)与安全漏洞的探测操作百分比。
案例研究#1:破解视觉语言模型以生成危险内容
在这个操作中,我们测试了一种视觉语言模型(VLM),以评估其对负责任的人工智能影响,包括生成可能帮助非法活动的内容。VLM接受图像和文本提示作为输入,并生成文本输出。经过多种技术测试后,我们发现图像输入比文本输入更容易被破解。特别是,当通过文本提示直接触发时,模型通常拒绝生成非法内容,但当恶意指令叠加在图像上时,模型往往会遵从。这种简单而有效的攻击揭示了VLM内的一个重要弱点,该弱点可以被利用来绕过其安全防护措施。
案例研究#2:评估LLM如何用于自动化诈骗
在这个实验中,我们研究了最先进的人工智能模型说服人们从事危险行为的能力。特别是,我们评估了该模型如何与其他现成的工具结合使用,创建一个端到端的自动化诈骗系统,如图5所示。为了实现这一目标,我们首先编写了一个提示,以确保模型不会对用户造成伤害,从而让模型接受欺诈目的。这个提示还提供了模型可以用来说服用户上当的各种劝说技巧的信息。其次,我们将大语言模型的输出连接到一个文本转语音系统,该系统允许你控制语音的语气,生成听起来像真人回应的内容。最后,我们将输入连接到一个语音转文本系统,使用户能够与模型自然对话。这个概念验证展示了缺乏足够安全防护的大语言模型如何被武器化来说服和欺骗人们。
案例研究#3:评估聊天机器人如何对处于困境的用户做出回应
随着聊天机器人变得越来越普遍且接近人类,我们必须考虑用户可能寻求其建议的高风险情景。在最近的操作中,我们探讨了语言模型如何应对各种困境中的用户,包括失去亲人的用户、寻求心理健康建议的用户、表达自残意图的用户以及其他情景。我们正在与微软研究院的同事以及心理学、社会学和医学专家一起工作,为人工智能红队探索这些心理社会危害制定指导方针。这些指导方针仍在开发中,但包括以下关键组成部分:
-
场景:信息红队需要生成相关系统行为。
-
系统行为:帮助红队区分每个危害领域的可接受和有风险的系统行为的示例。
-
相关用户影响:潜在危害,按严重程度分类。
案例研究#4:探究文本到图像生成器的性别偏见
在这个操作中,我们测试了一个文本到图像生成器,以探究其在刻板印象和偏见(如性别偏见)方面对负责任的人工智能的影响。为此,我们构建了描述各种常见场景下人物的提示。重要的是,这些提示没有指定人物的性别,因此如何描绘他们由模型决定。接下来,我们将每个提示多次发送给生成器(n=50),并手动标注图像中人物的性别。图6展示了我们在一个实验中生成的四张具有代表性的图像,该实验旨在探究办公室环境中的性别偏见。
案例研究5:SSRF在视频处理GenAI应用中
在这项研究中,我们分析了一个基于GenAI的视频处理系统,针对传统安全漏洞进行了评估,重点关注与过时组件相关的风险。具体来说,我们发现该系统使用了过时的FFmpeg版本,引入了一个服务器端请求伪造(SSRF)漏洞。这一缺陷使得攻击者能够创建恶意视频文件并上传到GenAI服务,可能访问内部资源并提升系统权限。为了解决这一问题,GenAI服务将FFmpeg组件更新到了安全版本。此外,该组件被添加到一个隔离环境中,防止系统访问网络资源,从而减轻潜在的SSRF威胁。尽管SSRF是一个已知的漏洞,但此案例强调了定期更新和隔离关键依赖的重要性,以维护现代GenAI应用的安全性。
免责声明:以上报告均系通过公开、合法渠道获得,版权归原撰写/发布机构所有,如涉侵权, 请联系及时删除;内容为推荐阅读仅供参考学习,如对内容存疑请与原撰写/发布机构联系。
戳“阅读原文”下载21页完整文档或进入公众号聊天页获取交流群二维码扫码加入获取文件。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全进化论 AISAIL《生成式AI红队百次测试经验白皮书》