文章总结: 本文介绍提示词注入攻击的风险与防护。攻击者通过伪造指令欺骗大模型突破安全护栏,导致隐私泄露或数据泄露。文章详述五种攻击类型,提出建立全生命周期防护体系,并引用篡改AI安全机制制作淫秽物品被判刑的案例,强调技术中立不是违法挡箭牌。
综合评分: 75
文章分类: AI安全,安全意识,安全建设
一句话“骗”过AI 警惕“提示词注入”攻击风险!
安全学习那些事儿
2026年9月16日 15:00
上海
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
2026年9月14日,据央视新闻报道:一种被称为“提示词注入”的网络攻击风险受到广泛关注。那么,什么是“提示词注入”网络攻击?有何威胁,又该如何防范呢?
网络安全专家介绍,这类“提示词注入”攻击可以通过一句话、一个文件、一张图片或一段视频“欺骗”大模型,对个人而言可能输出违法违规内容,对政企而言会造成内部文档和核心数据泄露。
虚假信息让AI 误把恶意指令当可信输入
网络安全专家介绍,“提示词注入”的本质,就是攻击者通过伪造虚假提示信息,让大模型误把恶意指令当作可信输入。“提示词注入”就是精心构建伪造,比如仿造一个key(密钥),里面的证书可能跟正常的一样,通过非常巧妙的方式获取进入AI的权限,进去之后,拿到了权限,可以拿数据,干一些坏事,比如生成一些有护栏之外的视频,或者文字、图片。它本质上是进去拿权限,突破大模型的安全护栏,来做各种各样恶意的事情。
“提示词注入”并不是单一的攻击手法,而是一整套“战术”。有的攻击者让AI“扮演”另一个角色,用新指令盖过已设定的规矩;有的攻击者把恶意指令提前藏进网页、邮件、文档里,AI一读取就中招。
“提示词注入”对个人而言,会造成隐私数据的泄露、敏感信息的泄露、个人财产的损失,甚至可以被不法分子利用身份去做其他的事情;对企业而言,它可能会泄露企业机密,给企业业务造成损失,经济上的损失,包括对于舆情方面的影响。
那么,“提示词注入”攻击都有哪些类型?
据网络安全专家介绍,根据攻击者与目标系统的交互关系,“提示词注入”攻击主要划分为以下几种类型:
- 越狱型攻击:攻击者通过对话直接提交恶意指令,意图突破模型内置的安全护栏。典型模式包括身份覆盖、情境豁免等。
- 数据投毒型攻击:攻击者不直接与目标模型对话,而是将恶意指令预先埋设在模型必然会读取的外部数据源中。常见投毒载体包括网页隐藏元素、邮件签名、数据库备注字段等。
- 渐进诱导型攻击:攻击者将完整的恶意指令拆解成多个独立看似无害的子任务,分散在多轮对话中逐步交付。
- 认知欺骗型攻击:攻击者通过赋予模型特定角色、唤起共情、制造紧急场景,让模型主动放弃防御。
- 逃逸攻击:攻击者通过对恶意指令进行形式变换,使其逃过基于关键词的浅层过滤,同时保证模型仍能理解其真实意图。
如何建立 全生命周期安全防护体系?
网络安全专家提示,近年来,一些机构单位开始部署私域大模型,但是却没有同步建设安全护栏。面对“提示词注入”攻击,应该如何防护呢?
对于“提示词注入”,其实防护手段有三类:第一类是让大模型自己有一个护栏;使用的过程中,可以做风险鉴定的平台,实时去看“提示词注入”的每一个动作,最后一步是实时溯源,可以通过对于日志的留存,包括它的行为流程、审计行为,做整个访问的控制。
案例:篡改AI安全机制 制作淫秽物品被判刑
“提示词注入”攻击的背后,是AI安全机制被突破的严峻现实。而当这种突破从“外部攻击”升级为“内部篡改”,法律责任该如何认定?
近日,浙江宁波余姚市人民法院宣判的一起案件为技术滥用划出了清晰的法律红线。
被告人郑某原本是一家游戏公司的程序员,2024年7月,他接触到境外一款AI色情聊天机器人后,萌生了开发同类软件非法牟利的想法,随后纠集五人组建团队开展研发。2025年1月,涉案AI模型在境外平台上线,接入多种境外支付渠道收费牟利。犯罪团伙运用提示词工程,改写模型底层设置,搭建特定角色对话场景,突破AI原生安全过滤机制。付费用户选定角色后,可进行色情聊天,还能通过消费积分批量生成各类淫秽静态、动态图片。
2025年9月,郑某等六名犯罪嫌疑人被公安机关抓获。经鉴定,在上述图片中随机抽取的12500张静态图片和全量动态图片中,有9000多张静态图片、5000多张动态图片被认定为淫秽物品。
余姚市人民法院刑事审判庭一级法官诸张琳:“技术中立”不是违法犯罪的挡箭牌,不能以内容由AI生成就否定了开发者的“制作者”身份。开发者主动篡改模型安全机制,搭建便于产出淫秽内容的技术环境,对淫秽内容的产生具备实质控制力,即便由用户输入指令触发内容生成,开发者仍属于刑法意义上淫秽物品的制作者,应当承担相应刑事责任。
法院审理查明,六名被告人以牟利为目的,结伙利用人工智能制作淫秽物品,情节严重,均构成制作淫秽物品牟利罪,分别判处六人有期徒刑三年一个月至三年十个月,并处罚金。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全学习那些事儿 《一句话“骗”过AI 警惕“提示词注入”攻击风险!》