文章总结: 本文系统梳理AI安全领域核心术语,涵盖GenAI基础概念、提示注入攻击、智能体风险、数据供应链安全及治理框架等关键主题。文章强调AI安全威胁的多样性与复杂性,指出护栏是概率过滤器而非安全边界,建议采用零信任架构、PDP/PEP分离等实践强化防护,并映射至OWASP等标准框架。
综合评分: 85
文章分类: AI安全,安全培训,威胁情报
AI 安全词典:今年每场技术对话都会用到的术语,一次讲清
原创
破天KK
破天KK
KK安全说
2026年9月23日 09:00
中国香港
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
一、核心 GenAI 词汇(跟得上对话的最低配置)
Token(词元)LLM 读写的最小单位;不完全是一个词,也不完全是一个字符。成本、上下文窗口限制,以及多种攻击(token 走私、同形字规避)都以 token 计价。理解分词,是理解过滤器绕过的前提。
Context window(上下文窗口)模型单次调用能关注的总 token 量(提示 + 历史 + 检索数据 + 输出)。它也是攻击者利用得最狠的单一信任边界——任何进入其中的内容,无论来源,都被模型赋予同等权威。
Embedding(嵌入)文本/图像/音频的稠密向量表示,捕捉语义,用于搜索、RAG 检索和相似度打分。嵌入可能把原始内容泄露回去(嵌入反演),而且在向量库里很少加密存储,是一个被低估的数据外泄面。
RAG(检索增强生成)查询时抓取相关外部文档注入提示,让模型基于当前、有据的数据回答,而不是只靠训练时知识。每一个检索到的片段默认都是不可信输入——这是间接提示注入最大的入口。
Fine-tuning / LoRA / RLHF(微调 / LoRA / 人类反馈强化学习)把基础模型权重适配到任务或对齐到偏好的技术,从全量重训到轻量适配层(LoRA)再到偏好优化(RLHF/DPO)。几百条被投毒的训练样本就能植入一个能扛过常规评估的后门——攻击面从”你发给模型什么”转移到”什么塑造了模型”。
Agent / Agentic AI(智能体 / 智能体式 AI)一个循环执行”感知 → 推理 → 行动”的系统,调用工具、保留记忆、做多步决策,人类在环审查有限。GenAI 安全从这里开始不再是理论:有工具访问权的 agent 能做事,不只是说话——一次成功攻击的爆炸半径从”坏文本”跳到”转账”或”代码执行”。
System prompt(系统提示)应用开发者设置的指令,定义模型角色、边界和行为,在用户输入之前前置。它不是安全边界——只是模型会和其他上下文内容一起权衡的强烈建议,所以”直接告诉它别这么做”从来扛不住红队测试。
Hallucination(幻觉)模型生成流畅、自信但事实错误或不受输入支持的内容。安全相关,因为攻击者会故意利用(slopsquatting:幻觉出来的包名后来被注册成恶意软件),也因为 agentic 流水线里无据的输出可能基于错误前提触发真实动作。
MCP(模型上下文协议)一个开放标准,让 LLM/agent 通过统一接口发现和调用外部工具与数据源,取代每个工具各写一套的集成方式。它也标准化了一个新的信任边界:一个恶意或被攻陷的 MCP 服务器,可以通过工具描述注入指令,而不只是工具输出。
二、提示与输入攻击
Prompt injection(提示注入)构造输入来覆盖或劫持模型指令,让它忽略系统提示或开发者意图。它在 OWASP LLM 应用 Top 10(2025/2026)中排第一,因为它是大多数下游失败的根因——越狱、数据泄露、未授权工具调用,通常都从这里开始。
Direct vs. indirect prompt injection(直接 vs. 间接提示注入)直接注入来自用户自己的输入;间接注入被埋在模型之后检索或读取的第三方内容里(网页、文档、邮件、工具结果)。间接注入是更难的问题——受害者从未输入恶意指令,所以面向用户侧的输入过滤完全无效。
Jailbreak(越狱)精心构造的提示,绕过模型的安全训练,产出它被对齐去拒绝的内容或动作(角色扮演人格、DAN 式框架、多轮侵蚀)。越狱专门针对模型的对齐层,与针对应用指令遵循的提示注入不同——两者经常被串联使用。
Prompt leaking(提示泄露)提取隐藏的系统提示本身,通常通过”重复以上所有内容”或翻译/编码技巧。除了尴尬,泄露的系统提示往往暴露内部工具名、业务逻辑和护栏措辞,攻击者可据此反向工程绕过。
Token smuggling(Token 走私)拆分或编码恶意指令(base64、Unicode 同形字、零宽字符、翻译往返),让它躲过基于关键词的输入过滤,但仍能被模型分词器正确解析。这就是为什么仅靠正则/关键词护栏,面对有动机的对手几乎毫无价值。
Multi-turn / crescendo attack(多轮 / 渐强攻击)在多个看似无害的轮次中逐步逼近一个被禁止的请求,而不是直接问,利用模型维持对话一致性的倾向。只针对单条消息的护栏完全漏掉这种攻击——检测必须对整个会话推理。
Adversarial suffix(对抗后缀)一串看似乱码的 token 附加到提示后,通过梯度优化(如 GCG)发现,能可靠破坏模型对齐。值得注意的是它是一种自动化、可迁移的攻击:针对开源权重模型找到的,往往对闭源商业模型也有效。
三、输出与下游处理
Improper output handling(输出处理不当)把 LLM 输出当作可信内容,未经净化就传给下游——SQL 查询、shell 命令、渲染的 HTML,或另一个工具调用。这是经典注入漏洞类别穿了件 AI 外衣;修复方法一如既往(参数化、沙箱、编码),只是更容易忘,因为”是模型写的”。
Insecure output rendering / LLM-XSS(不安全输出渲染)把模型输出直接渲染进网页或聊天 UI 而不转义,让攻击者注入的提示产出在受害者浏览器执行的脚本。这是一个普通 XSS 漏洞,只是 payload 投递机制恰好是 LLM。
Excessive agency(过度自主权)给 agent 的权限、工具访问或自主性超过任务所需,导致一次成功操纵(提示注入、工具投毒)就能级联成高影响动作。它在 2026 OWASP LLM Top 10 跳到第 3 名,正是因为 agentic 部署不断以宽泛、未限定范围的工具授权上线,”为了安全”——恰恰与真正有用的做法相反。
Cascading hallucination(级联幻觉)在多 agent 或多步流水线中,一个 agent 的幻觉输出变成另一个 agent 的可信输入,错误在每一跳复合,直到最终动作自信地出错。传统单轮评估抓不到这个——你必须测流水线,不是测模型。
四、智能体与多智能体风险
Memory poisoning(记忆投毒)向 agent 的持久记忆(情景、语义或向量存储)注入虚假或恶意内容,让它在原始攻击输入早已消失后仍影响未来会话。这击败了”就是不要信任这一次输入”的常规缓解——毒药现在成了 agent 的基准事实。
Tool poisoning / tool misuse(工具投毒 / 工具滥用)操纵工具的描述、文档或响应,诱骗 agent 用攻击者选定的参数调用它,或操纵 agent 把合法工具用在预期用途之外。因为 agent 基于自然语言描述选择工具,一个被投毒的描述,实际上就是一次带着名字和权限集的提示注入。
Confused deputy attack(混淆代理攻击)agent 用自身高权限,代表低权限或恶意请求者行动,因为它分不清”用户让我做 X”和”我读到的内容告诉我做 X”。这是 agentic AI 的标志性失败模式——传统 IAM 的”一个主体一个会话”模型,对一次调用里戴多顶帽子的 agent 毫无答案。
Rogue agent action(失控 agent 行动)agent 自主采取有害、未授权或超出范围的动作,人类从未批准那个具体步骤,通常来自一系列较小操纵的累积。这就是为什么”人类在环”被重新设计成”人类在关键检查点”——全时监督跟不上 agent 的速度。
Agent-to-agent (A2A) communication attack(智能体间通信攻击)利用多 agent 系统中协作 agent 之间的信任——一个被攻陷或恶意的 agent 向同伴喂投毒指令,而同伴把同伴消息当作权威。多 agent 架构扩大攻击面的速度,快于扩大防御的速度,因为大多数护栏工具是为”单 agent 对单人类”建的。
Lethal trifecta(致命三要素)一个具体的高风险组合:(1)访问私有/敏感数据,(2)暴露于不可信外部内容,(3)具备对外通信能力(发邮件、调 API、发数据)——三者同时存在于同一个 agent。三者同时成立时,间接提示注入不再是骚扰,而是直接的数据外泄路径;去掉任何一条腿就能断链。
Denial of wallet(钱包拒绝服务)AI 时代的拒绝服务:攻击者(或失控的 agent 循环)把 token 消耗推到 API 账单——而不是服务器——先倒下。因为推理按 token 计费,成本飙升告警往往是最早的信号,表明 agent 已被劫持或卡在循环里——比任何功能性错误都早。
Runaway agentic loop(失控智能体循环)agent 卡在反复重新规划、反复调工具、反复重试而没有终止条件,烧钱并可能每轮重复采取不需要的动作。这是”感知-规划-行动-反思”循环的设计失败,本身不是攻击,但攻击者可以故意触发一个来推高成本或耗尽保护其他租户的速率限制。
五、数据、RAG 与模型供应链
Data poisoning(数据投毒)污染训练、微调或 RAG 摄取的数据,让模型学到错误事实、后门触发器或偏见行为。与提示注入区分:投毒腐蚀知识,注入腐蚀单次交互——投毒有耐心且持久,注入是每请求一次。
Model inversion / training data extraction(模型反演 / 训练数据提取)以某种方式查询已部署模型,从其普通、授权的访问中重建或推断训练数据的具体内容,包括记忆的 PII。这就是为什么”模型训练后从未见过原始数据”和”数据不可能泄露”不是同一个说法——** regurgitation 和成员推断是真实、可测量的现象,不是假设。**
Membership inference attack(成员推断攻击)仅通过观察模型对某条记录的输出/置信度,判断该记录是否属于训练集。这本身就是隐私侵犯(例如”这位患者的记录是否被用于训练这个模型”),即使没有提取记录内容。
Embedding inversion(嵌入反演)仅从向量嵌入重建原始文本(或足够接近到敏感的东西)。因为嵌入的存储、缓存和共享往往比原始文本更宽松(”只是数字而已”),这堵上了一条团队常以为不存在的泄露路径。
Cross-tenant leakage / RAG(跨租户泄露)多租户 RAG 系统因元数据过滤损坏、共享索引或向量库缺少行级安全,检索并暴露另一个租户的文档。这是经典 IDOR/访问控制缺陷的 AI 时代版本,只不过”记录”是语义匹配,不是主键,测试中更容易漏。
Citation spoofing(引用伪造)LLM 捏造或错误归因一个看起来权威的来源引用,或来自幻觉,或来自攻击者故意在可检索内容里埋入假但可信的”来源”。特别危险,因为引用是用户被训练去信任为有据证明的 UX 信号。
Model serialization attack(模型序列化攻击)利用模型检查点格式(.pkl、.pt、不安全的 .bin)中的不安全反序列化,在受害者加载文件的那一刻实现任意代码执行——无需推理。这就是为什么基于 pickle 的格式正被淘汰,转向 safetensors,后者只存张量数据,加载时无法执行代码。
AI/ML supply chain attack(AI/ML 供应链攻击)在你的部署上游任何位置引入的攻陷:公共 hub 上被投毒的预训练模型、仿冒拼写的模型/包名、被攻陷的训练数据集,或训练流水线里的恶意依赖。模型来源和签名(类似软件的 SBOM/SLSA)是新兴控制手段,常被称为MLBOM(模型/ML 物料清单)。
Model weight exfiltration(模型权重外泄)窃取训练好的模型权重本身,被前沿实验室视为皇冠明珠级 IP 资产——区别于窃取训练数据或通过查询提取行为。这是前沿 AI 治理的首要关切,因为权重一旦流出,无法像泄露的凭证那样撤销或打补丁。
六、护栏、评估与治理
Guardrail(护栏)一种输入、输出或工具调用过滤器(分类器、正则、策略引擎或第二个 LLM),在内容被行动前对照安全/策略边界检查。关键:护栏是概率过滤器,不是安全边界。它降低可能性,不保证阻止;把它当后者是一种设计错误,几乎出现在每一份 agentic 事件复盘里。
LLM-as-judge(LLM 当裁判)用一个 LLM 按评分标准给另一个模型(或它自己)的输出打分,规模是人类审查比不上的。它引入了自己的攻击面:裁判提示注入——被评分的响应内容操纵裁判给出本不该给的通过分。
Eval / golden dataset(评估 / 黄金数据集)一套精心整理、带版本、有已知正确预期输出(或评分标准)的测试输入,用于在发布前回归测试模型或提示变更。它用可重复的门禁取代”凭感觉”的人工抽查。AI 时代的单元测试套件,也同样在交付压力下被忽视。
Red-teaming / AI/GenAI(红队测试)由人或自动化 agent 对模型或系统做结构化对抗测试,在真实攻击者之前故意打破其安全、安全或策略边界。OWASP 的 GenAI 红队指南和 NIST 的 AI RMF 都把此视为必需的、反复进行的实践,不是一次性的发布前打勾。
Zero trust for AI agents(AI agent 零信任)把”永不信任、始终验证”扩展到 agent 对 agent、agent 对工具的调用:每个动作都按调用认证、授权、限定范围,而不是从长生命周期会话里继承一次。它通过拒绝让 agent 身份静默代表用户,直接对抗混淆代理问题。
PDP / PEP(策略决策点 / 策略执行点)把”判断 agent 动作是否被允许”(PDP,对照策略评估)和”在动作将执行的点强制执行该决定”(PEP)在架构上分开。这就是把”系统提示说了不许”变成 agent 无法靠推理绕过的真实技术控制的关键。
AI-BOM / MLBOM(AI 物料清单)模型或 AI 系统所有成分的清单——数据集、基础模型、微调数据、依赖、评估结果——支持来源检查和事件范围界定。它让”我们是否被 HuggingFace 上那个被投毒的模型影响”能在几分钟而不是几天内回答。
Canary token / for prompts(金丝雀令牌)嵌在系统提示或文档里的唯一、静默标记,专门用于:如果它之后出现在模型输出或外泄通道里,你就有证据证明内容被泄露或提示被提取。对提示泄露和间接注入外泄来说,是廉价、低投入的检测控制。
AIVSS(AI 漏洞评分系统)一个新兴的、CVSS 风格的评分框架,专门针对 AI/agentic 风险,权重因素包括自主性级别和爆炸半径——这些是 CVSS 的软件漏洞模型捕捉不到的。有用,因为纯 CVSS 分数一致地低估 agentic 发现:它没有字段表示”这个 agent 在初始攻陷后还能独立再采取五个动作”。
七、你被要求把发现映射到的框架
OWASP Top 10 for LLM Applications被引用最多的 LLM 专属风险分类(提示注入、敏感信息泄露、供应链、过度自主权、输出处理不当等),现处于 2025/2026 活跃修订中。向另一个安全团队描述 LLM 应用发现时的默认通用语。
OWASP Top 10 for Agentic Applications / Agentic Skills上述框架的扩展,针对 agent 专属风险(记忆投毒、工具滥用、失控行动)和更新的”skills”层(打包的指令 + 继承宿主 agent 权限的代码)。当发现关乎自主性和委托,而不只是单轮模型行为时,用这些。
OWASP Top 10 for MCP模型上下文协议部署的协议专属风险清单:恶意服务器信任、工具描述注入、协议层凭证泄露。你的架构一包含任何 MCP 服务器(一方或三方),它就相关。
MITRE ATLAS一个专门针对 AI/ML 系统的对手战术和技术知识库,结构像 ATT&CK,但针对模型提取、规避、投毒和推理攻击。当你需要攻击者 TTP,而不只是风险类别时用它——它映射一场针对 AI 系统的真实战役会如何展开。
NIST AI RMF(及 AI 600-1)美国政府的自愿风险管理框架(治理、映射、度量、管理),用于可信 AI,AI 600-1 是生成式 AI 专属配置。当受众是治理/风险而非工程时,这是首选框架——它讲组织控制,不讲攻击 payload。
ISO/IEC 42001AI 的国际管理体系标准,结构像 ISO 27001 但针对 AI 治理——政策、风险评估、生命周期控制、可审计性。企业客户和监管者越来越多地要求它,作为成熟 AI 治理计划的可认证证明。
CSA MAESTRO云安全联盟专为多 agent/agentic 系统打造的风险建模框架,逐层枚举 agent 栈中的威胁,并跨越 agent 间信任边界。当被审查的系统是多 agent 编排,而不是 API 后面的单个模型时,用它替代普通 STRIDE。
Databricks AI Security Framework (DASF)一个面向实践者的控制框架,把安全控制映射到 AI/ML 生命周期的具体阶段(数据、模型、服务、监控),对平台团队把上述框架落地成具体清单很有用。
结语
这本词典的目标让你不再在关键对话里掉线。术语背后是真实的攻击面、真实的失败模式和真实的控制手段。
写在最后,清记住三件事:
- 系统提示不是安全边界,护栏也不是。 它们是概率过滤,不是技术控制。
- 间接提示注入是核心难题。 受害者从未输入任何东西,所以用户侧过滤毫无意义。
- agent 把爆炸半径从”坏文本”变成”真实动作”。 权限、工具、自主性——每一项都要按最小必要原则重新审视。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:KK安全说 破天KK
破天KK《AI 安全词典:今年每场技术对话都会用到的术语,一次讲清》