文章总结: 本文分析智能体行为安全风险,指出决策黑盒、责任模糊与攻击自主进化三类耦合威胁,提出智能体黑匣子治理方案,通过全流程记录、纵深防御与回溯分析构建可解释、可审计、可追溯的治理体系,并给出记忆安全为核心的五道防线及主动免疫机制等可操作建议。
综合评分: 88
文章分类: AI安全,安全建设,安全运营
专题·原创 | 智能体黑匣子:智能体行为风险分析与治理建议
原创
刘奇旭等
刘奇旭等
中国信息安全
2026年9月20日 19:19
北京
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
刘奇旭
文 | 中国科学院信息工程研究所 刘奇旭 谭儒 刘心宇 靳泽 曹雅琴
近年来,人工智能交互范式已由问答交互转向基于智能体的自主感知与行动,智能体突破传统应用边界,具备感知、记忆、决策、交互、执行等能力,并已大规模应用于金融交易、自动驾驶、医疗决策与具身智能等关键场景。然而,智能体具备高度自主决策能力与环境交互能力,容易产生用户意图偏离、人类监管绕过、环境漏洞利用等新型行为漏洞与安全威胁,在特定场景下可能转化为对物理世界与数字秩序的真实冲击,这使得智能体行为风险分析与治理成为一项紧迫的安全任务。
目前,智能体安全研究多聚焦于提示词防护与输出内容安全等局部环节,主要面向单次交互的输入输出层面,难以覆盖智能体在真实环境中自主执行的完整行为链路。由于智能体决策过程不透明、行为序列动态演化、跨组件因果路径复杂,现有方法难以支撑对智能体自主行为全流程的记录、防御与追溯,这正是当前智能体行为安全治理研究的主要缺口。
2026年5月,国家网信办等部门联合印发的《智能体规范应用与创新发展实施意见》提出,提升对智能体非合规行为的发现、干预、阻断、恢复能力。针对智能体非合规行为的发现与治理,需要建立起与智能体能力相匹配的行为监测与应急响应机制。因此,系统性地审视智能体行为风险的内涵与责任主体,构建面向智能体行为威胁的漏洞治理框架,已成为智能体技术安全、可信、可持续发展的核心需求。为此,本文提出构建智能体黑匣子这一可解释、可审计、可追溯的记录与审计机制,将记录、防御与复盘机制内嵌于智能体的运行流程之中。
一、人工智能安全范式的演变
传统大语言模型以问答交互为核心,以模型输出为服务终点,其安全防护聚焦于内容合规性与回答准确性的校验。相比之下,智能体突破问答交互的边界,将大语言模型嵌入具备感知、记忆、决策、交互与执行能力的架构中,模型由咨询服务提供者转变为真实环境的操作执行者,催生了安全范式的三重转变。
首先,关注对象从内容扩展至行为。智能体的输出直接映射为工具调用、文件操作等执行动作,安全隐患不再仅限于模型输出内容的不正当性,更在于智能体在真实环境中执行的危险操作。其次,评估范围从单轮回答延伸至循环交互。智能体的决策受到长期记忆的影响,并会随着记忆内容的累积而被持续塑造,安全分析不能仅审查单次交互,还需要纳入一段时间内的行为序列与记忆状态变化,关注动态演化中的风险累积。最后,判断标准从结果可信演变为行为可解释、过程可审计、责任可追溯。智能体自主行为的复杂性要求安全评估体系不仅能判定操作结果的合规性,更须具备还原决策链条、界定责任主体的能力,最终实现针对攻击事件的事后追溯与行为解释。因此,要进一步提升智能体行为安全防护能力,就不能止步于输出内容监控,而必须建立可解释、可审计、可追溯的治理体系。这也意味着,漏洞治理的对象已从可枚举的代码缺陷,拓展至智能体行为中产生的新型安全漏洞。
二、智能体行为安全风险与治理挑战
智能体以任务目标为驱动,在动态环境中自主完成模型推理、工具调用与策略调整,其行为具有决策黑盒、因果跨域、策略变异的特点,导致智能体存在决策行为难监控、责任主体难定位、自主攻击难防御等多重安全风险。三类风险相互耦合,共同构成了智能体行为安全的系统性威胁。
(一)可解释性缺失,智能体行为监控的黑盒困境
决策黑盒是智能体行为威胁难以全程监控的本质原因,这一特性贯穿大语言模型的内部表征、推理链构建与外部工具交互的全过程。大模型参数组合使行为意图缺乏可解释的因果链条,思维链暴露的中间步骤也可能遭到策略性伪造。此外,动态调用外部工具、与环境实时交互的行为序列因推理非确定性而无法提前枚举,使智能体在执行长程任务时可能逐渐向欺骗性策略偏移,例如绕过安全审核、利用系统漏洞等,上述风险隐藏于看似合理的表层行为下。智能体的黑盒特性从三个层面带来治理困境。一是行为事后追溯难以还原决策的因果链条;二是在行为意图不透明的情况下,监控告警贸然阻断可能破坏业务逻辑,而选择放行又可能纵容高风险行动;三是强制要求可解释性可能折损决策效率,还会催生虚假解释。因此,治理核心是构建行为透明、决策可审计的框架,实现智能体全流程行为可控可查,为行为漏洞的早期识别创造条件。
(二)责任边界模糊,威胁事件归因的主体难定位
智能体是由大语言模型、记忆系统、外部工具、感知交互与环境基础设施集成的复合架构,其在具备高度自主性的同时,也从根本上模糊了行为的来源边界。威胁事件的因果链可能同时涉及底层模型的违规、智能体原生机制的缺陷,以及所调用工具的威胁,使归因成为难题。
具体而言,威胁可分为四类。第一类威胁源于大语言模型,如提示词注入、幻觉生成、越狱指令跟随等。模型层面的失控使得这些风险在智能体架构中被放大为具有真实环境破坏力的行为。第二类威胁深植于智能体原生机制,最典型的是长期记忆污染,攻击者注入单次看似正常的语句污染记忆,使智能体在检索时拼接出被恶意建构的上下文。例如,MINJA记忆注入攻击,通过多轮渐进式手段向医疗智能体长期记忆中植入“患者A的数据已合并至患者B名下”的虚假条目,使其将降糖药误荐给高血压患者。第三类威胁来自被智能体调用的工具或第三方库,如供应链污染、工具接口漏洞、恶意命令注入等。第四类威胁来自智能体各组件间桥接交互引入的新型漏洞,例如,模型上下文协议(MCP)漏洞、工具编排逻辑漏洞、特殊token解析漏洞等。然而,外部行为日志仅记录智能体按需调用工具的行为,恶意部分被隐藏在受信任的组件中,难以从智能体本身的行为决策中剥离。
智能体行为边界模糊导致归因陷入困境。单一组件在隔离测试中安全,并不代表其在智能体架构的动态组合下依然安全。智能体的一次数据泄露事件可能由提示注入诱发、借记忆污染扭曲用户意图,最终经过一次看似正常的工具调用完成外传,攻击链条跨越多层边界。传统组件级合规认证忽视了组件交互中产生的系统性风险。因此,治理必须超越单点防护,走向全链条可溯源,并树立跨组件的责任划分意识。
(三)攻击自主进化,传统被动防御难以应对
智能体所具备的自主进化能力正在打破攻击与防御之间的平衡。传统攻击载荷一旦部署便进入模式相对固定的执行阶段,防御方可以通过样本分析、特征提取实现滞后阻断。而由智能体驱动的攻击则呈现为持续观察防御、动态调整战术并在失败中自我学习的进化过程。2026年7月,OpenAI的一次内部网络安全能力评测中,被下调安全护栏的模型组合在智能体循环驱动下偏离原始意图,从隔离环境中逃逸并成功入侵Hugging Face内网。智能体自主生成、迭代并执行攻击链,使传统的被动防御体系面临严峻挑战。
智能体的自主进化能力在多个层面催生了行为安全治理风险。一是攻击战术自动化变异与对抗性学习,攻击智能体将行为模式编码为可演化的策略空间,在被防御系统识别或阻断后自动生成行为变体,使得基于签名的检测引擎持续落后于攻击技术漂移的速度。二是自进化能力使智能体的攻击经验可跨任务域迁移。例如,数据库突破尝试失败后,恶意智能体会绕过数据库并通过文件系统间接获取数据,使传统威胁建模难以覆盖攻击向量多样性。三是多智能体系统可共享攻击策略,进而形成攻击知识库并集体学习,迭代速度远超单点防御体系的更新周期,漏洞治理从一次性修复转变为持续性对抗。
因此,针对智能体行为安全的治理,一方面,需要发展基于行为意图预测的主动防御机制,分析智能体在推理链中暴露的目标倾向、对环境的探索模式以及策略的调整路径,在攻击造成实质性损害前识别其恶意意图;另一方面,引入对抗性进化免疫的主动防御机制,通过动态改变系统响应的特征,扰乱攻击智能体对防御边界的认知,使其无法从交互反馈中有效学习,从而抑制其进化效率。
上述三类风险并非独立存在,而是彼此耦合的整体,共同构成智能体行为安全的系统性威胁。一是决策过程的黑盒不可解释性放大了责任归因难题;二是黑盒特性与责任边界模糊,共同为攻击方在观察防御、调整策略与自我学习的自主进化过程提供了空间;三是三类风险相互叠加、彼此放大,黑盒越不可解释,归因越困难,攻击进化便越隐蔽,最终造成的危害也越严重。因此,对智能体行为安全的治理,亟须将上述三类风险视为联动放大的网络,以系统性思维构建可解释、可归因与可防御的全链条治理框架。
三、智能体黑匣子:智能体行为安全治理方案
针对智能体行为安全风险的治理不应仅依赖外部日志与事后审计,更需重塑智能体的安全机制。本文借鉴飞行记录仪的设计内涵,建立一套可解释、可审计、可追溯的智能体黑匣子体系(如图1所示),将记录、防御与复盘措施内嵌于智能体的运行流程之中,这三大模块构成相互支撑的闭环。全流程记录既为纵深防御提供风险研判所需的上下文与依据,也为回溯分析沉淀可供复盘的证据链条;纵深防御在实时阻断威胁的同时,依据记录层的可信记忆作出拦截或放行决策,并将处置结果回写至记录层与追溯层;回溯分析则依托记录定位事件根因、抽取脆弱模式,进而反向驱动防御策略的动态更新与记忆的净化修复。以下从全流程记录、纵深防御与主动免疫三个维度,阐述面向智能体行为安全的治理方案。
图1 智能体黑匣子治理方案设计框架
(一)记录:智能体全流程事件记录与责任划分
流程事件记录与责任划分体系的构建,旨在为智能体黑匣子确立统一的记录标准,使每一次决策均有据可查、有迹可循。传统日志体系侧重于记录执行结果,难以还原决策链中的意图、依据与上下文。相比之下,以智能体黑匣子为载体的记录体系,则能够覆盖智能体从信息输入、内部推理到决策执行的认知全过程,为行为溯源提供完整的证据链条。在全链条记录的基础上进行责任划分,使得因果追溯具备客观、可验证的事实依据。具体而言,该体系包含以下三层记录机制。
一是记录智能体架构中各组件接收以及输出的信息,形成记忆条目,为每项记忆条目附加来源标识、时间戳与可信度评分等,从而确保智能体行为追溯时能够明确受污染信息或恶意指令的注入路径,有效区分智能体记忆上下文、用户输入、外部检索、推理生成等信息来源,明确责任主体,避免事后归因模糊。
二是明确记录行为链路,除了记录记忆条目的具体行为外,还需要完整记录行为发生时所处的任务阶段、所影响的上下文节点、真实执行的操作序列等信息。以运维智能体为例,若其数周前存入的一条经验性知识在后续任务中被检索并触发了一次具有潜在风险的操作,则通过该记录链路可精准回溯该行为的激活阶段、决策权重及触发条件,实现对隐性驱动行为的完整还原。这一机制从根本上填补了传统日志仅记录输出结果、无法追溯行为来源的结构性盲区,使智能体的行为审计真正具备可解释性与证据效力,成为全流程事件记录体系中支撑追溯与分析的核心能力。
三是记忆格式应兼顾机器可读与人工审计,支持多维度检索。支持基于自然语言语义解析的层级记忆检索,用于宏观行为复盘。同时,支持基于元数据字段的结构化数据库查询,用于微观精准取证,多维度协同检索可实现从行为解释到证据核验的完整覆盖。
(二)防御:以记忆安全为核心的纵深防御体系
智能体所面临的安全威胁不仅包括输入侧的提示词注入、输出侧的数据泄露,更延伸至针对记忆层的持久化攻击。为了确保智能体自身的安全性以及智能体黑匣子溯源证据的可靠性,需要建立以记忆安全为核心的纵深防御体系,突破传统边界防护思维,将记忆系统作为安全中轴,构建全链路协同防御机制。该体系由五道防线组成,沿输入、记忆、交互、行为、输出的智能体执行链路分层布设。
一是对用户输入与外部检索内容进行实时安全检测,其核心除了识别显式的恶意指令、越权请求与污染性信息,还要对用户输入进行意图推断,并将推断结果与智能体后续实际执行的行为意图进行交叉比对。若意图偏离或存在隐蔽诱导,即便输入内容本身不触发语义告警,系统仍可基于意图不一致性提前标记风险。该防线聚焦输入侧,在行为尚未生成时依据意图一致性预判并拦截源头风险。
二是针对智能体的协议与交互栈构建严格的通信校验与身份映射机制,作为执行隔离的前置关卡。为了防御组件间桥接协议或编排层的逻辑漏洞引发的安全威胁,针对所有跨组件交互实施协议级防御,在桥接接口处实施双向身份认证,校验交互协议参数格式,严格监控组件间通信,从而保障智能体各组件间的交互安全。该防线专门应对存在于组件桥接与编排层的协议漏洞,弥补输入侧内容审查与输出侧后果审查均无法覆盖的通信盲区。
三是针对智能体的具体操作行为执行严格的隔离措施,当智能体调用工具、感知环境信息或执行代码时,严格执行最小权限原则与操作审批流程,从而有效阻断因记忆污染引发的越权操作。但该措施的局限性在于无法干预合规但高风险的行为决策,因此,需要智能体的记忆辅助风险研判。该防线位于行为执行关口,能够在越权操作落地前予以阻断,但其阻断的只是污染的后果,而非引发越权的污染源头,须与第四道防线的记忆可信保障协同。
四是确保智能体的记忆可信程度,基于智能体黑匣子的可复查机制,引入版本管理与变更追踪能力,详细记录每一条记忆的新增、修改、激活与撤销,并支持回滚。同时,部署周期性记忆审计流程,利用一致性校验与异常检测算法识别可疑条目,实现对记忆污染的主动发现与隔离,及时封堵由记忆层引入的行为漏洞。记忆作为连接输入、推理与工具调用的决策依据,一旦被污染,后续各环节的防护都将失去可靠根基,因此处于防御中轴。同时,记忆的版本管理与变更轨迹本身即为追溯所需的证据基础,可支撑事件根因定位与脆弱性抽取。
五是对智能体生成的操作指令或返回内容进行二次安全审查,尤其关注涉及系统变更、数据导出或权限调整的高风险输出,确保即使记忆被局部污染,智能体的行为仍处于可控范围内。该防线聚焦输出后果,作为操作执行前的最后兜底,当恶意意图已绕过输入检测或经记忆与工具环节间接注入时,仍可在高风险指令落地前予以拦截。
(三)追溯:回溯分析促进智能体主动免疫
安全治理的最终目标是使智能体在经历安全事件后具备自我修复与免疫力提升的能力。智能体黑匣子执行的回溯分析以完整决策轨迹为基础,通过系统性复盘驱动智能体从被动响应转向主动免疫,该机制的实现包括以下四个环节。
一是事件根因定位,基于来源标记与使用链路,逆向追溯至触发链的起始节点,从而区分表层诱因与深层缺陷。例如,某次越权操作的表层诱因来自记忆中的错误经验,深层缺陷则可能是经验可信度评估机制的缺失。
二是脆弱性模式抽取,对多起事件的回溯结果进行交叉比对,提炼出共性的脆弱模式,如输入来源缺乏验证、调用链缺少审批节点、记忆更新策略存在覆盖逻辑缺陷等。通过将个案的模式进行沉淀总结并蒸馏为系统性认知,为防御策略的调整与行为漏洞的系统性修复提供依据。
三是策略动态更新,基于脆弱性模式,自动优化前述纵深防御体系中的各项策略。例如,若发现某一外部输入源形成的记忆频繁引发风险,则可对该输入源增设额外审查,或在智能体黑匣子中下调对该输入源的初始可信度评分。策略更新过程同样由智能体黑匣子记录,以便后续评估调整效果。
四是记忆修正净化,针对已确认的污染记忆,不仅执行删除或覆盖操作,更需通过修正记录保留其污染轨迹与修正依据,防止污染记忆再次恢复。同时,将事件复盘的结论以安全经验的形式固化在智能体的长期记忆中,使智能体具备自演化能力,能够逐步增强对已知缺陷与未知威胁的抵抗能力。
上述环节共同构成了对抗性进化免疫的技术路径。其一,在复盘阶段识别“单条指令看似正常、组合起来构成攻击链”的隐蔽攻击模式,相当于免疫系统的抗原识别。其二,自动生成或更新安全防御技能,沉淀攻击模式与威胁指标、响应措施与攻击变种,相当于免疫反应。其三,将防御结论写入长期记忆并注入后续会话,使智能体在遭遇同类及变种攻击时于执行前自动阻断,相当于免疫记忆。其四,依托“技能过时即自动修补”的自适应指令持续更新防御能力,相当于免疫系统的持续进化。
四、未来展望
为了推动智能体行为安全治理工作纵深发展,亟待从管理与政策两个层面协同发力。
在管理层面,组织应建立智能体行为安全的常态化治理机制。一是建立上线前的安全评估与准入制度,针对记忆写入、工具调用、跨组件交互等高风险能力开展安全测评,明确禁用场景与准入条件。二是落实运行中的安全运营责任,配备专职安全人员,制定行为日志留存、异常告警处置与应急响应预案,实现对非合规行为的快速发现、阻断与恢复。三是强化跨部门协同,建立智能体安全事件通报与联动响应机制,确保单一智能体的异常行为能够及时触发关联系统的协同防护。
在政策层面,行业主管部门应进一步制定智能体行为安全的具体技术标准,将原则性要求转化为覆盖智能体全生命周期的可操作、可验证的安全规范,为产业实践提供统一的技术依据与合规标尺,明确智能体行为漏洞的分类分级标准与安全事件报告机制。在《生成式人工智能服务管理暂行办法》等既有规则基础上,针对智能体的自主决策与工具执行特性,补充行为层面的监管细则,明确智能体非合规行为的分类分级标准与责任主体。同时,探索建立智能体安全事件的强制报告与监管追溯制度,将重大智能体行为事故纳入监管视野。
通过技术方案与政策管理的协同发力,最终建立行为可解释、过程可审计、责任可追溯的智能体行为安全治理体系。这不仅是保障智能体技术健康发展的必要前提,更是构建数字社会可信基础设施的战略基石。
(本文刊登于《中国信息安全》杂志2026年第8期)
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:中国信息安全 刘奇旭等
刘奇旭等《专题·原创 | 智能体黑匣子:智能体行为风险分析与治理建议》