文章总结: 《人工智能安全治理框架3.0》于2026年9月14日发布,由国家网信办指导编制。框架延续风险分类、技术应对、综合治理逻辑,梳理54项风险点,新增智能体风险管理框架附件,按全生命周期8环节配7类防范措施,并给出四类主体共51条安全指引。文件为监管风向标,可作为合规自查清单、安全需求基线与供应商测评依据。
综合评分: 88
文章分类: 政策法规,AI安全,安全建设,解决方案
重磅!AI安全治理框架3.0发布:54项风险、51条指引,一文讲透
原创
大白
大白
知白守黑1024
2026年9月16日 06:49
北京
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
“
当AI从「回答问题」走向「执行任务」,安全的重心就从「模型说了什么」,变成「智能体做了什么」。
9月14日,2026年国家网络安全宣传周开幕式上,《人工智能安全治理框架3.0》正式发布。这份文件由国家网信办指导、全国网络安全标准化技术委员会组织专业机构、科研院所和行业企业编制,距离2.0版发布刚好一年。
为什么坚持一年一版?因为这一年AI的变化实在太大。框架前言的原话是:基础大模型在长程任务规划、长上下文记忆、复杂任务推理上持续突破,智能体的任务规划、工具调用和跨应用协作能力不断增强,AI正在从「回答问题」向「执行任务」迭代演进。
这句话是理解3.0的钥匙。当AI的主要产出从一段回答变成一串动作,治理对象就从模型输出本身,扩展到身份、权限、工具、记忆和整条执行链路。3.0延续「风险分类、技术应对、综合治理」的核心逻辑,但每一层都围绕新形态重写了细节。
📌 本文看点
01
54项风险三层地图
02
智能体8环节×7措施
03
51条指引对号入座
01
OVERVIEW
一年一版,3.0到底更新了什么
先看版本节奏:框架1.0发布于2024年9月,2.0发布于2025年9月,3.0发布于2026年9月,一年一版、持续迭代。3.0不是推倒重来,而是在前两版基础上「与时俱进梳理更新风险分类,优化调整技术应对和综合治理措施」。
全文结构五大块:治理原则5条、风险分类3类54项、技术应对3类措施、综合治理5方面、安全指引4类主体51条,外加三个附件。下面这张骨架图,建议保存。
— 框架3.0骨架总览(制图依据:框架原文第1-5章及附件目录)
五条治理原则,一条比一条硬
原则部分3.0延续了五条框架:包容审慎确保安全、风险导向敏捷治理、技管结合协同应对、开放合作共治共享、可信应用防范失控。值得细读的是第五条「可信应用、防范失控」——明确提出加强智能体行为失控等突出风险的防范治理,推动构建法律法规、技术监测、风险预警、应急响应体系,确保AI始终处于人类控制之下。
54
安全风险点
51
安全指引条目
3
专项附件
三个附件,全是干货
附件1是风险分级原则:按应用场景、智能化水平、应用规模三个要素,把风险分为低、一般、较大、重大、特别重大五级。附件2是智能体风险管理框架,全文最重的新增内容,第三章单独拆。附件3是可信人工智能基本准则八条:人类最终控制、尊重国家主权、价值观对齐、提升系统透明度、促进可客观验证、强化安全防护、前瞻预防应对、全球协同共治。
02
RISK MAP
54项风险:一张三层地图
3.0把风险分成三层,逻辑非常清晰:AI作为信息技术,模型、算法、数据、算力自身有缺陷弱点,这是内生风险(17项);作为生产力工具,会被误用、滥用、恶用,这是应用风险(25项);作为模拟延伸人类智能的技术,会冲击社会结构、生态环境、文化范式和伦理规范,这是衍生风险(12项)。三层共14个子类、54项风险点,逐项对照原文整理如下。
— 54项安全风险三层地图(条目引自框架第2章,子类数量为本文统计)
四个专栏,全是新面孔
比清单更值得读的,是3.0专门设置的四个专栏——每一个都对应过去一年真实发生过的安全事件类型。
1
非预期自主行为风险:框架点名了三种情形——模型收到关闭服务指令后拒绝停服、评测中策略性作弊、突破隔离措施入侵外部系统。原文措辞是「根据业界相关报道」,说明已有真实案例可循。
2
自主实施网络攻击威胁:AI加持下的网络攻击正走向自动化、规模化、智能化,攻击形态从「辅助人攻击」向「大模型自主组织执行攻击」演进,传统攻防格局面临重塑。
3
智能体社交平台安全风险:智能体在社交平台自主发帖、互动、形成社群,而现有的账号检测与防护体系尚未覆盖这类新主体。
4
GEO投毒操控大模型推荐内容:通过批量投放倾向性内容,影响大模型对用户查询的输出结果,把商业推广包装成大模型的「客观答案」。GEO(生成式引擎优化)第一次被安全治理文件正式点名。
风险清单越细,治理共识越容易落地。
03
AGENT FRAMEWORK
附件2:智能体风险管理框架
3.0最大的结构性变化,是给智能体单独写了一份附件。原因不难理解:智能体有身份、有权限、能调工具、有记忆,一旦出问题,影响的是真实世界的外部系统。附件2按全生命周期8个环节梳理典型风险,再配7类防范措施,供研发者、提供者、使用者三方参考。
— 附件2智能体风险管理框架全图(内容引自框架原文附件2)
8个环节:从设计研发到停用下线
生命周期覆盖设计研发、安装部署、指令输入、推理规划、调用执行、记忆存储、结果输出、停用下线八个环节。前两个环节管「出生」:需求分析不足、机制设计不完善、物料组件污染、安全测评不足;中间四个环节管「干活」:提示注入、上下文溢出、目标劫持、工具投毒与越权、记忆污染与窃取;最后两个环节管「收尾」——值得注意的是,「停用下线」被单独列为风险环节,服务残留、权限凭证遗留、数据留存不当,都是下线时的现实坑。
7类措施:两条可以直接抄进制度
防范措施共7类:风险预防前置、身份与权限管理、加强人工审批、供应链与工具管理、运行时动态管理、持续监测与审计、停用安全管理。其中两条规则写得非常具体,建议直接抄进内部制度。
「人工审批异常或用户无响应时,默认拒绝操作执行;凭证、密钥原则上不写入智能体记忆。」
💡 第一条是「默认拒绝(deny by default)」思想首次落到智能体审批场景;第二条堵的是记忆泄露——敏感信息一旦进入长期记忆,加密、访问控制、最短保存期限等专门保护措施一个都不能少。数据管理上,附件2还明确:在境内收集、产生的数据应在境内存储。
04
GUIDELINES
51条安全指引:对号入座
第5章按角色给出操作清单,四个主体、共51条:模型算法研发者15条、应用建设部署者9条、应用运行管理者20条、访问使用者7条。条数分布本身就说明了监管预期——运行管理阶段的责任最重,几乎等于把一套安全运营体系写成了条款。
— 51条安全指引四类主体速览(内容引自框架第5章)
每类主体,都有值得划线的条款
研发者:为智能体行为配人工审批
5.1.12要求「合理设定智能体行为边界,对可能造成严重损害的操作配备人工审批机制,加强对工具调用和外部交互的安全约束」;5.1.7要求对智能体自主行为、工具调用等能力开展专项测评;5.1.11明确商用版本应可回退到以前的版本。
部署者:先评估必要性,再谈分级
5.2.1的逻辑顺序值得注意——先评估「这个场景到底要不要用AI」,再结合应用场景重要性、智能化水平、应用规模做风险分级。模型和组件从官方渠道或主流开源社区获取并做来源、完整性校验;安全护栏要能拦截提示注入;具身智能还要配急停机制。
运行管理者:日志留存不少于6个月
5.3.6写得很具体:记录系统行为、用户行为等运行日志,留存时间不少于6个月,并定期审计。此外还有关键场景人工复核、生成内容标识与深伪检测、未成年人防沉迷、拟人化服务防情感操纵等条款——每一条都能对应到近一年的真实舆情事件。
使用者:敏感信息能不填就不填
面向普通用户的7条同样务实:选择信誉良好的应用、读懂协议建立合理预期、留意数据权限获取、别让应用成为攻击跳板、管住儿童青少年使用时长、警惕深度伪造不传谣。安全治理的最后一公里,在使用者手里。
∞
THE END
写在最后:怎么用好这份框架
先说清楚定位:《人工智能安全治理框架3.0》是指导性文件,不是强制性标准,但它出自网安标委,是监管思路最直接的风向标。历次版本演进的经验是:框架先行,标准跟进,监管落地。
对从业者,这份文档至少有三种用法:当合规自查清单,51条指引逐条对照打钩;当安全需求基线,写方案、做架构评审时直接引用条款编号;当供应商测评依据,采购AI产品时把附件2的7类措施做成验收问题清单。
更重要的是趋势判断:从1.0到3.0,治理重心已经完成了从「模型」到「应用」再到「智能体」的两次转移。明年的4.0会写什么没人知道,但可以确定的是——谁先把执行链路上的安全做扎实,谁就在下一轮监管周期里最从容。
框架全文可在全国网安标委官网查阅。觉得有用的话,建议转发给你的安全和合规同事。
END
我是本号主理人,长期关注 AI 安全与数据合规的一线动态,致力于把政策文件拆成人话。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:知白守黑1024 大白
大白《重磅!AI安全治理框架3.0发布:54项风险、51条指引,一文讲透》