文章总结: 文档全面介绍了大模型安全治理与评测体系,包括AI安全治理机构布局、生成式AI安全运营与主动防御机制、模型本体安全治理方法,以及OpenAI、Anthropic和Google等公司的安全评测框架。研究提出了多层防护与人机协同的安全策略,并通过数据全生命周期治理、隐私判别器等技术手段提升模型安全性,为AI安全领域提供了系统性解决方案。
综合评分: 87
文章分类: AI安全,安全建设,安全运营,技术标准,解决方案
大模型安全治理与评测体系化研究与实践
原创
AISAIL
安全进化论
2025年9月18日 11:00
广东
人工智能技术发展与安全趋势
- 智能涌现的AI系统:
随着人工智能加速发展,其正在深刻改变生产与生活方式。例如,“人工智能+”行动提出赋能网络空间治理,强化信息精准识别、风险实时处置等能力,并强调全球合作应对应用风险,确保发展安全、可靠、可控(《关于深入实施“人工智能+”行动的意见》)。
- AI安全治理机构布局:
各地积极成立AI安全治理机构。例如:
- 2020年4月:清华大学成立人工智能国际治理研究院,为中国参与国际治理提供智力支撑。
- 2022年10月:中国科协与复旦大学共建科技伦理与人类未来研究院,研究数字与人工智能伦理等。
- 2022年11月:北京大学武汉人工智能研究院成立,专注于AI伦理、安全治理、数据合规等领域。
- 2024年7月:上海人工智能安全治理实验室成立,聚焦AI安全标准、技术研发和多方协同治理模式。
- 2024年9月:北京人工智能安全与治理实验室成立,2025年升级为前瞻研究院。
- 2024年9月:大湾区生成式AI安全联合实验室成立,研究安全测评、运营方式创新等。
生成式人工智能安全治理实践
- 安全运营与主动防御:
构建生成式AI服务的安全运营与评测体系,包括多层防护机制、人机协同策略等。
-
AI系统边界防护(安全围栏)策略:
-
多层防护与人机协同机制:通过模型安全代理、知识增强、风险识别与拦截等手段保障安全。
-
机审有害处理机制:如中断会话规避有害漏出、扣除信用分(默认100分,低于60分封禁)。
-
模型本体安全治理:
-
数据全生命周期安全治理:涵盖数据收集、清洗、脱敏、合规。
-
语种判别器:过滤非法网站(5800万个网站)、低质量篇章(192.6亿篇语料),最终保留53.6亿篇高质量语料。
-
隐私判别器:基于200多万句标注语料,中文人名识别率>98%,判断连续30个Token内是否含隐私信息。
-
质量判别器:通过深度神经网络模型评分(参数量350M),评估句子质量并筛选低质量样本。
- 模型可靠性准确性优化:采用文档知识检索和类搜索插件降低幻觉率。例如,针对“特斯拉老板是谁”的问题,通过检索引擎返回准确答案。
- 对抗攻击与安全对齐机制:全人工构建SFT与RLHF数据,通过强化学习提升模型安全对齐能力。
- 跨领域跨部门风险管理体系:
建立运行中风控运营体系,覆盖多维度问题发现和分级闭环机制,保障模型运行中的安全可控。
大模型安全评测体系构建与应用
- OpenAI GPT-安全评测框架:
将评估分为“常规能力评测”与“前沿能力评测”。
- 常规能力评测:关注隐私保护、幻觉识别、越狱防护、内容安全等。
- 前沿能力评测:覆盖CBRN(生化核放能力)、网络安全攻击、说服力评估、自主性评估等高风险领域。
- Anthropic Claude-安全评测框架:
基于“负责任扩展策略”,分为常规与前沿能力评测。
- 常规能力评测:涵盖内容安全、对齐性、智能体安全等。
- 前沿能力评测:聚焦生物威胁、自主性行为、网络安全攻击等高风险场景。
- Google Gemini-安全评测框架:
核心为“前沿安全框架”,分为两个层级。
- 常规能力评测:测试提示注入攻击、数据记忆与隐私安全、生成内容中的有害信息。
- 前沿能力评测:评估CBRN扩散、网络安全攻击、AI自我改进能力等高风险场景。
大模型安全评测技术研究进展
基于遗传算法优化的大模型越狱攻击框架:
研究成果《ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models》提出一种基于遗传算法优化的框架,用于破解对齐大语言模型的越狱攻击。该研究正在TrustCom2025会议评审中。
本文提供23页完整版文件下载,请查看文后提示。
FreeBuf 帮会简介
「智盾矩阵·大模型安全智库」帮会是FreeBuf知识大陆的重量级帮会,目前已入选FreeBuf钻石星选帮会——官方认证高信誉与高质量,帮会聚焦人工智能与大模型安全领域,致力于打造全球视野下的专业资源聚合平台。截止目前帮会已累计更新2300+文档资源,为从业者提供从理论到实践的全维度知识支持。
1、内容框架(持续更新中)
2、内容涵盖
①系统梳理国内外人工智能安全政策法规、行业技术标准、伦理治理框架
②深度整合大模型安全领域的前沿研究报告、技术白皮书、前沿技术论文、行业峰会资料、典型场景解决方案及实务操作指南等
③覆盖伦理与合规安全、模型安全、内容安全、数据隐私、算法合规、AI应用与集成安全、基础设施安全、对抗攻击防御、可解释性研究等多个细分方向
3、加入永久帮会的专属权益
①定期抽奖赠送安全类书籍
②1次职业规划指导
③1次简历修改机会
④安全岗位内推机会
⑤无限制浏览下载帮会资源
⑥享受一对一专属找资料服务,有问必答,供资料参考(日限3份)
⑦历史发布资料,百度网盘一次性打包发送
⑧群内已分享资料,每月底网盘打包分享至会员,避免群内文件过期,方便会员查阅(周更)
4、帮会网盘
帮会优质资源稳定更新,目前日更10+,年更至少1000+,截止目前帮会已累计更新2300+文档资源,网盘文件多维度分类,方便查找
5、如何加入
现在帮会权益升级,原年卡会员139元,现永久会员149元,年卡会员99元,(随着资源增加、成员增多,后续永久会员价格将逐步上调),有意向的师傅们可以扫码加入我们,共同进步。
*加入方式:网页端和APP端*
网页端:
https://wiki.freebuf.com/societyDetail?society_id=344
APP端:
公众号已发表帮会资源展示:
①政策、标准
网络安全标准实践指南——人工智能生成合成内容标识方法 文件 元数据隐式标识 文本文件
网络安全标准实践指南——人工智能生成合成内容标识方法 文件 元数据隐式标识 图片文件
网络安全标准实践指南——人工智能生成合成内容标识方法 文件 元数据隐式标识 音频文件
网络安全标准实践指南——人工智能生成合成内容标识方法 文件 元数据隐式标识 视频文件
网络安全标准实践指南——人工智能生成合成内容标识方法 文件 元数据隐式标识 安全防护技术指南
关于通用人工智能模型提供者义务范围澄清指南的制定开展针对性咨询
工业和信息化领域人工智能安全治理标准体系建设指南(2025版)
②行业解决方案
③行业技术报告
④行业技术白皮书
⑤行业技术论文
⑥实务手册指南
⑦行业大会分享PPT
MCP协议标准化研究工作沙龙—— 大模型与智能应用的信息交互主题精彩回顾
通义灵码AI程序员解密:AI Agent在软件研发领域的落地实践
AI重构全球数字基建:美的多云统一数字化底座与出海的安全合规建设
智体赋能:基于大模型Agent的自动化渗透测试框架设计与实践
免责声明:以上报告均系通过公开、合法渠道获得,版权归原撰写/发布机构所有,如涉侵权, 请联系及时删除;内容为推荐阅读仅供参考学习,如对内容存疑请与原撰写/发布机构联系。
戳底部“阅读原文”或进入公众号聊天页获取交流群二维码扫码加入获取文档,打广告者勿扰。
点分享
点收藏
点在看
点点赞
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全进化论 AISAIL《大模型安全治理与评测体系化研究与实践》