文章总结: 文章探讨了基于模型上下文协议(MCP)的智能体系统面临的安全风险,特别是第三方服务带来的安全隐患。作者提出了SAFEMCP框架,通过红队测试、安全评估等手段识别和缓解这些风险,并通过实验验证了攻击与防御的有效性。文章还提出了构建安全MCP生态系统的路线图,包括红队测试、安全骨干LLM开发、安全评估等六个方面,强调了MCP驱动的智能体系统存在真实的安全威胁,需要研究社区关注并开发新技术。
综合评分: 88
文章分类: AI安全,安全建设,漏洞分析
在MCP驱动的智能代理系统中识别和缓解第三方安全风险
原创
AISAIL
安全进化论
2025年6月18日 11:12
广东
点击上方蓝色字体,关注我们
/技术交流群/
【知识大陆】:进入后台聊天页,点击底部菜单栏菜单“知识大陆”,点击对应帮会聊天框会自动发送对应帮会二维码,使用微信扫码即可加入!
【交流群】:进入后台聊天页,点击底部菜单栏菜单“交流群”,点击交流群聊天框会自动发送群二维码,使用微信扫码即可加入!
1 论文概述:
论文探讨了基于模型上下文协议(MCP)的智能体系统面临的安全风险,提出通过红队测试、安全评估等手段构建安全的MCP生态系统,并通过实验验证了攻击与防御的有效性。
2 论文内容:
- 引言:MCP 的兴起与安全挑战
背景:大型语言模型(LLMs)正从模仿学习转向基于经验的学习模式,强化学习和工具使用成为关键。
问题:MCP作为标准化接口,虽然促进了LLMs与外部服务的交互,但引入了第三方服务的安全隐患。例如,医疗场景中恶意设备可能篡改患者数据,导致错误治疗建议。
目标:本文旨在揭示MCP生态中的三方安全风险,并提出全面的安全技术解决方案。
- 构建 SAFEMCP 框架
环境与数据集:SAFEMCP 测试平台涵盖十种广泛使用的场景,包括 WebShop、BabyAI 等,模拟 MCP 服务的实际应用。
攻击与防御机制:
攻击方法:支持直接攻击(Dir.)、AutoDAN、CodeChameleon 等六种策略。
防御机制:
被动防御:预先生成白名单,过滤恶意服务;事后检测识别恶意行为。
主动防御:提取服务信息并过滤恶意内容。
评估指标:
帮助性(Helpfulness):通过相对准确率损失(RAL)衡量性能下降。
无害性(Harmlessness):计算攻击成功率(ASR)和危害率(HR)。
可检测性(Detectability):检测模型对攻击的识别比例(DR)。
- 初步实验与观察
3.1 第三方攻击是否构成威胁?
实验设计:在三种模型系列(GPT、Qwen、Doubao)上测试六种攻击策略,涵盖20个任务场景。
结果:
直接攻击(Dir.)对 G-o3-mini 和 QW3-14B 导致 RAL 分别为 0.25 和 0.34,表明攻击显著影响系统性能。
高级攻击(如 ReNeLLM、CodeChameleon)进一步提升 ASR 和 HR,显示更复杂的攻击更具威胁性。
结论:第三方攻击是真实威胁,需开发针对性防御策略。
3.2 被动检测能否有效防御?
实验设计:测试 LLM 是否能识别恶意服务,结合 OpenAI-moderation API 和 LLaMA-Guard 进行检测。
结果:
对直接攻击,所有模型均实现 100% 检测率。
高级攻击(如 CipherChat)难以被检测,OpenAI-moderation 表现甚至低于 LLaMA-Guard。
结论:简单检测方法不足以应对复杂攻击,需开发更精细的防护模型。
3.3 主动防御的效果如何?
实验设计:使用 GPT-4o-mini 提取服务信息并过滤恶意内容。
结果:
主动防御显著降低 ASR 和 HR,但在某些情况下未能提取有用信息,导致性能下降(RAL 增加)。
结论:主动防御可行,但需优化以避免性能损失。
- 构建安全 MCP 生态系统的路线图
4.1 红队测试
必要性:红队测试可模拟对抗性攻击,提前发现漏洞。
重点方向:
第三方红队测试:探索第三方服务的潜在攻击路径。
工作流定向测试:分析服务依赖网络,识别关键节点。
跨服务测试:研究不同服务间的协同攻击。
4.2 安全骨干 LLM 开发
目标:开发对攻击更具鲁棒性的 LLM。
方法:
MCP 安全感知预训练:将安全知识融入预训练阶段。
MCP 安全微调:构建专门针对 MCP 的微调语料库。
MCP 安全强化学习:通过奖励机制提升模型安全性。
4.3 安全评估
框架:
基准数据集:集成新对抗场景与真实约束(如传感器噪声、API 速率限制)。
评估指标:定义多维度指标(如级联影响评分、恢复延迟阈值)。
评估协议:规范评估环境与攻击模拟。
4.4 数据积累
策略:
数据转换:将现有工具相关任务表达为 MCP 服务。
数据标注:采用人机协作方式生成对抗数据。
4.5 MCP 服务防护
方法:
混合检测:结合规则引擎与轻量级 LLM 检测异常行为。
信任图传播:建模服务信任度随时间变化的动态图。
4.6 安全生态建设
支柱:
全球服务审计标准:评估服务抗攻击能力、数据来源透明度。
协作治理网络:利用区块链技术共享威胁信息。
- 替代观点
5.1 被动安全观
观点:部分研究者认为应优先提升 LLM 性能,而非专注于安全问题。
反驳:MCP 引入的三方交互使安全问题更加复杂,单纯依赖更强模型无法解决。
5.2 替代安全方案
系统级 vs 模型级:系统级防护关注基础设施完整性,模型级防护聚焦认知漏洞。未来需整合两者以应对全面威胁。
- 结论
MCP驱动的智能体系统存在真实的安全威胁,防御并非易事,需要研究社区关注并开发新技术以构建安全的MCP驱动的智能体系统。
FreeBuf 帮会简介
「智盾矩阵·大模型安全智库」帮会是FreeBuf知识大陆的重量级帮会,目前已入选FreeBuf钻石星选帮会——官方认证高信誉与高质量,帮会聚焦人工智能与大模型安全领域,致力于打造全球视野下的专业资源聚合平台。截止目前帮会已累计更新1100+文档资源,为从业者提供从理论到实践的全维度知识支持。
1、内容框架(持续更新中)
2、内容涵盖
①系统梳理国内外人工智能安全政策法规、行业技术标准、伦理治理框架
②深度整合大模型安全领域的前沿研究报告、技术白皮书、前沿技术论文、行业峰会资料、典型场景解决方案及实务操作指南等
③覆盖伦理与合规安全、模型安全、内容安全、数据隐私、算法合规、AI应用与集成安全、基础设施安全、对抗攻击防御、可解释性研究等多个细分方向
3、加入永久帮会的专属资源
①定期抽奖赠送安全类书籍
②1次职业规划指导
③1次简历修改机会
④安全岗位内推机会
⑤无限制浏览下载帮会资源
4、帮会网盘
帮会优质资源稳定更新,目前日更10+,年更至少300+,截止目前帮会已累计更新1100+文档资源,网盘文件多维度分类,方便查找
部分帮会资源展示:
①国外政策文件
②国内政策文件
③国家标准、行业标准、团体标准
④行业技术报告
⑤行业技术白皮书
⑥行业技术论文
⑦实务手册指南
⑧行业大会材料
5、如何加入
现在帮会权益升级,原年卡会员119元,现永久会员139元,年卡会员89元,季卡会员39元(随着资源增加、成员增多,后续永久会员价格将上调至199元),有意向的师傅们可以扫码加入我们,共同进步。
*加入方式:网页端和APP端*
网页端:
https://wiki.freebuf.com/societyDetail?society_id=344
APP端:
6、【618优惠活动】【6.13-6.19】
①永久会员原价139元,扫码领券加入立减30元到手109元即可成为永久会员
②年卡会员原价89元,活动期间69元,活动结束恢复原价
③邀请朋友加入帮会(PC端点击右下侧“邀请朋友加入”、APP端点击右上角“分享有奖”),活动期间最高可获得30%现金返现
点分享
点收藏
点在看
点点赞
免责声明:以上报告均系通过公开、合法渠道获得,版权归原撰写/发布机构所有,如涉侵权, 请联系及时删除;内容为推荐阅读仅供参考学习,如对内容存疑请与原撰写/发布机构联系。
戳底部“阅读原文”或进入公众号聊天页获取交流群二维码扫码加入获取完整文档。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全进化论 AISAIL《在MCP驱动的智能代理系统中识别和缓解第三方安全风险》