文章总结: 该文档是浙江大学举办的学术报告通知,主题为AI内生安全能力建设。报告由上海人工智能实验室刘东瑞博士主讲,将探讨当前AI安全对齐技术的局限性,如RLHF等方法仅教导AI拒绝敏感问题而非删除敏感知识,并分享内生安全技术路线的最新研究成果,包括动态发现AI模型漏洞、缓解神经元冲突和提升表征可靠性等关键技术。
综合评分: 86
文章分类: AI安全,安全建设,漏洞分析,技术标准,学术报告
学术报告 | AI内生安全能力建设:从安全评测到内生安全
浙大网安
2025年12月11日 15:10
浙江
浙江大学计算机科学与技术学院
浙江大学区块链与数据安全全国重点实验室
浙江大学网络空间安全学院
学 术 报 告
刘东瑞 博士
上海人工智能实验室
青年科学家
AI内生安全能力建设:从安全评测到内生安全
12月16日(周二)16:00
玉泉校区逸夫工商楼101会议室
报告简介
为了应对和降低前沿AI模型和智能体的潜在风险,目前业界提升安全性的技术路线是先对模型进行安全评测,然后获取或模拟人类价值偏好的数据对模型和智能体进行“安全对齐”, 例如RLHF和DPO等技术。然而这类方法未能真正解决AI风险,一方面是因为对安全对齐方法的底层机理认识不深刻,另一方面是RLHF等方法仅教导AI拒绝回答敏感问题,并没有从模型内部删除敏感知识。本次讲座将分享“内生安全”技术路线上的探索和最新研究成果,即从安全评测到内生安全,包括动态发现前沿AI模型和智能体漏洞、缓解内在神经元的冲突、表征的可靠性等。
报告人简介
刘东瑞,上海人工智能实验室可信安全中心青年科学家,博士毕业于上海交通大学。长期从事安全可信人工智能研究,包括大模型的可解释性、攻防、对齐和评测等。在 NeurIPs、ICLR、CVPR、AAAI、ACL等会议期刊上发表论文数十篇。曾获得CVPR 2024 最佳论文候选奖和ACL 2025杰出论文奖和上海交通大学优秀博士毕业生等荣誉。
更多学院动态
欢迎关注
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:浙大网安 《学术报告 | AI内生安全能力建设:从安全评测到内生安全》