文章总结: 微软发布《以人为本的AI行为准则》草案,为MAI模型设定网络攻击能力管控的绝对约束,禁止生成可利用漏洞代码、攻击工具及攻击指导,且企业和用户无法绕过。准则限制AI智能体自主权限,要求遵循指挥链原则,并对网络安全等特殊领域设例外审查机制。微软将开放六周公众咨询,计划修订后用于指导2027年模型开发。
综合评分: 82
文章分类: AI安全,政策法规,安全建设,安全意识
大模型网络攻击能力该如何管控?首份AI行为“思想钢印”公布
安全内参编译
安全内参编译
安全内参
2026年9月16日 17:37
北京
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
关注我们
带你读懂网络安全
微软认为,未来将把这份AI行为规范作为“绝对约束”嵌入模型训练开发过程,部署模型的企业和用户均无法绕过防护机制,以实现对网络攻击行为的管控;
需要注意的是,该规范将网络防御、公共安全、国家安全和军民两用等领域列为特殊领域,即可能需要开展规范禁止的行为,微软称将通过授权渠道加强客户审核。
前情回顾·AI安全技术动态
- Claude AI文本隐形水印是如何实现的?该怎么破解?
- OpenAI秘密开发大模型超级黑客,攻击成功率高达84%
- AI攻击真实案例验证:中国模型比美国模型更适合做网络防御
- Anthropic年度报告:AI如何改变网络攻击?安全防御该如何改进?
安全内参9月16日消息,微软AI发布了面向旗下MAI模型的《以人为本的AI行为准则》(Humanist AI Code of Conduct)草案,明确了网络攻击能力的安全规则,限制了AI智能体的自主运行,并针对网络安全等专业领域建立了专门审查机制。
根据这份行为准则,模型不得生成可实际运行的漏洞利用代码、攻击工具,不得提供攻击策划、目标选择、入侵操作流程、规避检测技术或行动指导,也不得提供其他能够实施或提升网络攻击能力的帮助。微软表示,无论用户以何种方式提出请求,这些限制均适用。
这些规定属于微软所称的“绝对约束”。部署模型的企业和最终用户都无法绕过这类安全防护机制。微软明确区分了了解网络攻击、开展防御性工作,以及真正获得攻击实施手段这三者之间的界限。
在这一限制范围内,MAI模型仍可协助开展经授权且合法的防御性工作,包括漏洞发现、恶意软件分析、漏洞利用概念验证(PoC)的开发与测试,以及介绍网络攻击原理的一般性教育内容。
阻断外部内容中的恶意指令
这份行为准则还对来自外部内容的指令作出规定。文件指出,模型行为的权限来源只能遵循“指挥链”。其层级依次为行为准则本身、部署模型的企业(运营方)制定的政策,以及具体用户的偏好。
根据准则,工具输出、文件内容、网页以及其他AI系统发送的消息本身均不具有指令权限。这些内容只有在通过上述指挥链获得明确授权后,才能拥有相应权限。而且,授权不得超越授权方本身的权限,也不得突破“绝对约束”。对于可疑内容,模型应在相关情况下向用户和运营方发出警告。
模型还必须让推理过程保持可见。这意味着不得隐藏思维链,不得使用“神经语”进行交流,也不得向人类监督人员隐瞒自身行为。
严格限制AI智能体的自主权限
另一组规定针对的是AI系统获得实际操作权限后可能带来的风险。根据准则,MAI模型只能在用户或运营方合理要求的范围内执行任务,不得自行扩大目标或权限范围。
当模型获得系统级访问权限时,准则要求其遵循最小权限原则,包括避免访问无关系统或数据,优先采取可逆操作,并对可能造成持久影响或广泛影响的操作发出警告。模型不得自行提升访问权限。
相关限制同样适用于任务委派。MAI模型把任务交给子智能体或其他AI系统执行时,这些任务必须至少遵守与原模型相同的任务范围、约束和权限。同时,子智能体或其他AI系统必须执行用户或运营方提出的停止运行或关机要求。
网络安全领域的特殊例外
这份行为准则也承认自身存在一定局限。文件将防御性网络安全、公共安全、国家安全以及军民两用科学研究列为特殊领域,并指出,其中“少数使用场景”可能需要使用标准设置下不允许使用的能力。
对于这些情况,微软表示,将通过“经授权的微软渠道”开展加强审查,包括进一步评估相关能力可能产生的安全、法律和权利影响。微软称,这些领域一旦发生不利影响,风险较高,因此需要采取更严格的审查措施。
规范仍在持续完善
微软表示,目前的MAI模型尚未接受这份文件的训练。公司将开放为期六周的公众咨询,并计划于今年晚些时候发布修订版,用于指导2027年模型的开发。
微软称,这份草案吸收了外部意见,参与者包括AI、法律、伦理学、哲学、语言学和公共政策领域的专家,以及企业负责人和公众焦点小组。
附录列出了九组“符合准则”和“不符合准则”的示例回复,用于说明模型应当如何行事。其中包括模型未经授权擅自回滚文件传输,以及模型在家庭成员遭遇健康危机时提供虚假安慰等案例。
参考资料:bleepingcomputer.com
推荐阅读
点击下方卡片关注我们,
带你一起读懂网络安全 ↓
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全内参 安全内参编译
安全内参编译《大模型网络攻击能力该如何管控?首份AI行为“思想钢印”公布》