文章总结: 本文探讨了数字安全领域中AI的真正对象是数据结构而非产品工具。作者提出AI在安全领域的四类核心对象:序列、图、分布和规则空间,并解释了这些结构如何决定AI的能力边界。文章强调理解数据的空间和时间维度结构对构建有效安全AI系统至关重要,指出当前AI加安全讨论中存在概念混淆问题,呼吁回归结构本质进行高质量安全建设。
综合评分: 92
文章分类: AI安全,安全建设,网络安全,数据安全
数字安全领域 AI 的面向对象是什么?
原创
Micropoor
0x727开源安全团队
2025年11月22日 14:43
上海
注:本文是笔者工作过程中思考事物、认识事物,准备改造事物的手稿之一,因接下来的工作中,拟计划使其数字安全建设与AI融合至统一,因此,笔者把“日记本”中的部分手稿摘录为该文。
一、AI 不面向产品或工具,只面向数据本身
在当前数字安全领域的“AI 热潮”中,最普遍、也最具误导性的观点,是将“产品或工具”当成“AI 的对象”。
诸如“给 WAF 加 AI”、“给 SIEM 套大模型”、“给邮件过滤叠智能体”等想法,看似推动创新,实则概念混乱。
算法无感于产品或工具的边界。
AI 的对象永远是数据及其结构性运动,而不是工具或场景。
数据的结构性决定 AI 能构建怎样的世界模型,也决定它的能力边界。产品或工具分类只是行业惯例,是人为划分的外壳,不具有算法意义。
真正的问题不是“AI 能不能做邮件安全”,而是“AI 能从什么结构的邮件类数据中构建世界模型”。
因此,数字安全行业真正缺少的并不是“AI 应用”,而是对 AI 在安全领域的真实对象 的基础性理解。
二、为什么必须回答这个问题?
过去两年“AI+安全”讨论呈爆炸式增长,但大多数都沿着错误路径展开,诸如:
1、给 WAF 加 AI
2、给邮件网关加 AI
3、给告警系统加 AI
4、给 HIDS 加 AI
5、SIEM 套用通用大模型
等等…
这种模式的问题在于:
产品或工具不是结构,结构才是算法的真实输入。当你说“AI 看懂邮件安全”,算法实际上处理的是:
1、文本序列
2、用户行为上下文
3、组织策略
4、异常分布
5、权限或对象关系图谱
产品或工具只是一层外壳,与算法无直接关系。对象错了,工程必然漂浮,预测偏差、异常误报、无法泛化都随之而来,这正是如今“AI+安全”虚浮的根源。
笔者必须要思考回应此类问题的范畴,制定战略性的动作,必须要思考2个类问题1个统一,既——
2个类问题:
1、面向方向
2、面向对象
1个统一问题:
方向和对象与所在组织(公司)场景的统一。
这关乎在接下来的几年的过程中,集中投入、集中力量等一系列的集中总和,于某一个或几个对象的全面推进,对象一旦错误,越集中越偏离;统一一旦分歧,越投入价值回报率越离奇。因此,笔者在此类问题的过程中思考许久。
三、AI 的对象由底层三重约束决定
AI 能处理什么,并不是主观感性的选择,而是受到三种结构性约束:
1、所在组织(公司)算力约束——决定数据颗粒度、模型规模、上下文长度、推理窗口。
2、算法架构约束——决定模型能够处理的对象类型:序列?图?分布?规则?
3、数据结构约束——决定 AI 能构建何种世界模型。(例:系统调用是强结构,邮件正文是弱结构)
由此,AI 的世界不是被产品(工具)名称塑造的,而是被数据的物质性形态 规定的。那些震撼世界的词句只是为了迎合完成KPI而创造的,必须回归于现实的物质形态。
四、数据的“双维度结构”:空间与时间
AI 在数字安全领域能否“理解”一个现象,取决于数据在空间和时间上的结构性。
1、空间维度:数据的结构强弱
(1)弱结构数据
如:邮件正文、日志文本、单条 HTTP 请求
特点:噪声大、信息密度低、必须依赖大量上下文。
(2)强结构数据
如:系统调用序列、攻击关系图、权限继承图、告警语义树
特点:高压缩、高语义、内置专家结构、AI 能直接推理
因此,结构强弱决定了 AI 的信息效率。
2、时间维度:行为的连续性
AI 能否构建有效模型,取决于:
——Δt:可观测的时间窗口
——ΔV:单位时间内的信息体量变化速度
(1)窗口越长,越容易发现行为模式;
(2)体量越稳定,越容易建立行为基线。
安全风险治理根源上都是“时间维度中的模式偏移”。
五、基于结构的推导:AI 在数字安全领域的四类对象
当我们抛开产品和工具边界,从数据结构出发,AI 在安全领域的对象自然显现为四类。这四类不是场景,而是本体结构,是一切安全 AI 能力的基底:
对象一:序列
形式:X={x1,x2,…,xT}
数字安全世界大部分的数据都是序列:
1、流量
2、系统调用
3、登录行为
4、告警时间序列
5、攻击阶段序列
等等…
主要任务:
1、异常检测
2、趋势预测
3、事件关联
4、行为基线建模
序列是数字安全数据中最基础的结构。
对象二:图
形式:G=(V,E)
当安全问题涉及关系与依赖,图结构是核心载体:
1、权限关系图
2、攻击链
3、横向移动图
4、主机—进程—连接关系图
5、服务依赖图
等等…
主要任务:
1、图嵌入
2、权限扩张路径预测
3、图结构异常检测
4、攻击路径推演
安全在被攻击本质上是“图结构的扰动”。
对象三:分布
形式:Pt(X)
数字安全问题最难的部分都与分布偏移相关:
1、行为异常
2、0day(1day)
3、数据泄露
4、内部违规
5、流量突变
等等…
核心任务:
1、分布偏离检测
2、概念漂移监测
3、异常评分
这是未知攻击检测的根基,也是未来的主战场,更是可“扩展”的思考高地。
对象四:规则空间
形式:R={r1,r2,…,rn}
安全的大部分劳动是规则治理,而规则并非静态:
1、会冗余
2、会冲突
3、会膨胀
4、会被绕过
5、会自我老化
等等…
AI 在规则空间中的能力是:
1、规则压缩
2、冲突检测
3、策略生成
4、约束求解
5、自动优化
这是未来安全策略体系的中枢战场。
六、为什么邮件、HIDS、WAF 等一系列的总和不是AI的对象?
因为它们都不是结构,只是“打包方式”,拆开后都能映射到四类对象:
| | |
| — | — |
| 工具 | 结构对象 |
| 邮件安全 | 文本序列、分布偏移、规则空间 |
| WAF | 流量序列、状态图、分布偏移 |
| HIDS | 系统调用序列、主机关系图 |
| SOC | 告警序列、策略图、分布异常 |
产品和工具是外壳,结构是本体,结构是算法的输入。
AI不会因为产品名称变聪明,只会因为数据结构充分而强大。
八、回归结构是高质量建设的前提
2024–2025是数字安全AI讨论呈爆炸式增长的过程,越是这种时候,越要沉着、冷静的面向结构延展思考。
四类对象——
1、序列
2、图
3、分布
4、规则空间
构成了安全 AI 的底层结构论。
一旦理解这些,所有“AI+安全”的混乱讨论都会自然坍缩回一个清晰框架。
真正的数字安全建设的创新也会从这里开始。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:0x727开源安全团队 Micropoor《数字安全领域 AI 的面向对象是什么?》