文章总结: 该工具旨在解决数据敏感性与AI分析需求之间的矛盾,提供离线、可逆的数据脱敏功能,支持多种数据格式和敏感信息识别,以保障数据安全的同时实现AI分析。
综合评分: 80
文章分类: 安全工具,数据安全,应用安全,网络安全,技术标准
把数据喂给 AI 之前,请先给它“打个码”
原创
湘移网核
湘移网核
间无道
2026年9月24日 18:31
湖南
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
引言:一个越来越普遍的纠结
先说一个场景。
手头有一批数据要分析:可能是 77 万行的日志,可能是导出的业务表格,也可能是几个数据库文件。人工看不过来,你想把它们发给大模型,让 AI 帮忙找问题、做总结。
但在点下”发送”之前,你犹豫了。
因为这份数据里什么都有:手机号、IP 地址、账号口令、内部系统名称,甚至还有用户的位置轨迹。这些东西一旦发给在线大模型,就等于把家底摊在了别人的桌子上。
删掉敏感信息再发?一份 77 万行的文件,手工打码要到猴年马月。直接不发了?问题还是解决不了。
这个纠结,不只是运维人、数据分析师的——每一个在用 AI 的人都会遇到。数据要用,但敏感信息不能出去。脱敏这个动作,谁都知道该做,但做起来太麻烦。
最近我把这个问题彻底解决了一下:自己写了一个工具,叫 AI 脱敏复原离线工具(v1.5.9)。今天展开讲讲它的思路。
▲ 工作台首页:脱敏任务、映射库、23 类内置识别类型、审计记录四个数字,工具状态一目了然
它解决什么问题:三个痛点
把数据发给 AI 之前,为什么不能直接用市面上的脱敏方案?认真用起来,普遍卡在三个地方:
第一,不可逆。很多工具脱完敏就是”死”数据,138****5678 打完星号,原文再也找不回来。可现实中大量场景是”先脱敏外发,拿到结果还要还原回来”。比如把数据脱敏后发给 AI 分析,分析结论要对应回真实业务,就必须能精确复原。
第二,要联网。在线脱敏服务意味着把原始数据先传到别人的服务器上。为了防泄露才脱敏,结果脱敏这件事本身先造成了泄露风险——这就很拧巴。
第三,按次收费或配置复杂。企业级脱敏平台动辄复杂部署,个人和小团队用不起也玩不转。
AI 脱敏复原离线工具的答案,浓缩成三句话:
完全离线:仅本机访问,运行期零外联、无遥测,数据不出本机;
可逆复原:脱敏不是终点,凭口令即可精确还原,产物还能随身带着”策略包”;
零门槛:内置 23 类识别规则、按国标分类分级一键选取,选文件 → 执行 → 拿结果,三步完成。
识别能力:23 类敏感信息,按国标三级分类
脱敏工具的核心竞争力是”看得见敏感信息”。看不全、误报多,后面全白搭。
这个工具内置了 23 类敏感信息识别,覆盖日常办公的方方面面:手机号、座机、姓名、身份证、银行卡、账号、密码口令、IP/IPv6/MAC 地址、邮箱、地址、车牌、企业名称、设备标识、位置轨迹、密钥凭据……凡是能直接或间接定位到”某个人、某台机器、某个系统”的信息,都在识别范围内。
更关键的是,这些类型不是平铺的,而是严格按国标 GB/T 43697-2024《数据分类分级规则》组织成三级:
核心数据 密码口令、密钥与凭据——泄露直接导致系统失陷,最高强度处理
重要数据 设备标识、位置轨迹、IP 地址等——基础设施与行踪轨迹类信息
一般数据 姓名、手机号、地址、车牌等个人信息
选规则的时候,勾一个级别(或一个行业包),23 类规则自动装填,不用逐项手选。
▲ 规则管理页:23 类识别规则按国标三级分组,每类标注脱敏算法、复原保障等级和示例
识别精度上下了很大功夫,举几个实际发生的例子:
· “××系统注册成功率低于集团阈值”这类指标描述句,不会被误判成公司名;
· 066-7359115 这种位数不合法的”座机”会被过滤,而 0663-7359115 这种合法区号会正确保留;
· 手机号旁边跟着一长串系统编号时,不会把编号片段误当手机号;
· 主流设备厂商日志里的账号、口令字段格式,都有专门的识别规则。
误报少了,真实敏感信息才不会漏网。
可逆脱敏:打码只是开始,口令在手随时还原
这是整个工具最核心的设计——可逆三层复原体系:
R2 · 自包含可逆
姓名、公司名、系统名称这类文本,脱敏后变成加密令牌。妙处在于令牌本身就是”密文容器”——产物文件被转发、改名、甚至拼接进别的报告里,拿回来仅凭主口令就能还原,不需要任何额外文件。
R3 · 格式保持可逆
手机号、身份证、银行卡脱敏后仍然是合法形态。比如手机号打星号后依然符合手机号格式、身份证掩码后校验位依然有效。下游测试库、校验逻辑完全无感,这是喂给测试环境最理想的形态。
R0 · 不可逆
确认永不回流的对外发布数据,用键控摘要,永不复原。
复原这件事有多简单?打开复原向导,拖入处理后的文件,输入主口令,完成。策略包随脱敏产物自动生成,跟着文件一起走,复原时不需要带着映射库文件。
▲ 脱敏向导第④步:77.5 万行的大文件执行中,五阶段标签 + 真实百分比进度,中断可断点续跑、可随时取消
安全设计:数据不出本机,口令是唯一钥匙
作为一个安全工具,它对自己的安全要求反而是最苛刻的:
网络隔离:仅监听本机回环地址,不连任何外部服务器,无遥测上报。断网环境完整可用;
高强度加密:映射库采用工业级口令派生 + 分组加密算法保护,原文在磁盘上以密文存在,主口令永不落盘;
抗爆破:口令连续输错 5 次,锁定时间指数退避(1 分钟 → 5 分钟 → 15 分钟……);
审计留痕:何时创建任务、何时脱敏、何时复原、何时建库——只记操作,不记任何敏感内容,异常操作有据可查。
▲ 审计日志页:每一步操作自动记录,只记操作不记敏感内容,出问题可追溯
映射库 = 加密的”原文↔脱敏值”对照表,是复原的唯一凭证。脱敏时自动生成并加密保存,主口令是打开它的钥匙——口令不存储,忘了就真的无法还原,所以请务必备份好恢复短语。
▲ 映射库管理:每个加密库文件独立分发,显示锁定状态与关联的策略包,删除时同步安全擦除
典型使用场景
这个工具在哪些场合能用?我列四个最常见的:
场景一 · 数据发给 AI 分析前脱敏
业务数据脱敏 → 发给大模型分析 → 拿回结论后凭口令复原对应到真实业务。AI 全程看不到任何真实敏感信息。这是做这个工具的最初动机。
场景二 · 测试环境数据同步
生产库导出的表格里有真实用户数据,直接同步到测试环境属于违规。脱敏后数据保留格式、手机号仍是合法手机号,测试脚本照常运行。
场景三 · 跨部门数据共享
报表要发给合作方,姓名、账号、证件号脱敏外发;对方处理完毕把结果传回,凭映射库一键复原,两边数据严丝合缝。
场景四 · 数据合规留存
按国标三级分类脱敏,任务报告自带 GB/T 43697 分级依据与法规依据两列,合规检查时直接拿得出手。
▲ 脱敏向导①:按国标分类(一般/重要/核心)或行业包一键勾选 23 类规则,选复原模式后进入下一步
写在最后
数据安全的困境往往不在于”不知道要保护”,而在于”保护的代价太高”。当脱敏要联网、复原要猜、大文件跑不动的时候,大多数人会选择冒险直接发。
把代价降下来,安全才会真正发生。完全离线、一键选取、可逆复原——这就是这款工具给出的答案。
它目前是 v1.5.9 版本,支持 12 种常见文件格式(xlsx/csv/txt/json/sql/log/docx/html……),专业版还提供主流数据库直连脱敏。整个工具从识别引擎、加密映射库到前端界面,每一行代码都在自己手里——自主可控,数据不出本机。
如果你也经常在”发数据”和”保安全”之间纠结,欢迎交流
腾讯官方SKILLHUB,复制链接丢给AI安装:
https://skillhub.cn/skills/user_239f6ce2/ai-mask-offline
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:间无道 湘移网核
湘移网核《把数据喂给 AI 之前,请先给它“打个码”》