文章总结: 本文探讨了以数据为中心的人工智能在大模型预训练和数据治理中的应用,强调优质数据对AI系统成功的关键作用。文章分析了传统小模型在复杂数据治理任务中的局限性,并介绍大模型驱动的数据治理技术,包括属性值规范化、地理数据清洗、建筑设计图纸合规性检查等应用。文章指出,大模型预训练需要数据治理技术,而数据治理技术也需要大模型加持,两者相辅相成。大模型在数据清洗和数据合规上已展现出重要价值,未来有望解决复杂数据治理场景的决策规划问题,在多模态实体链接与跨模态检索等领域也有广泛应用前景。
综合评分: 75
文章分类: AI安全,数据安全,解决方案,安全建设,技术标准
大模型驱动的数据清洗与数据合规
原创
AISAIL
安全进化论
2025年7月24日 11:05
广东
核心速览
本文探讨了以数据为中心的人工智能在大模型预训练和数据治理中的应用,强调优质数据对AI系统成功的关键作用,并分析了当前小模型在复杂数据治理任务中的局限性。
研究背景
-
研究问题:文章聚焦于如何通过系统化的数据工程提升人工智能系统的效能,特别是在大模型预训练中如何利用高质量、多样性和合规的数据来驱动模型性能。这一问题的重要性在于,数据质量直接影响AI系统的落地效果,而当前模型的成功很大程度上依赖于数据的覆盖广度、多维度、时效性、精度和合规性。解决这一问题将推动AI技术在各行业的深度应用。
-
研究难点:在实施数据治理过程中,面临数据来源多样性与复杂性的挑战,包括错误数据的发现与修复、多源数据融合与规范化以及数据合规性检查等任务。传统方法依赖完整性约束或监督学习,但这些方法对训练数据依赖性强,难以应对大规模数据修复和小样本场景的需求。此外,数据市场环境复杂多变,领域数据治理需求飞速增长,进一步增加了治理难度。
-
文献综述:文章引用了多项相关研究,如Daochen Zha等人提出的“以数据为中心的人工智能”框架,强调训练数据开发、推理数据开发和数据持续维护的重要性;Heidari等人提出的Holodetect方法尝试通过少量样本学习发现错误数据,但仍存在应用场景有限的问题;Tu等人提出的Unicorn模型通过多任务学习机制实现知识共享,但要求充足训练数据;Shen等人则通过双视图信息增强知识库表示,但依然依赖监督方法。这些研究表明,传统方法和技术在处理日益复杂的数据治理任务时已显不足,亟需新的解决方案。
以数据为中心的人工智能
-
训练数据开发:为了支持机器学习模型的训练,需要收集和产生丰富、高质量的数据。这包括覆盖广、多维度、有时效性、高精度和合规性的数据,确保AI系统能够更好地进行学习和推理。
-
推理数据开发:创建新的评估集为模型提供更精细的见解,或通过工程数据输入触发模型的特定能力。这一过程需要对数据进行系统性地迭代处理,使其能够反映现实世界中的动态变化。
-
数据持续维护:在动态环境中,数据的质量和可靠性需要持续维护。现实世界中的数据不断产生,因此需要机制来保证数据在整个生命周期内的可用性和准确性。
大模型预训练中的数据工程
- 数据来源与配比:GPT等大模型的成功依赖于高质量、丰富的训练数据。多样化的数据来源和合适的数据配比对于模型的智慧涌现至关重要。例如,Sora的强大源自于对视频图像、帧级画面文本描述及视频内容总结的精心准备。
- 数据治理的重要性:在大模型行业实践中,做好预训练数据的数据治理是关键一环。无论是招投标领域还是其他具体应用,都需要通过数据治理来保障模型性能和实际效果。
大模型驱动的数据治理技术研究
- 属性值规范化:利用大模型的常识和容错能力发现知识库中的同义词组,并纠正错误词组或补充缺失的词组。这种方法在低资源场景下特别有效,显著降低了标注数据的需求。
- 地理数据清洗:基于大模型的能力,引入大模型+GeoTools框架,实现地址文本数据的清洗和规范化。这种方法可以显著降低编辑距离(从15.27降至3.74),并增强多个下游任务的效果。
- 建筑设计图纸合规性检查:利用预训练模型、自然语言处理和知识图谱技术构建建筑设计行业标准知识库,以及基于图谱的建筑图纸辅助设计和问答系统。未来可扩展为图纸自动审查和自动设计。
多模态实体链接与跨模态检索
- 实时视频流实体链接:基于直播场景构建了250小时时长的数据集,并提出了解决实时视频的技术方案。利用大模型管理内存块提升实体链接的准确率,同时缓解推理时长消耗。
- 图文跨模态检索:构建全新的文图跨模态检索评测数据集,并提出了基于大模型的增强方案。实验结果表明,该方法在真实场景中具有显著优势。
总体结论
- 数据治理与大模型相辅相成:大模型预训练需要数据治理技术,而数据治理技术也需要大模型加持。基于小模型的数据治理技术难以满足日益增长的海量数据治理需求。
- 大模型驱动的数据治理方兴未艾:尽管基于大模型的数据治理技术研究刚刚起步,但其在数据清洗和数据合规上已经展现出重要价值。未来,大模型智能体技术有望解决复杂数据治理场景的决策规划问题。
- 广泛应用前景:大模型在属性值规范化、地理数据清洗、建筑设计图纸合规性检查、实时视频流实体链接和图文跨模态检索等方面的应用展示了广阔前景。这些技术不仅提高了数据治理的效率,还为各行业提供了创新解决方案。
FreeBuf 帮会简介
「智盾矩阵·大模型安全智库」帮会是FreeBuf知识大陆的重量级帮会,目前已入选FreeBuf钻石星选帮会——官方认证高信誉与高质量,帮会聚焦人工智能与大模型安全领域,致力于打造全球视野下的专业资源聚合平台。截止目前帮会已累计更新1600+文档资源,为从业者提供从理论到实践的全维度知识支持。
1、内容框架(持续更新中)
2、内容涵盖
①系统梳理国内外人工智能安全政策法规、行业技术标准、伦理治理框架
②深度整合大模型安全领域的前沿研究报告、技术白皮书、前沿技术论文、行业峰会资料、典型场景解决方案及实务操作指南等
③覆盖伦理与合规安全、模型安全、内容安全、数据隐私、算法合规、AI应用与集成安全、基础设施安全、对抗攻击防御、可解释性研究等多个细分方向
3、加入永久帮会的专属资源
①定期抽奖赠送安全类书籍
②1次职业规划指导
③1次简历修改机会
④安全岗位内推机会
⑤无限制浏览下载帮会资源
4、帮会网盘
帮会优质资源稳定更新,目前日更10+,年更至少1000+,截止目前帮会已累计更新1600+文档资源,网盘文件多维度分类,方便查找
部分帮会资源展示:
①国外政策文件
②国内政策文件
③国家标准、行业标准、团体标准
④行业技术报告
⑤行业技术白皮书
⑥行业技术论文
⑦实务手册指南
⑧行业大会材料
5、如何加入
现在帮会权益升级,原年卡会员119元,现永久会员119元,年卡会员79元,季卡会员29元(随着资源增加、成员增多,后续永久会员价格将上调至199元),有意向的师傅们可以扫码加入我们,共同进步。
*加入方式:网页端和APP端*
网页端:
https://wiki.freebuf.com/societyDetail?society_id=344
APP端:
点分享
点收藏
点在看
点点赞
免责声明:以上报告均系通过公开、合法渠道获得,版权归原撰写/发布机构所有,如涉侵权, 请联系及时删除;内容为推荐阅读仅供参考学习,如对内容存疑请与原撰写/发布机构联系。
戳底部“阅读原文”或进入公众号聊天页获取交流群二维码扫码加入获取文档,打广告者勿扰。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全进化论 AISAIL《大模型驱动的数据清洗与数据合规》