文章总结: 公安部2023启动“金析为证”将资金分析转为法庭证据,已发布六项标准并确立公安登记鉴定体制;文章提出以DeepSeek大模型+智能体构建“感知-决策-执行”闭环,通过微调、RAG与工具集实现数据清洗、流向穿透、异常识别及报告自动生成,缓解基层侦鉴分离、人才短缺与报告乱象,为经侦、监察、民商事场景提供可复制、可解释、降门槛的新质生产力。
综合评分: 85
文章分类: 人工智能,安全工具,数据安全,应用安全,安全建设
首发 | 皮浩:资金数据分析与鉴定的人工智能实现路径(完整版)
皮浩
取证者联盟
2026年1月2日 12:00
上海
资金数据分析与鉴定的人工智能实现路径
本文收录在《首届中南刑事司法论坛(人工智能与刑事司法研究)论文集》中。
本文(精编版)收录在《电子数据取证与网络犯罪调查专刊》(第八辑)中。
摘要:自2023年7月起,公安部经侦局正式启动“资金分析成果证据转化”工作,简称“金析为证”。2024年2月印发《公安经侦部门资金数据分析成果转化工作指引(试行)》,推动将资金分析成果转化为鉴定意见,正式拉开了资金分析鉴定的序幕。截止2025年7月,6个相关法庭科学标准已经发布并实施;同年,资金分析鉴定工作程序规定和鉴定机构、鉴定人登记管理办法也相继发布并施行。“金析为证”作为大数据分析类鉴定的先河,正以星火之光掀起燎原之势。人工智能(AI)从早期的神经网络模型到现代的大模型和智能体,随着DeepSeek的广泛应用,人工智能在推理和分析研判领域的能力得到显著提升,本文将结合资金数据分析与鉴定领域的实战应用探讨人工智能实现路径。
关键词:金析为证、资金分析鉴定、人工智能、大模型、智能体
一、引论
资金数据在刑事、行政乃至民商事案件中均发挥着至关重要的作用,它不仅是犯罪动机和目的的体现,更是案件侦破、事实认定和定罪量刑的关键证据,特别是在经济犯罪侦查和职务犯罪调查领域,“资金流”也被誉为案件的“DNA”。
资金数据在司法活动中的衍变从2012年公安部提出“在线查控技术”开始,经历了资金数据获取、资金数据分析、资金数据证据化和资金分析报告证据转化(即“金析为证”)四个阶段。
2023年7月,公安部经济犯罪侦查局(以下简称“部经侦局”)正式启动“资金分析成果证据转化”工作,简称“金析为证”。 2024年2月,部经侦查局在广泛调研并征求地方公安经侦部门和相关单位意见建议的基础上,印发《公安经侦部门资金数据分析成果转化工作指引(试行)》,推动将资金分析研判成果转化为鉴定意见,实现资金分析研判成果作为刑事诉讼证据应用,正式拉开了“金析为证”专项工作的序幕。截止2025年7月,6个金析为证相关的法庭科学标准已经发布并实施,同年《公安机关资金分析鉴定工作程序规定(试行)》《公安机关资金分析鉴定机构登记管理办法(试行)》和《公安机关资金分析鉴定人登记管理办法(试行)》相继发布并施行。“金析为证”的实质性工作已经开启,即资金数据分析已经从侦查分析衍生到检验鉴定的质变。
诚然,资金分析在侦查和鉴定阶段发挥着不同的作用,承载着不同的使命,但目前高速发展带来的人员梯队储备不足、技战术能力参差不齐等现象还比较普遍。为了解决基层办案民警能力不足、青黄不接以及省、市两级资金分析实验室侦鉴分离要求的问题,围绕“专业、机制、大数据”的核心思想,亟需引入新的可持续的提效赋能手段,打造资金数据分析与鉴定的新质生产力。
人工智能自上世纪五十年代被首次提出后,以实现感知、推理、决策和行动能力为核心目标,依托大模型和智能体这两种AI技术落地的关键形态,取得了革命性的发展。大模型是AI技术的“智慧大脑”,通过海量数据训练具备强大的数据处理和生成能力,支持多模态输入(文本、图像、语音),擅长复杂推理与知识生成。而智能体具备自主决策与执行能力,包括感知环境、动态决策和任务执行,正好弥补了大模型的局限性。
基于AI技术框架,大模型为智能体提供认知支持,解析复杂需求并生成任务规划;智能体为大模型赋予行动能力,通过API或硬件接口实现环境交互。最后形成“感知——决策——执行”的闭环。
因此,通过选择合适的大模型基座,建立资金数据分析与鉴定领域的专业知识库,并加以训练、微调,最终打造出资金分析领域的智能体,从而解决资金分析与鉴定过程中的上述问题,为涉资金案件的侦查分析与检验鉴定工作赋能。
二、资金数据分析与鉴定
(一)资金数据概述
我国的资金数据主要来源于银行等金融机构、第三方支付平台(如支付宝、财付通)、涉网犯罪经常涉及的第四方支付平台等途径。[1]境外非常火热的虚拟货币(如比特币、泰达币)在“9.24通知”[2]后不被认可其价值属性,故不视作资金数据的来源。
资金数据的存在形态多种多样,包括货币(如现金、数字货币、银行存款、支付宝余额等)、不动产、债务、投资(股票、基金、理财产品等)、风险管理(如保险、信托等)、消费等等,目前均以电子数据形态记录和流转,可以在获得授权的前提下通过线上或线下的方式进行调取。获取的资金数据格式通常为电子表格文件或纸质扫描件,一般经过OCR转换后均可得到资金电子数据文件,如下图所示。
图1 资金数据示例
资金数据通常包含的客户名称、卡号、交易对方名称、交易时间、交易金额等信息通常为固定结构特征数据,即结构化数据,而备注信息一般不呈现固定结构特征,因此属于非结构化数据。在进行资金数据分析前,通常可以借助数据预处理等清洗手段将非结构化数据转化为结构化数据,以便更好地进行后续的检验和鉴定。
资金数据分析前需要掌握其独有的特性,主要包括客观真实性、多元性、留痕性和趋利性。
客观真实性主要表现在资金数据是行为人真实经济行为的记录,记录的产生、存储和管理在国家有关部门和机构的监督下进行,受国内相关法律保护。
多元性主要表现在资金数据不仅仅是交易数额的流转变化,还包括对应的人、事,以及时间、空间等多元化信息数据,比如交易产生时记录的日期时间信息、IP地址以及操作设备的MAC地址、线下取现行为的网点位置信息等都是资金数据重要的附属数据。
留痕性主要表现在交易行为的发生,都会在金融网络内留下痕迹,这个痕迹中的大多数都不像传统电子数据那样可以自行删除,三方四方支付除外。因此,资金数据的分析不在于技术的深度,而更在于分析思路的广度。
趋利性则主要表现在资金往往流向利益的相关方,因此资金数据的分析遵循的是先宏观再微观,层层穿透逐步追踪式的,再狡猾的狐狸也逃不过敏锐细致的猎手。
(二)资金数据分析
资金数据分析的方法和维度很多,综合来看,可以大致分为宏观流向分析、特定流向分析、流向分类分析、特殊交易分析、交易时序分析等五种常规方法。
1. 宏观流向分析
宏观流向分析,一般指对分析对象的全量资金数据进行分析,是资金分析最基础的分析方法,适用于绝大部分案件在前期对涉案资金体量、整体流向进行分析的场景,以地下钱庄、网赌、传销、非法集资、售假等案件为主要代表。在分析初始阶段金析宏观流向分析,能够对案件的涉案主体的规模、性质等方面起到描述性的作用,利于掌握案件的整体概况。
宏观流向分析的范围包括分析对象的整体交易属性(量级,频次、周期、对手数量)和资金来源和去向两大部分。不针对特定交易,以分析对象的总收入,总支出,总净收入,总净支出为主要标准来进行区分,最终形成将分析对象的总体来源、去向两大类账户。
宏观流向分析的传统实现路径一般是依靠统计方法完成,例如数据透视表、数据统计。这个路径的弊端在于传统方式在单个账户线索下,可以应对;但若嫌疑对象是团伙,需要分析团伙整体属性时,则无法使用,例如无法规避团伙内部交易带来的对分析结果的影响。为了解决此类问题,使用智能分析工具可以快速形成嫌疑对象的数据画像和来源去向图,从而规避团伙内部交易对分析结果的影响,资金来源和去向的划分也更为迅速和快捷。
图2 数据透视表
图3 来源去向图
2. 特定流向分析
特定流向分析,是指只关注案件的某一笔或者几笔交易的流量、流向等属性的分析。特定流向分析关注的是部分交易数据,而非全部。特定流向所关注的交易来源和去向一般按收支动作来作为衡量标准。常见的适用典型案件有电信诈骗、贪污受贿、合同诈骗、虚开增值税发票、挪用资金、高利转贷等。此类案件线索通常指向比较明确,针对哪一笔或者几笔、哪个对象等。比如在大多数电信诈骗案件中,线索往往是单个受害人;虚开增值税发票案件中,线索往往是有疑似接受虚开的资金;高利转贷案件中,线索通常是银行贷款。因此,特定流向追踪在犯罪事实验证方面能够起到很好的作用。
特定流向分析的传统实现路径一般是依靠Excel等通用工具,借助人工逐笔交易进行追踪、核对。该路径的难点主要在于,一旦混入其他资金时,无法继续辨别资金性质是否来自原来的追踪资金。此时可以列出有可能含有特定资金的所有资金流向,再根据其他数据,例如人员关系等方面来核查交易的可疑性,从而确定具体流向。当然,也可以借助资金分析软件的智能追踪功能,通过固化的追踪逻辑,自动计算,效率更高。
特别是在电信诈骗案件中,追踪受害人的钱款流向,梳理重点转移账户,止付冻结,追赃挽损。如下图所示,受害人转账至对方一级账户,经过层层特定资金分析,最终分析到可追踪的4层账户。
图4 特定资金流向图
3. 流向分类分析
流向分类分析是描述目标对象资金的交易性质或类别的分析方法,是经济犯罪案件中使用较多的一类分析方法,常使用在宏观流向分析后进行更为细致的分析,主要根据交易的属性,按照分类统计的形式描述对手的属性类别。此类分析可明确对象资金的来源或者去向的类别,对涉案对象的资金性质、主观意图等做出描述。常见的适用典型案件有集资诈骗、非法吸收公众存款、职务犯罪类等,这些案件不仅需要明确资金流向,还需要明确资金的性质和用途。流向分类分析也是对下一步侦查/调查对象抽丝剥茧的过程,分清已侦查/调查清楚的,巩固既有的研判成果;同时发现不明确的、可疑的流向,为下一步提供具体导向。
流向分类分析的核心要素是如何分类,常见的分类维度包括:单位交易、银行交易、消防、取现、理财及其他等等。该方法的常规实现路径分为两步。首先,需要做出资金来源去向,即对手分成来源和去向两大类。其次,对两大类进行继续分类,再根据字符长度或者关键词将个人、公司的分开,其中会包含其他类别,再将这两大类进行精细的划分。过程比较复杂,在分类完成后,需要将分类的总量、对手的数量加和与宏观的流向分析结果做核对,保证不漏不重。如果借助智能分析工具的检索过滤功能,搜索包含的关键词或者户名(如可视化搜索),再做标记分类,分类完后结果自动统计。
4. 特殊交易分析
特殊交易分析主要关注是否有某一特征的交易存在,并分析其具体情况。这里,验证“存在”是首要的,是对账户作用、角色、主观意图进行佐证的常用分析方法。跟特定资金流向分析相比,不再仅仅局限于几笔,一般分析对象是全量数据。通常关注的特殊特征维度众多,例如数额特征——小额测试交易;主观意图特征——取现、消费交易;交易性质特征——公转私、夜间交易;账户属性特征——只进不出、集中转入分散转出等等。根据关注的特殊特征,使用在对嫌疑主体定性、主观意图判断等场景中。常见案件有洗钱、网络赌博、帮助信息网络犯罪活动、非法经营等。
5. 交易时序分析
交易时序分析是通过时间维度对交易数据进行分析,更加注重资金交易在时间上显示的各项特征,例如账户的资金交易趋势、交易集中时间段、账户(交易)的静默期、交易的特殊时间段等。从时间维度的分析结果验证现有线索,发现新线索,是掌握目标对象“行为规律”、“发生过程”的有效手段。大部分涉资金案件中后期分析时都会做时序分析,尤其是线索不明确的案件。交易时序分析一般不作为案件的首要分析方法,在需要对更细微的犯罪过程的刻画和描述时再使用。
图5 资产数据变化
图6 交易时序分析
(三)资金分析鉴定
自“2.28决定”[3]实施二十年来,司法会计作为与资金密切相关的鉴定门类持续参与司法活动。直至2015年、2018年《全国人民代表大会常务委员会关于司法鉴定管理问题的决定》将列入统一登记管理范围的司法鉴定业务限制为法医、物证、声像资料和环境损害四大类,“四大类”外的司法会计鉴定不再予以登记管理。2020年3月,《司法部办公厅关于开展司法鉴定机构和鉴定人清理整顿工作的通知》(司办通〔2020〕27号)指出:对明确属于从事“四类外”鉴定业务的鉴定机构和鉴定人,依法坚决注销登记。随着时间流逝,截止目前,除检察机关仍保留有司法会计鉴定并持续管理外,原社会第三方司法会计鉴定机构均已主动注销或在有效期限届满后被动注销。
第三方司法鉴定机构注销后,随之衍变出一批由各级财政部门登记管理、经各级法院认可的财务服务机构,由注册会计师(原司法会计鉴定人)从事相关专业鉴定工作。技术上,传统的会计审计人员已无法处理错综复杂的涉案资金和海量数据分析研判的需求。
事实上,随着信息化和数字经济的发展,大量的涉案资金均已电子数据出现,且绝大部分涉网犯罪也都与资金交易密切相关。因此,在当前情况下还是存在不少以电子数据存在性鉴定出现,特别是鉴定检材涉及的资金数据本身就是服务器取证获取的后台数据的情况。这被我国证据法学专家刘品新教授称之为“鉴计为证”[4],也可以理解为目前资金数据分析报告直接证据化,也就是“金析为证”的前身。
“资金分析鉴定”延续“金析为证”的思想而来,最早出现在2025年4月7日公安部印发并施行的《公安机关资金分析鉴定工作程序规定(试行)》(以下简称《规定》)。《规定》第一章第二条指出,本规定所称的资金分析鉴定,是指为解决案件调查和诉讼活动中的资金数据分析专门性问题,公安机关资金分析鉴定机构的鉴定人运用资金分析技术方法,对资金数据进行检验、鉴别、分析和判断,并出具资金数据检验报告、鉴定意见的活动。
讨论资金分析鉴定,我们必须要搞清楚几个关键问题。
首先,要明确资金分析鉴定解决的是跨法学、公安学(侦查)、工学(信息技术)、管理学(会计、财务、审计)、经济学等学科交叉领域的专门性问题。
其次,《规定》第四章第二十五条指出,资金分析鉴定工作流程主要包括资金数据及其他数据的完整性客观性校验、保全备份、数据的归并与清洗、数据的分析与结论生成等。这里既有“资金数据”还有“其他数据”,“资金数据”是指依法向银行业金融机构、非银行支付机构及其他单位和个人获取的账户信息、交易明细等资金相关数据。“其他数据”,即非资金数据,是指公安机关资金分析鉴定需要的其他类型数据,包括但不限于运营商通信数据、第三方通联APP数据、地理位置数据等等。
再次,资金分析鉴定的标准方法主要依据是2025年3月1日施行的《GA/T 2158-2024 法庭科学 资金数据获取规程》《GA/T 2159-2024法庭科学 资金数据清洗规程》《GA/T 2160-2024 法庭科学 资金数据检验规程》和《GA/T 2160-2024 法庭科学 非法集资类案件资金数据分析规程》,这四个标准囊括了资金数据的获取、清洗(含预检)、检验及分析(一个类罪)的关键步骤。根据2025年7月1日施行《GA/Z 2328-2025 法庭科学 资金数据分析标准体系表》所示,还会有资金数据穿透、洗钱类案件资金数据分析等规程陆续发布施行。
最后,目前的资金分析鉴定机构,仅指经公安机关登记管理部门核准登记,取得鉴定机构资格证书并开展资金分析鉴定工作的组织。其余司法鉴定登记管理部门,如检察机关、司法行政管理部门尚不具备相关权限。同样的,目前的资金分析鉴定人,也仅指经公安机关登记管理部门核准登记,取得鉴定人资格证书并从事资金分析鉴定工作的专门技术人员。
(四)当前挑战
1. 侦鉴分离难题
2025年7月29日,公安部印发《公安机关资金分析鉴定人登记管理办法(试行)》(以下简称《办法》),其中第一章第四条要求“资金分析鉴定人应当独立开展资金分析鉴定工作,不得从事资金分析以外的侦查工作。”
《办法》从鉴定人工作范围角度严格强调了“侦鉴分离”,势必要求将现有的资金分析人员进行强行拆分,满足《办法》第三章第十条要求且取得资金分析鉴定人资格的属于鉴定人,即从现有队伍中择出,剩下的作为侦查人员。虽然鉴定人的数量底限是三人,但按照实验室日常管理角色要求,三人尚不足以承担日常鉴定业务工作。
一方面,现有单个案件鉴定工作要求两名鉴定人加一名复核人,如果出现重现鉴定的情形,二次鉴定的鉴定人必须不低于原鉴定人的专业技术资质,必然要求有足够的备份人员,且需要满足相应的技术资质或职称要求。另一方面,日常事务管理中,通常在鉴定实验室启用不具备鉴定人资格的“助理”或“助理鉴定人”,他们从侦查人员中遴选或借调,也会带来侦鉴分离的新风险。
还需要重视的是,资金数据分析工作在侦查阶段通常会伴有多次调证、多次研判的情况,因此只有等待侦查分析完善后再进行鉴定才能确保真正做到侦鉴分离。但这样做的后果是要求侦查阶段资金分析必须做的足够细致和全面,而鉴定阶段相当于是依据法庭科学规程技术上重新复验一遍,但流程上更加繁琐和严谨。对于人数紧张的鉴定实验室来说,鉴定的工作量和压力空前巨大,相当于针对每一个案件,鉴定人员需要做大于侦查人员的工作量。如果为了省事直接参照侦查分析的结果出具报告,则又会面临巨大的法律风险。
2. 结果报告乱象
由于目前资金分析鉴定工作正处于过渡期,资金分析结果报告的形态和性质也持续着呈现了一定的混乱现象。
第一种,电子数据鉴定报告。电子数据鉴定的客体主要是电子数据及其存储介质,资金数据的形态归属于电子数据。套用电子数据存在性鉴定,完成后出具的司法鉴定意见书属于《刑事诉讼法》规定的独立证据类型“鉴定意见”,与“电子数据”本身分属两种不同类型的证据。
第二种,司法会计鉴定报告。司法会计鉴定是为了解决案件中有关会计专门性问题,运用司法会计鉴定技术,通过调查、研究和验断,做出鉴定结论,为案件需要证明的对象提供证据材料所进行的一种鉴定,它的鉴定客体主要是有关社会组织和个人保存的会计核算资料及其拥有的财产。与电子数据鉴定相同,司法会计鉴定完成后出具的司法鉴定意见书也是法律效力的独立证据。
第三种,审计报告。一般由会计师事务所(即依法独立承担注册会计师业务的中介服务机构)出具。会计师事务所是受财政部门及各地监管局监管的财务服务机构,不是受司法行政部门监管的司法鉴定机构。会计师事务所出具的审计报告是指审计人员根据审计计划和程序,对被审计单位实施必要的审计程序,就被审计事项作出审计结论,提出审计意见和审计建议的书面文件。被法院认可为专业鉴定机构的会计事务所出具的审计报告也视为鉴定意见书。
第四种,资金分析报告。通常由尚不具备资金分析鉴定资质的机构出具,资金分析人员(资金分析师)按照工作规范和技术标准,对委托方提供的资金数据进行清洗、检验、分析,形成的标准化报告。这也是资金分析鉴定报告诞生过渡阶段的产物。
上述第三、四种报告用于诉讼活动时,应当依据“2021年刑诉法解释”第一百条规定,[5]属于专门性报告。然而,不少实务专家为了硬靠《诉讼法》中的现有证据类型,将此类报告认为属于书证或证人证言,笔者不赞同。
3. 行业发展趋势
在业务发展趋势上,随着“金析为证”工作的持续推进,资金分析鉴定从公安涉资金类刑事案件出发,逐步推进到检察侦查、纪检监察机关审查调查乃至行政执法和民商事专业鉴定中,公检法司一体化的资金分析鉴定发展趋势势在必行。基于公检法司一体化的践行,必然建立多方互认的鉴定体系,从人民法院对外颁发的具有专门技术的司法辅助机构(专业鉴定机构)到司法行政部门统一管理的司法鉴定机构。
在技术发展趋势上,人工智能的不断介入,从智能分析工具到大模型、智能体的发展,能够应用在资金分析与鉴定领域的新技术不断赋能,有助于加速人才梯队培养和助力涉资金类犯罪的预防和打击。
三、人工智能的发展与应用
(一)人工智能与大模型
1. 人工智能概述
人工智能(AI)是研究、开发用于模拟、延伸和扩展人类智能的理论、方法、技术及应用系统的一门综合性科学。人工智能涉及的方面十分广泛,包括机器人、语言识别、图像识别、自然语言处理、专家系统、机器学习,计算机视觉等等。
AI的发展可以简单的分为传统AI和生成式AI两种。传统AI也叫做“规则驱动的AI”或“判别式AI”,主要依靠预设的规则和大量的训练数据来工作,通过训练让模型学会从数据中提取特征,然后根据这些特征进行分类或预测。传统AI包括各种机器学习算法,如决策树、支持向量机(SVM)、逻辑回归等,典型的应用包括IBM的深蓝(Deep Blue)和谷歌的AlphaGo。生成式AI(简称AIGC),是指基于生成对抗网络、大型预训练模型等人工智能的技术方法,通过已有数据的学习和识别,以适当的泛化能力生成相关内容的技术。这种技术可以生成文本、图像、音频、视频等多种形式的内容,典型的应用包括OpenAI的聊天机器人ChatGPT以及Stability AI的绘图模型Stable Diffusion等等。可以说生成式AI是人工智能1.0时代进入2.0时代的重要标志。
2. 大模型概述
大模型(LLM)是指具有大规模参数和复杂计算结构的机器学习模型,具备复杂的任务处理能力。大模型具有巨量参数、数据驱动、语言突破、跨域通用及持续进化的特点,在各领域均有广泛的应用,包括自然语言处理、计算机视觉、语音识别和推荐系统等。
相比大模型,小模型通常指参数较少、层数较浅的模型。小模型训练速度快、资源占用少、泛化能力强,因此适用于数据量较小、计算资源有限的场景,例如移动端应用、嵌入式设备、物联网等。
大模型的发展经历了三个阶段:Transformer[6]革命与早期探索阶段(2017-2019)、规模化阶段(2020-2023)、多模态融合与智能体崛起阶段(2023-2025)。
大模型的核心技术建立在模块化的通用架构之上,并由Transformer核心架构驱动。大模型通用架构通常包括输入层、嵌入层、特征提取层和输出层,而Transformer通常是特征提取层中的核心组件。Transformer模型结合了编码器和解码器两大部分,编码器负责理解输入的文本,为每个输入构造对应的语义表示;解码器负责生成输出,使用编码器输出的语义表示结合其他输入来生成目标序列。
图7 编码器和解码器的工作原理
上图中提及的注意力机制能够让序列中的每个元素在对自身进行处理时,并行地关注所有位置的信息。通过这种方式,每个元素能够“关注”到整个序列中的其他部分,从而捕获全局上下文信息。
大模型经过训练,可以完成某些领域的文本生成、系统问答和信息提取等工作。但大模型模型受上下文窗口限制,处理长文本时可能会丢失信息;更糟糕的是,大模型还可能会生成与事实不符的内容,影响输出可靠性,需要借助一定程度的人工核验。另外,大模型的训练和推理耗费巨大算力,成本高昂,限制了很多企业的应用落地。
(二)大模型的训练
核心技术搭建了大模型的“骨架”和“大脑潜力”,要让其真正“智能”,还需对大模型进行训练,训练是为大模型“注入知识”和“培养能力”的唯一路径。大模型训练的本质是一个参数不断优化的过程。利用海量数据与算力,使模型学习数据规律,获得预测能力。虽然细节各有不同,但是当前的大模型训练往往都收敛为“预训练——微调——强化学习”这个范式。
1. 提示词工程
提示词工程在大模型应用的开发和性能优化过程中贯穿始终。提示词是用户对大模型输入的指令,用于指导其生成、提取或回答,它的作用是明确任务,帮助AI输出预期结果。通过角色、任务、上下文、约束和示例的引导,提示词能够将开放域能力聚焦为贴合特定场景的可靠输出。
提示工程技术是引导大模型进行深度思考和创新的有效工具,这些技术可分为基础输入增强(如零样本提示、少样本提示)、行为风格塑造(角色提示、系统提示)、思维引导强化(思维链(CoT)、目标分解)、迭代优化交互(自我批评、思路连贯性)、元方法提效等。其中,零样本和少样本提示各有优势和局限,选择使用哪一种方法取决于特定的任务需求和目标。为了获得更可靠的响应,还可以考虑使用更高级的提示技术,比如思维链提示,或者对模型进行微调和进一步的提示工程实验,以达到更好的结果。
在应用提示工程技术时,经常会出现各种提示词陷阱,如缺乏迭代陷阱、过度指令和模糊指令陷阱、假设偏见陷阱、幻觉生成陷阱和忽视伦理边界陷阱等,处理好上述陷阱尤为重要。
针对缺乏迭代陷阱,首先需要采用增量方法,即从基础提示词开始,逐步添加细节和要求;其次主动寻求反馈,要求AI对其输出进行自我评估,并提供改进建议;最后准备多轮对话,设计一系列后续问题用于澄清和改进初始输出。
针对过度指令和模糊指令陷阱,首先需要平衡详细度,提供足够的上下文,但要避免过多限制;其次明确关键点,突出最重要的2-3个要求;再次采用清晰的结构来组织需求;最后提供示例,给出期望输出的简短示例。
针对假设偏见陷阱,首先自我审视,设计提示词时反思自己可能存在的偏见;其次使用中立语言,避免在提示词中包含偏见或预设立场;最后进行批判性思考,对AI的输出保持警惕,交叉验证重要信息。
针对幻觉产生陷阱,首先明确不确定性,鼓励AI在不确定时明确说明;其次事实核查提示,要求AI区分已知事实和推测内容;再次要求AI从多个角度或来源验证信息;最后明确要求AI提供信息来源,以便更好地验证。
针对忽视伦理边界陷阱,首先了解界限,熟悉AI系统的基本伦理准则和限制;其次合法合规,确保请求符合法律和道德标准;再次在提示词中明确包含伦理考虑和指导原则;最后要求AI评估其建议或输出的潜在社会影响。
综上,撰写出优质提示词需要做到以下几点,以促进大模型更加贴切适用。
第一、指令清晰,使用清晰、准确的词语,避免模棱两可或引起歧义。
第二、提供上下文、历史背景及环境信息,可以引导模型理解更具体的情景,以做出更好的响应。
第三、结构化输出,采用“角色——任务——要求”三段式结构,让提示词更清晰。
第四、在提示词中少量增加“示例样本”来启发大模型达到举一反三的效果。
第五、迭代优化,通过多轮迭代指令,逐步优化输出结果,结合大模型的实时反馈能力,实践高质量输出。
第六、控制长度,限制输出的文字数、答案数等以适应会议纪要、案件总结性文档、检验/鉴定报告等场景。
第七、多步推理,在提示词中增加多步骤推理的示例来启发大模型达到举一反三的效果。
2. 大模型微调
要训练成特定领域的专业大模型,微调工作必不可少。大模型微调是调整预训练模型参数适应特定任务的过程。微调避免从头训练大模型的高成本,仅需在预训练模型的基础上进行,因此成本较低;同时,微调仅利用少量领域数据快速补充预训练缺失的专业知识,省去了海量通用数据的收集工作。另外,微调还可以实现深度定制化,灵活适配案情研判、资金分析、报告撰写等场景,构建专属的资金分析、鉴定AI模块。
进行大模型微调时,首先需要准备高质量训练数据,如涉资金各类罪案例中的真实脱敏数据,构建模型学习的专业领域“知识库”;其次选择一个预训练好的基础模型,比如今年初爆火的DeepSeek;再次通过迭代学习优化参数,完成AI“分析师”的实战演练;最后合成新的资金数据分析领域的专业大模型。
实践大模型的微调,需要构建微调流程,主要包括环境准备、模型加载、数据集准备、LoRA配置、[7]训练器设置、模型训练、评估、保存及测试,从而提升大模型在特定领域任务中的性能与适应性。
第一步、环境准备。安装transformers,peft,trl,bitsandbytes。激活虚拟环境,确保CPU支持。
第二步、模型加载。加载DeepSeek-R1 7B版本(示例),使用AutoModelForCausalLM和BitsAndBytesConfig。
图8 加载DeepSeek模型
第三步、数据集准备。加载数据集,转为Hugging Face格式,[8]清洗和分类。
第四步、LoRA配置。设置LoRAConfig with rank=16, target_modules,应用到模型。
图9 配置LoRA
第五步、训练器设置。使用SFTTrainer设置参数,如epochs=3, batch_size=1 for CPU。
图10 设置训练器
第六步、模型训练。运行trainer.train(),监控损失,训练时间视数据而定。
第七步、模型评估。使用测试集评估损失和任务准确率,比较微调前后。
第八步、保存。保存微调适配器和合并模型。
第九步、测试。加载微调模型测试任务。
(三)RAG知识库构建
RAG(Retrieval-Augmented Generation,检索增强生成)是一种AI框架,它将传统信息检索系统(如数据库)的优势与大模型(LLM)的功能结合在一起。借助RAG,可以克服大模型的知识局限,处理最新数据与幻觉问题。通过检索外部知识,为大模型提供依据,减少事实错误。
典型的RAG系统主要由三大核心组件构成:知识库、检索器、生成器,这些组件协同工作,实现了从输入到生成高质量结果输出的完整流程。知识库内容包括法律法规、案情概况、法庭科学的技术标准、各类法律文书报告等等,要求数据准确、无涉密或其他敏感信息,以确保应用安全;检索器基于相似度查找相关文档,使用向量搜索;[9]生成器基于知识库和检索器,生成高质量的答案。
(四)智能体开发
智能体(Agent)是自主规划和执行任务的AI系统,拥有专业领域知识库,支持多步推理、工具调用和任务自动化。
智能体的核心组件包括大模型、规划、记忆和工具。智能体通过大模型解析任务并规划步骤,借助工具调用扩展智能体专业能力,记忆机制保存上下文和记录中间结果,通过存储历史交互实现。结合RAG检索数据,智能体更加精准、动态和自动化。
构建一个专业领域的智能体,首先,定义任务、明确目标,要求尽可能具体、清晰、可分解,例如任务是资金数据归并、清洗、分析,最终目标是输出某账号的来源去向信息。其次,分解任务,制定计划,将任务拆解为若干小步骤,多步处理,这在资金分析领域很容易进行小步骤分解,例如导入、归并、清洗、清洗过程中的调整、数据的宏观流向分析、特定账号的分析等等。再次,设计提示词明确每步任务,下达专业指令,指令结构包括步骤、上下文、格式,例如指令可以是分析电诈案件中某受害人账号资金流转情况并输出每个层级中转的账号信息。复次,按规划步骤执行任务,即实现自动化数据分析。最后,保存结果,输出可记录的成果格式。
四、构建资金分析智能体
(一)资金分析智能体的规划
大模型在资金分析领域中实现应用,需要具备三个要素:D(Data,数据)、M(Model,模型)、A(Applications,应用套件)。首先,数据是AI应用的前提和基础,大模型的精准训练需要大量的资金数据、技战法模型、研判思路等。其次,模型是经过训练的私有领域专有模型,而且必需是具备资金分析业务特点的、能够真正进行实战的大模型。最后,直接作用于资金数据本体的是真正能用于实战的具有理解并遵循标准、资金分析能力和展现功能的应用套件。三者缺一不可,有机结合,形成具备“资金分析师”特质的资金分析智能体。
1. 资金分析智能体的定位
已知AI人机协作有三种模式:第一种助理模式(Embedding),人类设立任务目标、AI只提供信息或建议,人类完成绝大部分工作,类似大部分聊天问答助手;第二种副驾驶模式(Copilot),人类设立任务目标、AI完成初稿、人类修改完善并确认结束工作;第三种代理人模式(Agents),人类设立目标、提供资源并监督结束,AI全权代理完成全流程工作。
资金分析智能体首先需要具备资金分析助理的能力,即经过知识库构建以及资金分析专业训练后能够根据人类设立的任务目标进行解读和理解并给出分析建议,但远远还不够。在此基础上,通过微调技术让AI能够完成初步分析工作,逐步培养成为初级资金分析师的水平,但需要注意的是人类需要在过程中的关键节点做好监督、确认和核准,此时的智能体处于副驾驶模式。最后,在不断的类罪训练数据和战法模型的学习训练之下,AI逐渐成长为代理人,能够具备独立工作的能力。但要特别注意的是,司法活动的责任主体绝对不能是AI,即不管是侦查分析阶段,还是检验鉴定阶段,任何决策性问题和结论性输出都不能完全依赖和放任AI,智能体的使用者一定要时刻履行相应的工作职责和法律责任。
- 预期目标与流程设计
市面上常见的资金分析软件尽管实现了智能化,但普遍使用方式和操作路径还是以“人工串联单点功能”为主,依赖的是操作人员的技术能力和业务经验。我们现在需要基于大模型构建资金分析智能体,以实现从“人工串联单点功能”到“智能驱动全流程分析”的范式升级。
针对资金分析智能体,我们预设计的流程包括先识别分析意图、接着生成分析思路、再进行思路确认,然后执行数据治理任务、清洗和分析数据、输出分析结果,最后根据上下文解读分析结果,对结果进行正负反馈优化。
3.大模型底座的选择
选择智能体所依托的大模型底座非常重要,通用模型在数据分析领域存在三大挑战:
第一,领域知识适配性不足。通用大模型难以识别业务术语或领域内的习惯表达,分析中欠缺足够的专业知识,存在“幻觉”现象;大模型缺乏经济案件特有的金融犯罪模式、涉税逻辑及洗钱链条知识,难以精准调用资金穿透分析工具等专业研判能力。
第二,复杂逻辑推理能力局限。涉及跨境资金流动的团伙作案需同时关联税务、银行、市场监管等数据,通用模型易出现逻辑断链,难以构建“资金-人员-企业”多重嵌套关系的动态推理图谱。
第三,决策过程不可解释。例如在分析资金异常交易时,无法直观展示“高风险账户”判定的具体计算依据,侦查分析需保留可验证的推理过程,但通用大模型动态生成的特征关联规则难以固化输出。
因此,选择领先的大模型底座是关键。
首先,DeepSeek代码能力的增强,对于前期数据清洗与ETL(Extraction Transformation Loading,即抽取、传输、加载)过程极大利好,如自动识别并处理数据中的缺失值和重复项,令数据清洗更智能;还能更好地支持跨维度数据查询能力,从而将更多维度的数据指标聚合起来进行分析,使数据分析更加深入。
其次,DeepSeek的推理能力增强,可以加速企业级指标语义构建效率,同时可以提升“人类语言”和“数据语言”的连接效率,让大模型的意图理解更精准。
再次,DeepSeek的数学能力增强,大大提升数据分析报告的深度、逻辑性和准确性,驱动数据分析报告更加贴近实战。
最后,对基座大模型进行深度调优,将大量真实案例数据、分析研判思路归纳作为资源,打造高质量训练数据语料,沉淀近千种分析战法,构建AI工具集,最终训练出资金数据分析领域的智能体。该智能体聚焦于经济犯罪侦查、职务犯罪调查与资金数据分析领域,具备案情推理、数据分析及风险行为识别等行业特有的能力。它能提供更精准的研判建议、更复杂的案情推理、更智能的报告生成。分析人员以自然语言作为交互方式处理专业、繁复的工作任务,从而全面赋能涉资金案件的侦查分析工作;同时,鉴定人员也可以利用它进行检材预检、数据核验乃至初步鉴定工作,为资金分析鉴定提升效率。
(二)资金分析智能体的开发
- 归纳研判思路
首先,针对资金数据的智能清洗,需要解决如何进行资金数据分类、归并、清洗、治理等四个方面的问题。
其次,针对资金数据的智能分析,需要解决如何进行资金统计分析、追踪溯源、异常交易识别和交易分类等方面的问题。
最后,针对资金数据的智能解读,需要明确解读场景、解读维度、解读结论以及如何输出待调单建议等问题。
2. 整理训练语料
首先,梳理高频分析场景。根据实战经验,全面梳理资金分析的高频场景,如快进快出、沉淀账户、高频交易等。
其次,人工标注分析思路。为各分析场景,人工整理研判分析思路、分析关键点、数据解读逻辑等。
最后,训练知识增强的行业大模型。除了高质量数据集,还需要充分利用历史积累的知识库和案件经验来增强大模型的专业领域知识能力。
- 构建AI工具集
以业务分析场景为核心调用各类AI工具套件,帮助用户快速准确地完成资金数据的智能清洗和探索式分析,AI工具套件包括但不限于知识图谱、战法模型、主体画像、社会网络分析、可视化分析等,从而形成工具集。
- 训练资金分析智能体
开始资金分析智能体训练,输入资金数据文件(如XLS、CSV等格式),思维链提供分析思路(如数据治理清洗、梳理调单账户的资金来源和去向、梳理根据资金流向形成的交易层级、研判数据中根据IP/MAC关联的团伙情况、生成案件分析报告等),借助小模型提供服务列表(如推荐模型、战法模型、数据治理模型、类罪研判模型、意图识别模型、OCR检测模型、开源情报等),智能体判断是否调用外部服务,如果选择调用,则使用Code Interpreter大模型调用小模型集的服务来输出结果;[10]如果选择不调用,则直接生成并输出结果。如下图所示。
图11 训练资金分析智能体
(三)资金分析智能体的应用
为了更好的验证资金分析智能体的实战应用水平,笔者选用了某网络赌博案件的脱敏数据。该案件背景为警方通过侦查发现,某赌博网站的一条隐蔽资金链路充值入口由支付宝跳转至A公司对公账户,因此调取了A公司的银行流水准备进行资金数据分析。
- 自动清洗资金数据
资金数据导入后,自动进行解压缩、清洗、校验、去重、治理等操作。
图12 自动清洗资金数据
2. 智能生成分析报告
初步分析后,一键智能生成分析报告,并能够导出。
图13 智能生成分析报告
- 分析资金流向分类
针对性的分析案件数据中A公司账户的收入来源与支出用途分类。
图14 资金流向分类分析
- 分析涉案资金规模
统计案件数据中A公司账户的交易总金额、收入总金额、支出总金额和交易净额。
图15 涉案资金规模分析
- 分析资金交易层级
根据案件数据,分析赌资去向,补充调取新的账户数据,继续分析资金交易层级。
图16 资金交易层级分析
五、结语
AI技术赋能案件侦查和司法鉴定领域具有重要的现实意义和发展前景,尤其在“金析为证”工作中针对资金数据分析和鉴定的尝试和应用。通过不断的标准完善、经验赋能、人机交互和科学训练,大模型和智能体在为资金数据分析与鉴定提供更强大的工具和方法的同时,不断降低从业人员的知识门槛,提升AI分析的效率、准确性和可信度,同时厘清责任归属,为进一步推动资金分析鉴定人才梯队的快速且持续发展注入新质生产力。
参考文献
(1)皮浩:《从一起经济案件看“金析为证”数字证据质证问题》,《电子数据取证与网络犯罪调查》第七辑。
(2) 刘铭:《金析为证:数智侦查成果证据化的实践探索》,《中国人民公安大学学报(社会科学版)》2025第2期。
(3) 殷炳华:《资金数据分析报告证据化的证据论基础和现实路径》,《中国人民公安大学学报:社会科学版》2024第5期。
(4) 李丽:《资金数据分析结论证据转化研究》,《公安研究》2024第6期。
(5) 于飞:《人工智能在数据分析中的应用研究》,《信息记录材料》2020第12期。
(6) 韩雪雯,车尚锟,杨梦晴,王能:《多模态数据驱动的AI智能体模式设计》,《图书情报工作》2024第24期。
(7) 蔡睿,葛军,孙哲,胡冰,徐玉华,孙知信:《AI预训练大模型发展综述》,《小型微型计算机系统》2024第10期。
(8) 王娜:《大数据时代背景下的人工智能应用分析》,《信息记录材料》2024第9期。
注:
[1]第四方支付平台是指未获得国家支付结算许可,违反国家支付结算制度,依托支付宝、财付通等正规第三方支付平台,通过大量注册商户或个人账户非法搭建的支付通道。
[2] 2021年9月24日,中国人民银行等10部门发布《关于进一步防范和处置虚拟货币交易炒作风险的通知》,明确虚拟货币不具有与法定货币等同的法律地位,相关业务活动属于非法金融活动。
[3]指2005年2月28日,十届全国人大常委会第十四次会议通过的《关于司法鉴定管理问题的决定》。
[4]参见皮浩:《从一起经济案件看“金析为证”数字证据质证问题》,《电子数据取证与网络犯罪调查》第七辑。
[5] 2021年《最高人民法院关于适用〈中华人民共和国刑事诉讼法〉的解释》第一百条规定,允许有专门知识的人就专门性问题出具的报告作为刑事证据使用。
[6] Transformer模型是一种深度学习模型,最早在2017年由谷歌大脑团队Ashish Vaswani和多伦多大学的一个团队发表的一篇名为”Attention is All You Need”的论文中描述。
[7] LoRA(Low-Rank Adaptation)是一种针对大型预训练模型的高效微调技术。它通过引入少量可训练的低秩矩阵来模拟参数更新,旨在解决全参数微调所带来的计算和存储成本问题。
[8] Hugging Face提供了transformers库,用于加载和使用模型。
[9]通过向量嵌入(Embedding)将文本转为数值向量,以支持快速相似度检索。
[10] Code Interpreter(代码解释器)是一个官方的ChatGPT插件,用于数据分析、图像转换、编辑代码等。简单说,Code Interpreter可以让普通用户(非程序员)用自然语言完成以前需要写代码来完成的复杂工作。
作者简介:
皮浩,司法鉴定人,高级工程师,现任智器云高校与法律服务行业总监。“取证者联盟”创始人,浙江司法技术专家库成员、香港isfs会员、广东警官学院外聘教官,多家鉴定机构、律师事务所专家顾问。《电子数据取证分析师国家职业技能标准》起草者之一,《中国大百科全书·网络安全与执法卷》编者之一,主编清《电子数据取证技术》,参编《数字取证》《电子数据取证》等专著十余本。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:取证者联盟 皮浩《首发 | 皮浩:资金数据分析与鉴定的人工智能实现路径(完整版)》