文章总结: 文章系统分析了AI在反钓鱼邮件领域的最新进展,包括学术界的ChatSpamDetector单模型方案和MultiPhishGuard多代理系统,以及微软、Proofpoint和深信服等商业公司的技术方案。文章指出,随着AI技术发展,反钓鱼检测已从规则匹配转向大模型分析,但面临高误报率、高成本和对抗性攻击等挑战。深信服的8B多模态模型结合向量数据库,实现了95.4%的检出率和0.046%的误报率,展现了较好的商业应用前景。
综合评分: null
文章分类: AI安全,WEB安全,安全建设,漏洞分析,解决方案
AI反钓鱼,国内外最新进展及模型分析
原创
孙志敏
AI与安全
2025年11月24日 08:20
北京
Agent 技术正在快速发展。当各家的 Agent 能力逐渐趋同时,竞争焦点将从 Agent 本身转向底层模型。而在反钓鱼领域,由于邮件格式单一、结构标准化,对外层 Agent 的要求相对较低,因此会率先进入“比拼模型能力”的阶段。
本文较长,分成四个部分:
1.通过论文介绍反钓鱼邮件使用大模型的方法,包括单智能体方案和多智能体方案。
2.介绍国外微软和Proofpoint的方案里的模型情况
3.介绍深信服的技术方案和模型应用特点
4.披露一些深信服模型训练过程的一些数据。
安全里有些奇葩攻击的存在:攻击没什么技术含量,但防护很麻烦,像DDoS,暴力破解等,一直是黑产的最爱,甲方的头疼。
钓鱼邮件也是这种,攻击简单成本低,多少年来一直无法清除。在大模型出现后,最先应用的场景之一就是用大模型来生成钓鱼邮件,并且越来越逼真。2025年4月份,Hoxhunt 有份报告显示,人工智能驱动的网络钓鱼代理在设计有效的网络钓鱼攻击方面已经超越了精英人类红队,这一里程碑式的成就可以说重塑了网络安全威胁格局,该报告将其描述为社会工程领域的“天网时刻”(天网一词来源于电影《终结者》,指超过人类的人工智能网络)。该类攻击已经蔓延至BEC(Business Email Compromise业务电子邮件入侵/欺骗攻击),危害越来越大。
钓鱼邮件检测经历了从规则匹配到智能分析的发展。早期方法依赖黑白名单、URL过滤、域名和邮件头校验(如 SPF、DKIM、DMARC),虽实时高效,却难应对语言伪装与新型攻击。
随后出现基于启发式和机器学习的检测模型,如 SVM、随机森林、朴素贝叶斯等,利用内容特征、URL结构、域名信息等进行分类,但仍受限于人工特征工程,难捕捉语义与社工意图。
进入深度学习阶段后,CNN、RNN 等模型能理解语义与上下文,显著提升准确率,但依赖大量标注数据,跨语言和场景的泛化能力仍有限。
大模型出现后,无论是学术界还是商业界,都出现了大量基于 LLM 的钓鱼检测研究与产品实践,如 Proofpoint、微软等厂商在邮件安全产品中引入了语言模型分析模块,而研究领域也出现了 ChatSpamDetector、MultiPhishGuard等方案。本文将对这些学术与产业界的发展作系统梳理。
01
两篇论文的分析
用大模型检测钓鱼邮件是比较热门的技术,目前已经有很多论文。研究论文的好处是,他们会准确描述如何实现,这一点好于商业公司。下面是对两篇论文的分析。
1.1 ChatSpamDetector:单一大模型的系统化应用
ChatSpamDetector系统使用大语言模型来检测钓鱼邮件,通过将邮件数据转换为适合LLM分析的提示词,系统能够高精度地判断邮件是否为钓鱼邮件,并提供详细的判断依据,其主要判断流程如下:
- 解析和解码(Parsing and Decoding)
- 提取邮件的原始内容,包括编码的主题、正文、附件等
- 将编码内容(如Base64、UTF-8等)解码为可读文本
2. 简化处理(Simplifying)
- 清理HTML标签和CSS样式,保留核心文本内容
- 去除无关的格式信息,提取关键信息如链接、文本内容
3. 生成提示词(Generating Prompt)
构造结构化的提示词输入给LLM:
我希望您能够充当垃圾邮件检测器,判断给定的电子邮件是钓鱼邮件还是合法邮件。您的分析应该全面且基于证据。钓鱼邮件通常冒充合法品牌,并使用社交工程技术来欺骗用户。这些技术包括但不限于:虚假奖励、虚假账户问题警告以及营造紧迫感或兴趣感。伪造发件人地址和嵌入欺骗性 HTML 链接也是常见的伎俩。请按照以下步骤分析电子邮件:1. 识别任何冒充知名品牌的邮件。2. 检查电子邮件标题是否存在欺诈迹象,例如发件人姓名或电子邮件地址是否存在差异。评估主题行是否存在典型的钓鱼特征(例如,紧迫性、奖励承诺)。请注意,收件人地址已被替换为虚拟地址。3. 分析电子邮件正文,查找旨在诱导点击超链接的社会工程手段。检查 URL 以确定其是否具有误导性或指向可疑网站。4. 对电子邮件进行全面评估,重点突出支持您结论的具体要素。并详细说明在电子邮件中发现的任何网络钓鱼或合法性迹象。5. 总结您的发现,并结合您收集的证据,对电子邮件的合法性做出最终判断。Email: <Insertemailtextdatahere>
4. LLM判断输出
大模型分析邮件内容后,输出JSON格式的检测结果:
- is_phishing: 是否为钓鱼邮件(true/false)
- phishing_score: 钓鱼概率评分(0-10)
- brand_impersonated: 被冒充的品牌
- rationales: 判断理由
这是一个非常简单的过程,也确实能够对钓鱼邮件做出相对准确的判断,但对模型能力要求非常高。
1.2 MultiPhishGuard:一种基于LLM的多代理钓鱼邮件检测系统
上一篇论文是一种基本方法,说清楚了大模型的应用,但单Agent的能力还是弱,MultiPhishGuard提出了一种多代理的方法,旨在强化检测能力。系统流程如下图:
整套检测框架基于“多智能体(multi-agent)+ 大语言模型(LLM) + 强化学习优化”的思路,将钓鱼邮件识别划分为多个协作阶段:
-
输入与变异生成
系统首先从 Email Dataset 获取原始邮件样本。为了模拟真实世界中多变的钓鱼策略,引入一个 对抗代理(Adversarial Agent),利用大语言模型生成语言上或格式上经过修改的“钓鱼变体邮件”,增强后续检测的鲁棒性和泛化能力。 -
特征提取与多智能体检测
每封邮件被解析为多个特征通道(文本、URL、元数据)。 一个 Phishing Agent Ensemble(钓鱼检测智能体集群) 分别使用三个大模型代理: -
Text Agent:基于大语言模型(如 GPT、LLaMA 或 Claude 类)理解邮件文本内容,分析语言风格、语义意图、社交工程特征(如“紧迫感”“身份冒充”“奖励诱导”);
-
URL Agent:利用大模型的上下文推理能力,对嵌入链接的域名、URL 结构及其描述文字是否相符进行判断;
-
Metadata Agent:分析邮件头部信息(发件人域名、时间、签名异常等)并结合上下文推理潜在伪造行为。
三个代理处理了主要内容,但对附件,二维码等的处理是缺失的。
-
各代理输出 Verdict(判定结果)、Confidence Score(置信度) 及 Rationale(理由)。
-
PPO集成权重优化器(PPO Optimizer)
不同代理的结果可能存在差异,因此引入基于 PPO (Proximal Policy Optimization) 的权重优化器。
该优化器在训练-测试循环中自动调整各智能体在最终判决中的权重,使整体性能最优。 这一步体现了“大模型 + 强化学习 ”的思路:模型不仅生成结果,还通过策略优化学习如何更好地整合多源信息。 -
解释与输出生成
为提高可解释性,系统设置 Explanation Simplifier Agent,利用语言模型将多个代理的冗长推理过程总结为自然语言形式的“简化解释(Simplified Rationale)”,帮助安全分析人员理解模型判定依据。 最终输出包括: -
Final Verdict(最终判定):钓鱼 / 非钓鱼;
-
Simplified Rationale(解释摘要):简明说明理由。
1.3 检测效果分析
两篇论文都给出了基于开源数据的效果分析,第一篇:
注:LLama2的模型为70B
从上表中可以看出,Llama2的误报率非常高,超过20%了,Gemini也非常高。
第二篇的准确率如下表,其中也包括第一篇的方式,单Agent的误报率确实非常高。
实际应用中,误报率还会更高,因为现实的数据远比开源数据复杂。
我有一份针对高对抗样本的测试数据,显示各模型误报都非常高,这样的误报率是无法商用的。
| | | | |
| — | — | — | — |
| 模型\指标 | 基础样本检出率 | 高对抗样本检出率 | 误报率 |
| Deepseek-R1 | 98.02% | 88.34% | 33.26% |
| CHATGPT-40 | 95.23% | 90.22% | 17.75% |
| LLAMA-8B | 26.70% | 20.05% | 0.40% |
另外,在实际应用中,上述大型模型的成本非常高,很难商业应用。
嗯,论文可以用来研究学习原理,但要直接商用,还是不太现实。
02
国外的商业公司进展
相对于论文,商业公司的技术方案一般不太公开,但我们仍然可以在互联网上找到一些蛛丝马迹。
2.1 微软的方案
微软在LLM应用比较多,已经在Security Copilot中充分表现,其反垃圾邮件能力集成于XDR中。
流程如上图,可分为以下关键阶段:
邮件输入 / 客户域接收
邮件流入客户的邮件系统(Customer domain)。每封邮件(无论正常还是可疑)进入邮件保护管道。 在这个阶段,系统可能已对发件人、域名、IP、邮件头、附件类型等做常规检查(例如 SPF、DKIM、DMARC、防 spoofing 、黑信誉列表、链接重写等)。
威胁检测层(Threat Detection)
在常规安全层面,系统应用机器学习模型、威胁情报、反病毒引擎、域名/信誉库(P2BCL)、垃圾邮件/伪装检测 (spoof, impersonation) 等。 这一层负责识别“传统”钓鱼或垃圾邮件特征:例如已知恶意链接、附件、黑域名、IP 异常、同一发送者大量邮件等。
语言理解/大模型层(LLM / SLM + 意图分析)
当邮件通过前两层仍难以判断时,或为更高级攻击时,进入“意图分析(Intent analysis)”阶段。
- 这一层关键在于语言语义、上下文、社工特质、邮件目的和情境的推理:例如 “这封邮件是不是在试图做 CEO 冒充?”,“请求是否不合常规流程?”,“语气是否有急迫性或奖励诱导?”,等等。
- Microsoft Defender for Office 365 现在大规模使用专用的大型语言模型 (LLM),提供 AI 驱动的电子邮件和协作安全保障。我们的解决方案现在可以解析语言,理解并识别攻击者的意图,并以机器速度对威胁进行分类,从而将恶意电子邮件拒之门外,并为安全运营中心 (SOC) 团队提供对攻击者技术的全新洞察。
威胁分类(Threat Classification)
在理解了意图之后,系统将邮件归入具体的威胁类别:如 “工资欺诈 (Payroll Fraud)”、“礼品卡骗局 (Gift Card Scam)”、“公司数据窃取 (Corporate Data Theft)”、“任务操控 (Task Manipulation)” 等。 这个分类使得安全分析团队能更好地优先响应、制定策略,并做后续的根因分析或追踪。
输出过滤/响应
最后,根据以上分析结果,邮件被过滤/隔离/阻断或交付给最终用户,同时安全系统生成可供 SOC (安全运营中心)使用的情报报告。
- 在 Defender 平台中,意图分析 + 分类信息将被整合进 “高级搜寻 (Advanced Hunting)”、“事件经验 (Incident Experience)” 中,帮助分析人员基于类型快速检索和响应。
- 此外,通过 Security Copilot 的 “Phishing Triage Agent” 自动化对用户举报邮件进行分类,减轻人工工作量。
注意,在语言理解层上,其标识是LLM/SLM,表示它在使用小模型,我认为更多是出于性能和成本的考虑。他没有透露SLM的信息,但可以查到的是,微软的Phi-3系列模型主要是三个规格,是4B,7B,14B,那就是4B或7B概率大一些,毕竟14B再叫SLM不合适了。
材料中还提到,这是专门为反钓鱼训练的模型(purpose-built)
实际效果,微软认为非常好,攻击者意图检测和过滤准确率高达 99.995%,也支持BEC的检测。
2.2 Proofpoint的方案
Proofpoint是Gartner 2024年Email安全平台里领先的厂商,其反钓鱼方案已经在充分使用AI的能力。
Proofpoint的邮件检测用到了语义检测和行为检测两个AI引擎。
Proofpoint 的语义分析,作为额外的威胁检测层,重点包括:
- 意图理解。我们的 LLM 引擎能够理解传入邮件的意图,这对于阻止身份冒用威胁至关重要。在本案例中(下图),LLM 引擎识别出了攻击者邮件中的紧迫感和财务相关用语。
- 语境理解。语义分析能够理解词语、短语和组合的语境用法,例如紧迫感和怀疑的语气。因此,它可以解读信息并把握给定信息的完整含义。
- 语言无关。无论使用什么词语或使用何种语言撰写冒充电子邮件,我们的语义分析都无关紧要,并且支持超过 100 种语言。
其关键检测步骤:
1.LLM检测语义
语义分析的目标是从文本数据中提取其潜在含义和意图。您可以使用多种方法和技术来实现这一目标。我们选择使用LLM文本嵌入进行分析。
我们根据威胁分析师定义的分类法对模型进行微调,以检测语义。这种方法使我们能够捕捉语义相似性,从而更好地理解电子邮件中使用的词语的含义。
Proofpoint 采用基于 LLM 的语义分析方法,利用学习到的强大表示,更好地理解和分析电子邮件中的文本含义。该方法能够捕捉复杂的语义关系和上下文细微差别,且不受文本变体和语言差异的影响,从而在文本分类和情感分析方面表现出色。
我们来看一下下面这条可疑信息中的关键意图指标。这条信息旨在营造紧迫感,并提到要更改支付路由信息。根据这些信息,基本可以判断问题。
2.AI补充检测
Proofpoint 使用我们的行为AI检测引擎(图中行为人工智能)来识别关键消息属性中的信号和异常情况,包括:
- 发件人
- 接收者
- 标题
- 信息特征
- 图片
- URL链接
- 附件
- 还有更多……
通过这种方法,每月可以检测并拦截数千万封高级电子邮件威胁。这包括商业电子邮件入侵 (BEC) 诈骗、电话定向攻击 (TOAD) 以及多因素身份验证 (MFA) 绕过攻击,覆盖我们超过 50 万的客户。
看上去,这个AI补充检测更象个机器学习的模型。
更多信息
在参考链接6中,Proofpoint的首席人工智能和数据官提到:
每天扫描 35 亿封电子邮件,占全球总量的三分之一。此外,他们每天还扫描近 500 亿个 URL 和 30 亿个附件。
必要的速度是通过训练专门用于检测的小型人工智能模型来实现的,这些模型基于示例和大型语言模型 (LLM) 的基础知识。例如,OpenAI 的GPT-5 估计拥有多达6350 亿个参数。对每封电子邮件都用如此庞大的模型处理是不切实际的。Proofpoint 已将其模型精简至约 3 亿个参数。它提炼并压缩模型,从而在不牺牲检测精度的前提下实现低延迟、在线性能。此外,它每 2.5 天更新一次这些模型,以便能够有效地解读邮件本身的意图,而不仅仅是扫描指标。
看上去,Proofpoint的模型确实很小,0.3B,但每2.5天更新一次,也不容易。
另外,0.3B有没有可能是个BERT的模型呢?至少看上去很象。
03
国内厂商
国内厂商最值得研究得还是深信服。在2024年网信办举办的人工智能赋能安全应用竞赛的钓鱼邮件检测中,深信服拿的是第一名(今年没有该单项比赛)。
跟国外厂商一样,深信服公开的技术资料也不多,但国内厂商还是好沟通一些,有些未公开但不保密的信息,还是可以问到一些。
3.1 技术方案
深信服的Agent方案非常完整,重点体现在两个方面,工具调用和任务规划。在对邮件内容进行拆解后,调用工具逐一验证。这对深层钓鱼非常有效。有很多邮件,仅通过邮件本身比较难识别,比如,它告诉你在某个地方的资料跟你有关,而资料在邮件里只是个链接,那么需要去下载分析。
在上述方案的基础上,有多种研判方案,覆盖了主要的威胁领域。其中的意图识别特别重要,他们能够进行多种意图分析,包括正文语义意图,URL跳转意图,HTML语义意图,附件行为意图等。
上面是智能体的框架图,在上图里,还有个向量数据库,用于降低误报:
①用户在钓鱼检测大模型上对邮件告警进行误报标注,标注的误报内容(包含攻击方向、数据包等信息)经分词器(Tonkenizer)处理后分割成诸多Token
②这些Token经过大模型嵌入层(Embedding)处理转换为蕴含语义信息的词嵌入向量
③将这些词嵌入向量存储在大模型的向量数据库中
④对于后续待研判邮件,大模型先在向量数据库中进行相似度检索,匹配邮件不再告警,不匹配的邮件才会进行进一步地研判与生成结果
简单地说,如果有个邮件被标注为误判了,就提取其特征,后续在跟这个特征相似度达到一定范围时,就判定为白。这个设计很好,因为每个公司的邮件各有特点,针对客户的具体信息建立合理的数据库,对降低误报可以有较好的效果。
3.2 模型情况
深信服一直强调自己的模型能力,有个专门的钓鱼GPT,用于邮件检测。关于模型的一些数据:
实际模型约8B,这个8B是多模态模型,且是个推理模型,意图分析能力较强,也可以分析图片。
现在很多钓鱼邮件采用二维码的方式,这种情况须识别二维码并进一步浏览或下载分析,需要比较强的综合分析能力。二维码分析,深信服用的是OCR,巧的是,Proofpoint用的也是OCR,二者基本一致。这个不是多模态能力。
但还有一些钓鱼邮件,正文以图片为主,或者使用仿冒的Logo之类的信息,这个就要使用多模态模型来分析。
在通过多模态智能体工具打开页面后,系统可结合视觉特征、身份信息及域名上下文等维度进行深入分析,从而自动执行以下任务:
- 识别网页图标(如官方Logo)是否涉及仿冒行为,或违规使用政府徽章;
- 调用浏览器工具实现网盘文件的自动下载,并进一步借助情报沙箱对文件载荷进行提取与分析;
- 应对安全对抗场景,如在遇到人机验证机制时,由云端智能体自动识别验证码并调用浏览器工具完成验证,最终跳转至目标页面以执行进一步分析。
3.3 部署方式及性能
对客户来说,邮件的防护不仅是反钓鱼,垃圾邮件的检测也非常重要。深信服并没有这个功能,只检测钓鱼邮件。
所以,他们采用与邮件网关配合的方法部署,也支持直接连接邮件服务器部署,大模型可以使用本地硬件,也可以使用远程MaaS服务。
使用硬件部署的场景,单服务器两块4090,每天处理邮件能力超过10万封,能够应对绝大部分企业的需求。
在检测率上,用户侧平均检出精准率达95.4%,误报率降到了0.046%,这个数据非常理想。
04
深信服的模型成本
我没做过模型训练,相信很多人跟我一样,也没做过模型训练,但我对训练需要的资源数据一直比较好奇,需要什么样的数据,多少数据,需要多少卡,训练多长时间,这次跟深信服交流,他们给我了一些数据,可供各位参考。
一个模型的训练,大体需要数据、卡资源,人才资源三个部分。
4.1 训练数据
整体训练数据分成两部分,预训练数据和微调数据。预训练数据通用语料大于1000G,安全语料大于200G,安全语料包括攻击代码/病毒/url/页面/邮件语料等。微调语料标签数据约5000万,其中安全领域QA对约500万。这些都用于基础模型的训练,深信服在一个基础模型上,微调出多个垂域模型:
在此基础上,钓鱼检测还有专门的数据集,实战场景积累数据用于优化效果:50万+高质量邮件数据,1万+钓鱼话术、100万+钓鱼原始载荷,有个标签邮件的样本大约是这个样子,Input是一个邮件,Output是对邮件的分析和处理方法,非常完整(彩色框和文字是注解,不算语料):
数据的积累和处理是下面的过程,处理过程也消耗巨大:
4.2 训练消耗
训练消耗主要是卡的数据和时间,以下是8B模型每次训练的各阶段消耗情况
| | |
| — | — |
| 底座预训练 | H100*50卡*30day |
| 一阶段微调 | H100*8卡*2day |
| 二阶段微调 | H100*8卡*2day |
| 思维链技术 | H100*8卡*2day |
看上去,训练的成本不是太高,就这块而言,很多公司可以负担。
4.3 人才需求
有了数据,有了卡,是不是就可以训练了,实际训练过程非常复杂,并且训练过程的调整也涉及数据的调整,这是个慢工出细活的过程,对团队要求非常高。
深信服差不多投入了60位既懂安全又懂AI的技术人员,历时一年左右的时间才实现钓鱼检测大模型的效果,持续迭代仍然是需要人力的。
数据、算力、人才,这三个门槛都很高,跨过去比较难。但只有跨过去,后续在模型竞争中,才能走下去的希望。
05
总结
1.作为安全检测里一个非常重要的门类,反钓鱼邮件在全面快速向大模型检测发展。有很多论文,做了很好的尝试,也讲清楚原理及实现方法。从目前的情况看,邮件多智能体检测,外围的邮件分拆,各家都差不了太多,竞争的关键点将是模型能力,不仅是模型的准确率,性能和成本也非常重要。
- 我们刚刚分析过提示词注入对AI渗透测试工具的攻击别光想着用AI工具做黑客,当心自己被反黑,能够成功并且有多种方法,这种攻击也开始针对反钓鱼邮件的系统了。
理论上防护不难,AI护栏可以比较好的解决这个问题,但考虑到性能和成本,AI护栏的成本甚至会高于反钓鱼系统本身的成本。所以,这个防护,是直接硬加一个AI护栏,还是反钓鱼系统自己增加防护,看看各家会如何选择,咱们拭目以待。
- 攻防仍在持续发展,大模型在继续优化钓鱼邮件的生成能力,针对大模型反钓鱼系统的攻击也会迅速发展。进化才刚刚开始,这个领域值得持续跟踪。
参考链接
1.人工智能钓鱼攻击迎来“天网时刻”,其智能代理的表现超越了人类红队
https://siliconangle.com/2025/04/03/ai-phishing-hits-skynet-moment-agents-outperform-human-red-teams/
2.ChatSpamDetector:利用大型语言模型有效检测钓鱼邮件
https://arxiv.org/html/2402.18093v2
3.MultiPhishGuard:一种基于LLM的多代理钓鱼邮件检测系统
https://arxiv.org/html/2505.23803v1
4.微软 Ignite 大会:利用 LLM 重新定义电子邮件安全,应对新时代的社会工程攻击
https://techcommunity.microsoft.com/blog/microsoftdefenderforoffice365blog/microsoft-ignite-redefining-email-security-with-llms-to-tackle-a-new-era-of-soci/4302421
5.GenAI正在推动最新一轮现代电子邮件威胁的激增
https://www.proofpoint.com/us/blog/email-and-cloud-threats/genai-powering-latest-surge-modern-email-threats
6.您的AI代理现在已成为电子邮件网络钓鱼的目标
https://spectrum.ieee.org/ai-agent-phishing
7.检测多层恶意二维码攻击
https://www.proofpoint.com/us/blog/email-and-cloud-threats/malicious-qr-code-attack
8.钓鱼邮件杀疯了 AI有何新解法
https://www.sangfor.com.cn/video/5f07a17f95354c44b3711c778511641d
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:AI与安全 孙志敏《AI反钓鱼,国内外最新进展及模型分析》