文章总结: 大语言模型存在幻象问题,表现为违背事实、前后不一致或编造信息。幻象类型包括违背已有事实、前后说法不一致和编造事实。幻象原因包括数据收集方法、曝光偏差、参数化知识偏差等。评估方法有HaluEval评测基准和HaluEval2.0。缓解策略包括基于人类反馈的强化学习、检索增强、提示改进、自我反思等综合方法,在预训练、指令微调和推理阶段采取相应措施。
综合评分: 87
文章分类: AI安全,安全建设,解决方案,技术标准,漏洞分析
大语言模型中的事实性幻象
原创
AISAIL
安全进化论
2025年9月11日 11:00
广东
概述
大语言模型在生成内容时存在“幻象”问题,表现为违背事实、前后不一致或编造信息。本文探讨其成因、评估方法及缓解策略。
背景与问题定义
大模型的局限性
ChatGPT等大模型在知识时效性(Knowledge Recency)、推理一致性(Reasoning Inconsistency)、数值计算能力(Numerical Computation)和事实性(Hallucination)方面存在问题。例如,模型可能生成“两磅的羽毛和一磅的石头一样重”这种逻辑错误的回答。
幻象的影响
幻象文本不仅影响输出的真实性和准确性,还可能被扩散为互联网语料,干扰后续训练。OpenAI的研究指出,这类问题在GPT-4中依然存在。
大模型幻象的具体表现
违背已有事实
模型可能生成与已知事实相悖的内容。例如,在回答“社会认知理论书籍列表”时,可能会列出不存在的作者或错误的作品。
前后说法不一致
在同一对话中,模型可能对相同问题给出矛盾的回答。
编造事实
模型可能生成完全虚构的信息,例如错误的历史事件或不存在的科学发现。
幻象类型分类
传统自然语言生成任务中的幻象
- Intrinsic Hallucinations: 生成内容与输入源矛盾。例如,在摘要任务中,摘要内容与文档不符。
- Extrinsic Hallucinations: 生成内容无法被输入源验证,但可能是真实的。例如,摘要中包含文档未提及但可能正确的信息。
GPT-4的幻象分类
- Open-domain hallucinations: 不依赖特定参考资源,常见于ChatGPT用户的开放性查询。
- Closed-domain hallucinations: 依赖特定参考资源,如摘要任务。
幻象出现的可能原因
数据集合原因
- 启发式数据收集方法可能导致输入与输出不对应。例如,WIKIBIO将Wikipedia第一句话作为描述infobox的文本,但研究发现62%的句子包含infobox中没有的信息。
- 开放式任务(如对话)的目标文本可能包含用于增加多样性的额外信息,导致幻象不可避免。
模型原因
- 曝光偏差(Exposure Bias): 训练基于真实数据,而测试基于模型生成的文本,可能导致误差累积。
- 参数化知识偏差(Parametric Knowledge Bias): 模型更倾向于使用训练时存储的知识,而非输入内容。
- 不充分的表示学习: 编码器的语义理解能力不足会导致生成错误。
- 不恰当的解码方式: 如top-k采样,虽然增加了多样性,但也提高了幻象概率。
大模型时代的幻象特点
- 训练数据: 数据规模更大、领域更广。
- 训练方式: 预训练-指令微调-人类对齐。
- 推理方式: 提示、上下文学习、思维链等。
-
幻象原因:
-
基于语句补全模式,受限于最大似然优化,难以表达知识的不确定性。
-
概率生成的本质导致模糊或不确定的事实容易出错。
-
监督微调(SFT)阶段可能导致模型内部知识与标注数据不对齐。
幻象评估方法
HaluEval评测基准
- 包含35000条幻象样本,涵盖问答、对话、摘要和日常查询任务。
- 自动生成每条样本包含正例和负例,人工标注幻象片段。
- 数据分布:问答(10000条)、对话(10000条)、摘要(10000条)、日常查询(5000条)。
- 结果显示,ChatGPT回复中有977条包含幻象(占比19.54%)。
HaluEval 2.0
- 综合评测基准,包含医学、金融、科学、教育和开放域五个领域的8770个事实问题。
- 基于GPT-4的幻象检测框架,事实抽取与判断匹配率超过90%。
- 评估指标包括宏观幻象率(MaHR)和微观幻象率(MiHR),指标越小越好。
幻象发生的原因分析
-
预训练阶段:
-
数据规模越大,知识频率越高,越容易出现幻象。
-
领域混合的数据来源可能导致幻象率上升。
-
指令微调阶段:
-
日常对话型指令幻象率较低,但过于复杂的指令容易产生幻象。
-
指令数据增强需注意复杂化、多样化和难度平衡。
- 提示设计:
提示的可读性、规范性和具体程度会影响幻象发生。
- 解码策略:
引入随机性可能导致幻象,尤其在领域敏感的任务中。
幻象缓解的方法
- 微调对齐阶段:
基于人类反馈的强化学习(RLHF)显著降低开放域幻象。
-
推理阶段:
-
检索增强: 较小模型的效果更显著。
-
提示改进: 尚无一致有效的提示方法。
-
自我反思: 只有70B参数量的模型具备有效反思能力。
-
综合缓解策略:
-
预训练阶段:数据清洗、增加领域数据。
-
指令微调阶段:检查指令与模型知识的一致性、混合多种指令数据、强化学习训练。
-
推理阶段:检索增强、平衡解码的事实性与多样性、采用自我反思和思维链等提示方法。
本文提供完整版45页文件下载,请查看文后提示。
FreeBuf 帮会简介
「智盾矩阵·大模型安全智库」帮会是FreeBuf知识大陆的重量级帮会,目前已入选FreeBuf钻石星选帮会——官方认证高信誉与高质量,帮会聚焦人工智能与大模型安全领域,致力于打造全球视野下的专业资源聚合平台。截止目前帮会已累计更新2200+文档资源,为从业者提供从理论到实践的全维度知识支持。
1、内容框架(持续更新中)
2、内容涵盖
①系统梳理国内外人工智能安全政策法规、行业技术标准、伦理治理框架
②深度整合大模型安全领域的前沿研究报告、技术白皮书、前沿技术论文、行业峰会资料、典型场景解决方案及实务操作指南等
③覆盖伦理与合规安全、模型安全、内容安全、数据隐私、算法合规、AI应用与集成安全、基础设施安全、对抗攻击防御、可解释性研究等多个细分方向
3、加入永久帮会的专属权益
①定期抽奖赠送安全类书籍
②1次职业规划指导
③1次简历修改机会
④安全岗位内推机会
⑤无限制浏览下载帮会资源
⑥享受一对一专属找资料服务,有问必答,供资料参考(日限3份)
⑦历史发布资料,百度网盘一次性打包发送
⑧群内已分享资料,每月底网盘打包分享至会员,避免群内文件过期,方便会员查阅(周更)
4、帮会网盘
帮会优质资源稳定更新,目前日更10+,年更至少1000+,截止目前帮会已累计更新2200+文档资源,网盘文件多维度分类,方便查找
5、如何加入
现在帮会权益升级,原年卡会员139元,现永久会员149元,年卡会员99元,(随着资源增加、成员增多,后续永久会员价格将逐步上调),有意向的师傅们可以扫码加入我们,共同进步。
*加入方式:网页端和APP端*
网页端:
https://wiki.freebuf.com/societyDetail?society_id=344
APP端:
公众号已发表帮会资源展示:
①政策、标准
网络安全标准实践指南——人工智能生成合成内容标识方法 文件 元数据隐式标识 文本文件
网络安全标准实践指南——人工智能生成合成内容标识方法 文件 元数据隐式标识 图片文件
网络安全标准实践指南——人工智能生成合成内容标识方法 文件 元数据隐式标识 音频文件
网络安全标准实践指南——人工智能生成合成内容标识方法 文件 元数据隐式标识 视频文件
网络安全标准实践指南——人工智能生成合成内容标识方法 文件 元数据隐式标识 安全防护技术指南
关于通用人工智能模型提供者义务范围澄清指南的制定开展针对性咨询
工业和信息化领域人工智能安全治理标准体系建设指南(2025版)
②行业解决方案
③行业技术报告
④行业技术白皮书
⑤行业技术论文
⑥实务手册指南
⑦行业大会分享PPT
MCP协议标准化研究工作沙龙—— 大模型与智能应用的信息交互主题精彩回顾
通义灵码AI程序员解密:AI Agent在软件研发领域的落地实践
AI重构全球数字基建:美的多云统一数字化底座与出海的安全合规建设
智体赋能:基于大模型Agent的自动化渗透测试框架设计与实践
免责声明:以上报告均系通过公开、合法渠道获得,版权归原撰写/发布机构所有,如涉侵权, 请联系及时删除;内容为推荐阅读仅供参考学习,如对内容存疑请与原撰写/发布机构联系。
戳底部“阅读原文”或进入公众号聊天页获取交流群二维码扫码加入获取文档,打广告者勿扰。
点分享
点收藏
点在看
点点赞
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全进化论 AISAIL《大语言模型中的事实性幻象》