文章总结: 本系列深入探讨社交媒体与AI对人类认知的影响。研究发现社交媒体可致注意力碎片化及神经结构改变,但也具心理干预潜力。AI在认知评估中表现优异却易受认知偏差操纵。建议通过数字素养教育、算法伦理设计及政策监管协同作用,平衡技术利弊以维护认知主权。
综合评分: 88
文章分类: AI安全,社会工程学,威胁情报,政策法规,安全意识
【资料】社交媒体和AI对人类认知的影响系列文章
原创
丁爸
丁爸 情报分析师的工具箱
2026年1月2日 22:29
四川
今天的《社交媒体和AI对人类认知的影响》系列文献按主题分为六大模块:
一、社交媒体对认知功能的负面影响
1. 注意力碎片化(《社交媒体对人类大脑认知能力的影响》)
2. 记忆偏差与情绪失调(同上)
3. 决策能力受损(《阿拉伯联合酋长国成年人智能手机过度使用与认知障碍之间的关联》)
二、数字技术对特定人群的影响
1. 老年人认知保护(《探索互联网使用对老年人认知能力的影响》)
2. 青少年认知风险(《抖音时代的注意力:短视频消费对认知的影响》)
三、AI技术的认知应用与风险
1. LLM在心理健康中的应用(《社交媒体对人类大脑认知能力的影响》)
2. 认知偏差操纵LLM推荐(《警惕偏见:认知偏差对基于LLM的商品推荐的影响》)
四、文化与社会认知传播
1. 表情包作为文化病毒(《思想病毒:孟加拉国Z世代的社交媒体表情包》)
2. 认知战与能源转型(《认知战、虚假信息和企业对欧洲能源转型的影响》)
五、理论创新:后数字时代的认知主权
1. 智能代理主义(《智能代理主义:后数字时代的人工智能、学习与认知主权》)
2. 机器心理学(《从人类视角看人工智能:探究机器心理学中的认知理论》)
六、平衡路径与未来方向
1. 个体干预(《社交媒体对认知功能和大脑健康的影响》)
2. 政策与技术(同上)
核心结论:社交媒体与AI对认知的影响呈现“双刃剑”特征:
- 风险面:注意力碎片化、记忆衰退、情绪失调及神经结构改变(如前额叶灰质减少)。
- 机遇面:LLM提升心理健康诊断精度,互联网使用延缓老年认知衰退。
- 平衡路径:需个体自律(数字排毒)、平台伦理设计(算法透明)、教育干预(数字素养)与政策监管(数据隐私法)协同作用。
1.《社交媒体对人类大脑认知能力的影响》
该文档是一篇2025年发表的学术综述,系统分析了社交媒体对人类认知能力的双重影响(既包括损害也涵盖应用潜力),并重点探讨了大型语言模型(LLM)在认知健康研究中的应用。以下是核心内容总结:
一、核心认知影响
- 注意力缺陷
- 碎片化信息导致持续性注意力下降,34%的ADHD患者因夜间使用社交媒体出现睡眠障碍,加剧专注力问题。
- Twitter的标签文化引发62%的ADHD用户参与碎片化讨论,Reddit用户的离题率比常人高2.5倍。
- 记忆偏差与情绪失调
- 抑郁患者78%的社交帖文使用绝对化词汇(如“总是”“从不”),与工作记忆缺陷相关。
- 焦虑用户第一人称代词(“我”“我的”)使用率高40%,反映反刍思维模式。
- 情绪波动显著:89%的应激反应通过情感突变检测,92%的自杀风险用户存在灾难化认知扭曲。
- 决策能力受损
- 重度抑郁患者使用冲动性语言(如“我受够了”)的频率是轻中度患者的3倍。
- 经济压力相关的短视高风险决策(如“我刚辞职”)在社交媒体中高频出现。
二、LLM技术的应用与挑战
-
模型效能
表格
| 模型 | 任务(数据集) | 准确率 | F1值 | 核心能力 |
| — | — | — | — | — |
| GPT-4 | 抑郁分级(DepSeverity) | 91% | 0.89 | 识别轻→重抑郁的细微梯度 |
| Mental-FLAN-T5 | 自杀风险(SDCNL) | 88% | 0.85 | 低资源场景性能超GPT-4 |
| Mental-Alpaca | 认知扭曲(Reddit-Cog) | 84% | 0.81 | 76%焦虑帖文检测灾难化思维 | -
跨平台差异
- Reddit模型在Twitter数据上F1值下降15%,因语言习惯差异显著。
- 葡萄牙语数据集性能比英语低20%,凸显多语言模型优化需求。
- 伦理风险
- 训练数据偏见:女性抑郁预测过拟合(因Red-Sam数据集中性别偏差达12%)。
- 隐私隐患:22%的推文元数据可复原用户身份。
三、社交媒体的双重角色
- 积极价值
- 支持社群降低30%情绪波动,68%未诊断的高风险用户(如CSSRS-Suicide数据集)通过早期干预获益。
- LLM结合MentalBERT等工具,从匿名帖文中提取抑郁、焦虑及自杀倾向的语言标记。
- 负面效应
- 每日超4小时使用导致注意力碎片化率翻倍。
- 55%的抑郁用户陷入算法强化的“信息茧房”,加剧认知僵化。
四、未来研究方向
- 纵向研究:追踪社交媒体对决策能力、情绪调节的长期影响。
- 伦理框架:建立LLM心理健康应用的透明性与公平性准则(如SHAP工具解释预测逻辑)。
- 多语言扩展:突破英语主导局限,覆盖全球认知趋势。
- 跨学科协作:整合心理学与计算语言学,开发认知风险干预方案。
结论:社交媒体既是认知功能的“压力源”(注意力分散、记忆扭曲),也是心理健康干预的“工具箱”。需通过LLM技术创新与伦理约束平衡其双面性,未来需聚焦长期效应与跨文化验证。
2.《探索互联网使用对老年人认知能力的影响》
一、总体概述
该研究基于中国健康与养老追踪调查(CHARLS 2020) 数据库,分析了7,142名中国60岁以上老年人的互联网使用行为与认知能力的关系。研究发现:
- 互联网使用与认知能力呈显著正相关(相关系数0.317***);
- 仅32.11%的老年人使用互联网,数字鸿沟问题突出;
- 互联网使用可提升认知储备,减缓认知衰退,尤其对城市、高教育水平群体效果更显著。
二、研究背景与挑战
全球老龄化危机
- 2015年中国老年痴呆患者达1,500万,2050年全球老年人口将达4.79亿(数据来源:CHARLS 2020)。
- 认知衰退是阿尔茨海默病的前兆,但现有治疗手段有限,需通过生活方式干预预防。
数字排斥风险
- 中国60岁以上非网民占39.8%(2023年统计),其中仅16.44% 会使用微信朋友圈,15.65% 掌握移动支付。
- 低教育水平(平均受教育年限仅4.2年)是老年人数字排斥的主因。
三、研究方法
数据来源
-
样本量:7,142人(男性3,991人,女性3,151人),覆盖全国28省450个村庄。
-
变量设计:
-
自变量:互联网使用能力(0-4分,涵盖上网、微信、移动支付、朋友圈功能)。
-
因变量:认知能力(0-21分,通过记忆力、定向力、注意力、视空间能力测试)。
-
控制变量:年龄、性别、教育程度、婚姻状况、城乡居住地。
统计方法
采用分层回归分析与多重线性回归,控制混杂因素后验证互联网对认知的影响。
四、核心研究发现
互联网使用提升认知能力
- 正向关联:互联网使用者认知得分比非使用者高1.041分(见表4),且使用深度越高认知收益越大(如移动支付使用者得分+0.502)。
- 机制解释:互联网通过促进社交互动、信息获取与脑力刺激,增强认知储备(Cognitive Reserve理论)。
人口特征调节效应
| 影响因素 | 认知能力关联性 |
| — | — |
| 教育水平 | 每提升一级,认知得分+1.020*** |
| 城乡差异 | 城市居民得分比农村高0.687*** |
| 婚姻状态 | 已婚者得分比未婚者高0.527*** |
| 年龄 | 每增长10岁,认知得分-0.291*** |
数字鸿沟加剧认知不平等
- 城市 vs 农村:城市老年人互联网使用率(44.68%)显著高于农村(56.32%)。
- 教育分层:高等教育群体(15.40%)的认知得分是文盲群体(37.57%)的2.7倍。
五、政策建议
促进数字包容
- 社区赋能:通过志愿者活动培训老年人使用微信、移动支付等工具。
- 公共服务适老化:优化政务平台界面,降低技术使用门槛。
- 资源倾斜:重点支持农村、低教育群体的数字技能培训。
认知健康干预
- 鼓励适度互联网使用(如每日1-2小时),避免过度使用导致社交孤立。
- 结合认知训练APP与社交功能(如视频通话),强化脑力刺激。
六、结论
该研究首次基于全国代表性样本证实:互联网是老年人认知健康的保护性因素。推动数字包容不仅可缩小技术差距,更能通过增强认知储备延缓老年痴呆进程,为应对老龄化社会提供低成本干预路径。
3.《思想病毒:孟加拉国Z世代的社交媒体表情包、文化传播和认知传播》
以下是对文档《思想病毒:孟加拉国Z世代的社交媒体表情包、文化传播和认知传播》的详细总结,采用总分总结构,按章节核心内容分述:
概述
该研究探讨互联网表情包(Memes)作为“文化病毒”在孟加拉国Z世代中的传播机制及其对认知、身份认同和社会规范的影响。通过整合模因理论(Memetics)、复杂传染模型(Complex Contagion)和社会符号学(Socio-semiotics),研究提出 “Z世代模因传播模型”(GM-TM),揭示表情包如何通过情感共鸣、社交强化和算法放大塑造青年文化。研究采用混合方法(内容分析、访谈及网络扩散数据),强调表情包兼具社会凝聚力与风险传播的双重性,并提出针对性治理建议。
一、引言:表情包作为“思想病毒”
- 核心概念
- 表情包是融合图像、文本、音视频的模因载体,通过情感化、低门槛传播成为“文化病毒”。
- 在孟加拉国,Z世代(15-24岁)借助表情包本土化全球模板(如添加孟加拉语、政治讽刺),强化群体认同。
- 研究背景
- 孟加拉国青年占比高(60%人口<25岁),社交媒体渗透率达92%(Facebook为主),但相关研究多聚焦西方语境。
- 表情包在政治敏感期易引发谣言传播(如抗议事件中的讽刺内容),需结合本土语言与文化编码分析。
二、研究意义:多维创新贡献
- 实证价值
- 首次系统记录孟加拉国表情包生态,填补全球南方(Global South)研究空白。
- 理论整合
- 融合模因复制机制、网络传染模型(如桥接节点理论)及符号意义解读,提出 GM-TM模型(见图1)。
- 政策启示
- 建议开发基于表情包的数字素养课程(如识别情感操纵)及平台级干预措施(如高风险内容摩擦机制)。
- 方法论示范
- 结合定量扩散分析(如社区浓度指标)与定性符号解码,为跨文化研究提供模板。
三、文献综述:三大理论支柱
- 模因进化论
- 从道金斯(Dawkins, 1976)的基因类比到什夫曼(Shifman)的多模态文化形式,强调表情包的 可复制性、变异性和互文性。
- 传播网络模型
- 复杂传染理论:多数表情包需多次社交强化才扩散,早期跨社区传播(低社区浓度)预示病毒式爆发(Weng et al., 2013)。
- 符号权力与身份
- 表情包通过文化符号(如板球隐喻、方言)构建群体边界,同一模板在不同社群可传递团结或排斥意义。
四、理论框架:GM-TM模型
模型提出模因传播由五要素交互驱动:
| 要素 | 作用机制 |
| — | — |
| 模板生态(T) | 全球模板本土化(如孟加拉语字幕+宝莱坞引用)提升群体共鸣。 |
| 网络结构(N) | 桥接节点(如学生活动家)和算法跨群推荐加速扩散。 |
| 符号语境(S) | 文化代码(如宗教隐喻)决定内容解读方向(讽刺/冒犯)。 |
| 心理驱动(P) | 高唤醒情绪(幽默/愤怒)促进分享,但降低事实核查意愿。 |
| 平台功能(A) | 二重唱(Duet)等功能降低创作门槛,算法优先推送高参与内容。 |
五、研究方法:混合路径设计
- 数据采集
- 语料库:18个月内公开平台(Facebook、TikTok)的400个表情包,按主题(政治/日常)分层抽样。
- 访谈:30名Z世代(创作者/分享者/消费者),探究动机与认知影响。
- 分析技术
- 定量:网络中心性(Betweenness Centrality)识别关键传播节点。
- 定性:符号框架编码(如政治讽刺、身份强化),Cohen’s kappa检验信度。
六、核心发现
- 传播机制
- 情感优先:72%参与者因情绪共鸣(幽默/愤怒)分享表情包,情感激活度预测传播力(β=0.45)。
- 算法放大:推荐系统替代桥接节点,使内容“跳跃”社群壁垒。
- 认知影响
- 身份锚定:本土化内容(如方言梗)增强群体归属感,但加剧圈层极化(城市参与者政治表情包暴露率高34%)。
- 行为转化:68%受访者表示政治表情包强化线下行动意愿(如讨论政策)。
- 风险效应
- 高唤醒内容更易传播虚假信息(如谣言表情包),且反讽形式阻碍事实核查。
七、讨论:双重性与治理
- 表情包的辩证角色
- 积极面:提供压力宣泄(如学业梗)、低成本政治参与(讽刺执政者)。
- 风险面:加速污名化(如身体羞辱梗)和谣言级联(如抗议事件)。
- GM-TM验证
- 模型成功解释跨社群传播(H1)、本土化模板的群体内效应(H2)及情感与虚假关联(H3)。
八、结论与政策建议
- 核心结论
- 表情包是“文化病毒”,通过情感-身份-网络耦合机制重塑Z世代认知与社会规范。
-
六大政策方向
-
| 领域 | 措施示例 |
| — | — |
| 数字素养教育 | 学校课程纳入“模因批判阅读”(如识别断章取义图像)。 |
| 平台干预 | 危机期对未验证高情感内容添加分享摩擦(如提示“确认来源”)。 |
| 社区规范 | 大学制定表情包骚扰行为准则,结合修复性司法(Restorative Justice)。 |
| 事实核查创新 | 用相同模板创作辟谣表情包(如“真相版”政治讽刺)。 |
| 心理健康支持 | 青年项目纳入网络欺凌应对策略(如表情包身体羞辱)。 |
九、研究局限与未来方向
- 局限:私域传播(如WhatsApp)未覆盖;结论限于公开数据。
- 展望:纵向追踪模因演化,开发孟加拉语AI内容分析工具。
4.《抖音时代的注意力:短视频消费对认知的影响》
一、研究背景与核心问题
- 现象背景
- 2024年全球短视频平台(如TikTok、Instagram Reels)用户超1.67亿,快速剪辑和算法推荐导致媒体消费模式转向“即时满足”。
- 公众担忧:高频次的短视频刺激可能损害注意力持续性,但实证研究匮乏。
- 科学问题
- 短视频消费是否影响注意力的三个核心网络(警觉性、定向性、执行控制)?
- 长期使用是否与注意力表现相关?
二、研究方法与设计
- 实验设计
-
注意力网络任务(ANT):通过反应时差异量化三个注意力网络:
-
客观数据:通过手机系统记录过去10天TikTok实际使用时长(非自我报告)。
-
警觉网络(No Cue – Double Cue反应时差)
-
定向网络(Central Cue – Spatial Cue反应时差)
-
执行控制网络(Incongruent – Congruent反应时差)。
-
实验组(TikTok观看组,n=55):用个人手机浏览TikTok 10分钟。
-
控制组(拼图组,n=55):完成300片拼图10分钟。
-
被试:110名18-44岁TikTok活跃用户(平均年龄20.43岁),随机分为两组:
-
测量工具:
- 假设
- H1-H3:短视频组在三个注意力网络表现均差于拼图组。
- H4-H6:TikTok使用时长与注意力表现呈负相关。
三、核心研究结果
- 短期暴露无显著影响
- 实验组与控制组在警觉(t=0.210, p=0.834)、定向(t=0.318, p=0.751)、执行控制(t=0.524, p=0.601)网络得分均无差异(见图3-5)。
- 结论:10分钟短视频暴露未引发即时注意力损害。
- 长期使用与时注意表现无关
- 过去10天TikTok使用时长与警觉(r=0.060, p=0.559)、定向(r=0.032, p=0.759)、执行控制(r=0.013, p=0.899)得分均无相关性(见图6-8)。
- 探索性发现
-
自我感知使用量与实际时长正相关(r=0.497, p<0.001)。
-
使用年限越长,实际使用时间越长(r=0.321, p=0.002)。
-
年龄效应:年龄越大,TikTok使用时间越少(r=-0.217, p=0.040)。
-
使用习惯:
四、讨论与延伸
- 与既往研究的矛盾
-
实验时长不足(10分钟 vs. 成瘾者长期暴露)。
-
ANT任务敏感度有限,需结合持续注意力任务(如CVAT)。
-
既往研究(如Chen et al., 2023)发现“短视频成瘾者”注意力更差,但本研究未复现该结论。
-
可能解释:
- 方法学创新
- 首次使用个人设备模拟真实使用场景,提升生态效度。
- 采用客观屏幕时间数据,避免自我报告偏差。
- 理论意义
- 支持注意力恢复理论(ART):自然环境可恢复注意力,而短视频的“快速剪辑”未表现出即时损害,但长期影响仍需追踪。
五、局限性与未来方向
- 任务敏感性
- ANT可能无法捕捉短视频特有的“快速内容切换”对注意力的影响,建议未来采用动态任务(如多目标追踪)。
- 样本代表性
- 被试多为大学生,需扩展至青少年和中老年群体。
- 内容差异
- 未控制短视频内容类型(教育类 vs. 娱乐类),可能掩盖特定内容的影响。
- 纵向设计缺失
- 需通过长期追踪研究使用习惯与注意力发展的因果关系。
六、结论
- 核心结论:
10分钟短视频暴露未显著影响注意力网络表现,且近期使用时长与注意力无相关性。
- 实践启示:
- 公众无需过度担忧短视频的即时认知损害,但需关注长期、高强度使用的潜在风险(如成瘾行为)。
- 研究呼吁:
- 需结合神经影像(如EEG)与行为数据,探索短视频对大脑网络的深层影响(如Yan et al., 2024发现的前额叶θ波抑制)。
论文价值:该研究为首个采用实验设计探究短视频与注意力关系的硕士论文,其严谨方法(随机分组+客观数据)为后续研究提供重要范式。
5.《警惕偏见:认知偏差对基于大型语言模型的商品推荐的影响》
该文档是一篇研究论文,探讨了如何利用人类认知偏差(Cognitive Biases)作为对抗性策略(Adversarial Strategies)来操纵基于大型语言模型(LLMs)的商品推荐系统,并分析了其影响和防御的困难性。以下是详细总结:
一、研究背景与动机
- LLMs在推荐中的应用与风险:LLMs在产品推荐领域应用日益广泛(如搜索引擎、聊天机器人、电商平台),但它们容易受到对抗性操纵(Adversarial Manipulation),这对现实商业应用构成挑战。
- 认知偏差的引入:论文提出,人类认知偏差(如从众心理、稀缺性效应)可能被嵌入产品描述中,作为“黑盒”对抗性攻击手段,影响LLM的推荐结果。这与人类心理学原理相关,且难以检测。
- 现有研究的不足:以往研究或关注LLM本身存在的认知偏差,或探索其他类型的对抗攻击(如提示注入、数据篡改),但缺乏系统研究认知偏差作为攻击策略对LLM推荐的影响。
二、核心研究方法
- 攻击策略设计:研究选取了10种常见的营销认知偏差作为攻击手段:
- 社会认同 (Social Proof):强调产品受欢迎程度(如“超过1万人购买”)。
- 稀缺性 (Scarcity):强调产品数量有限(如“仅剩几件”)。
- 排他性 (Exclusivity):强调产品仅对特定群体可用(如“仅限会员”)。
- 身份信号 (Identity Signaling):强调产品与特定身份或价值观的关联(如“LGBTQ+友好”)。
- 故事效应 (Storytelling Effect):用叙事方式描述产品使用场景。
- 分母忽视 (Denominator Neglect):将总价分摊到每日小额(如“每天仅需X美元”)。
- 权威偏见 (Authority Bias):强调产品受专家或权威认可(如“专家推荐”)。
- 诱饵效应 (Decoy Effect):暗示同类产品性价比更低。
- 对比效应 (Contrast Effect):强调同类产品更贵。
- 折扣框架 (Discount Framing):以特定方式呈现折扣(如“原价高XX%,现折扣”)。
- 攻击实施方式:
- 专家攻击 (Expert Attacks):由营销专家为产品描述添加一句体现特定偏差的句子。
- 生成攻击 (Generated Attacks):使用Claude 3.5 Sonnet模型重写整个产品描述,将认知偏差更隐蔽地融入其中,并确保与其他产品描述长度和风格一致。
- 实验设置:
-
推荐率 (Rate):产品被推荐的频率。
-
推荐位置 (Pos):产品在推荐列表中的平均排名(数值越小越好)。
-
平均倒数排名 (MRR):综合考虑是否被推荐及其排名位置的指标。
-
数据集:使用合成数据集(虚构的咖啡机、相机、书籍各10件)和真实亚马逊产品数据集(笔记本电脑、宠物咀嚼玩具)。
-
LLM推荐器:测试了多种开源和闭源模型,包括LLaMA系列(8B, 70B, 405B参数)、Mistral 2 Large、Claude 3.5/3.7 Sonnet(带/不带思考模块)。
-
评估指标:
-
查询方式:使用宽泛查询(如“我正在寻找一台咖啡机。你能给我一些建议吗?”),让LLM自由决定推荐哪些产品及排序。
-
防御尝试:修改系统提示(System Prompt),要求LLM仅关注产品特性和用户查询,忽略其他因素,以评估其鲁棒性。
三、关键研究发现
- 认知偏差对推荐有显著影响:
- 正向影响:社会认同 (Social Proof) 一致地显著提高了产品的推荐率和排名位置(例如,在Claude 3.5上,推荐率提升高达+334%,位置提升+50%)。折扣框架 (Discount Framing) 也表现出积极效果。
- 负向影响:排他性 (Exclusivity) 和 稀缺性 (Scarcity) 意外地显著降低了产品的可见性(例如,排他性导致推荐率平均下降约-30%至-45%,位置恶化约-54%至-116%)。这与它们在影响人类消费者时的有效性形成鲜明对比。
- 混合/不一致影响:其他偏差(如诱饵效应、对比效应)的影响因模型、产品或攻击方式而异,缺乏一致性。
- 模型规模与能力的影响有限:
- 模型规模(如LLaMA的不同参数版本)与对认知偏差的易感性之间没有明确的相关性。
- 启用Claude 3.7的“思考模块”(Thinking Module)进行显式推理,并未显著提高其抵抗认知偏差的能力。偏差的影响依然存在。
- 认知偏差攻击难以防御:
- 研究尝试通过修改系统提示(要求LLM仅关注产品特性)进行防御,但效果甚微。攻击的影响在防御提示下依然显著存在(见表5)。
- 这表明认知偏差利用了LLM内部固有的、深层次的关联模式,难以通过简单的提示调整来消除。
- 专家攻击 vs. 生成攻击:
- 生成攻击通常比专家攻击产生更一致的结果。专家攻击可能更明显(如直接声明“这是最受欢迎的选择!”),效果波动更大。生成攻击更隐蔽(如使用“畅销产品”),效果更稳定。
- 现实世界数据验证:
- 在真实的亚马逊产品数据(笔记本电脑、宠物咀嚼玩具)上测试了社会认同和排他性偏差。
- 结果模式与合成数据集一致:社会认同提升可见性,排他性降低可见性。
- 但影响程度通常比在合成数据集上观察到的要弱。研究者认为,这是因为真实产品描述本身可能已包含多种认知偏差,且描述更长,稀释了单一注入偏差的影响。
- 有趣的观察:
- 折扣 vs. 降价:在描述中加入折扣框架偏差(平均折扣约26.25%),比直接将产品价格减半更能提高推荐率。
- 社会认同的价值:社会认同偏差可以补偿产品评分的下降(平均可抵消约0.27分的评分下降)。
四、结论与意义
- 主要结论:认知偏差可以作为一种隐蔽且有效的对抗性策略,操纵基于LLM的商品推荐系统。某些偏差(如社会认同)能显著提升产品可见性,而另一些(如排他性、稀缺性)则意外地降低可见性。这些影响在不同模型、产品和规模上表现出一定的鲁棒性,且难以防御。
- 研究意义:
- 揭示盲点:揭示了LLM推荐系统在商业应用中的一个关键盲点和潜在风险。
- 行为一致性:表明LLM在处理嵌入语言中的认知偏差时,其行为可能与人类决策模式有相似之处。
- 防御挑战:突显了开发有效防御措施来对抗此类微妙攻击的困难性。
- 实践意义:研究结果对依赖LLM进行产品推荐的平台和消费者都具有重要意义,提醒人们注意推荐结果可能受到产品描述中隐含偏见的操纵,影响推荐的公平性和可靠性。研究呼吁开发更鲁棒、可解释的推荐系统。
五、局限性与未来工作
- 查询类型:研究主要关注宽泛查询,特定或结构化用户意图的影响可能不同。
- 泛化性:结果可能因领域、语言(目前仅限英语)或产品池大小(研究使用10个产品)而异。
- 防御深度:研究的防御策略是初步的,更复杂的防御方法值得探索。
- 未来方向:研究建议探索更广泛的偏差、不同类型的查询、多语言环境以及开发更有效的防御机制。
这篇论文通过严谨的实验设计和广泛的评估,首次系统地研究了认知偏差作为对抗性攻击对LLM推荐的影响,为理解和提升LLM在商业推荐场景中的鲁棒性和公平性提供了重要洞见。
6.《阿拉伯联合酋长国成年人智能手机过度使用与认知障碍之间的关联:一项横断面研究》
该文档报告了一项在阿拉伯联合酋长国(UAE)进行的横断面研究,旨在探讨成年人智能手机过度使用与认知障碍之间的关联。研究于2022-2023学年进行,采用在线问卷调查方式,通过社交媒体平台(如WhatsApp、Instagram)便利抽样招募了401名年龄大于18岁的在阿联酋居住的成年人参与。研究使用了经过验证的量表进行评估:智能手机成瘾量表短版(SAS-SV)用于评估智能手机过度使用情况,并据此将参与者分为“成瘾者”、“高风险”和“低风险”三组;认知障碍则通过“评估痴呆症-8量表”(AD8)进行筛查,得分≥2分表明可能存在认知障碍。研究还收集了参与者的社会人口学信息、抑郁诊断情况以及智能手机使用相关的健康影响(如睡眠障碍、头痛、手指疼痛、视觉疲劳等)。
一、研究主要发现
1. 智能手机过度使用情况
- 普遍性高: 研究发现智能手机过度使用在阿联酋成年人中非常普遍。根据SAS-SV评分,75.3% 的参与者(302人)被归类为“智能手机成瘾者”,18.7%(75人)为“高风险”,仅6%(24人)为“低风险”。
- 使用时长: 67%的参与者(268人)每天使用智能手机超过4小时。
- 相关因素: 智能手机成瘾与国籍(阿联酋本地人成瘾率最高)和教育水平(学士学位持有者成瘾率最高)显著相关(p=0.015)。最常见的成瘾行为包括:使用时间超过预期、难以抑制使用冲动、频繁检查手机关注社交媒体互动。
2. 认知障碍情况
- 患病率高: 根据AD8量表,45.4% 的参与者(182人)被评估为“可能存在认知障碍”,平均得分为1.9。最常见的症状是“对爱好兴趣减少”和“日常思考/记忆问题”。
- 与年龄无关: 与传统认知不同,研究未发现年龄与认知障碍之间存在显著关联(p=0.677)。认知障碍在年轻参与者(18-24岁)中也很常见。
3. 智能手机过度使用与认知障碍的关联
- 显著关联: 研究的核心发现是智能手机过度使用与认知障碍之间存在统计学上显著的关联(p=0.002)。
- 风险差异: 在“成瘾者”组中,认知障碍的患病率最高(50.3%, 152人),显著高于“高风险”组(29.3%, 22人)和“低风险”组(33.3%, 8人)。统计分析(Mann-Whitney U检验)进一步证实,“成瘾者”与“高风险”组之间(p<0.001)、“成瘾者”与“低风险”组之间(p=0.045)均存在显著差异。
4. 其他健康影响
- 身体症状: 智能手机过度使用(成瘾程度越高)与多种身体症状显著相关,包括睡眠障碍(p<0.001)、头痛(p=0.007)、手指疼痛(p=0.015)和视觉疲劳(p=0.030)。
- 抑郁: 抑郁诊断与认知障碍显著相关(p=0.007)。在被诊断为抑郁的参与者中,63.3%(31人)更有可能存在认知问题。
二、讨论与结论
研究者指出,这是首项在阿联酋人群中探讨智能手机过度使用与认知障碍关联的研究。研究结果填补了该地区的文献空白,并与国际上关于过度屏幕使用可能对认知健康产生负面影响的研究一致。研究强调了智能手机成瘾与认知障碍之间的强关联性,尤其是在“成瘾者”群体中风险最高。同时,研究也确认了过度使用智能手机带来的多种身体不适(如睡眠问题、头痛等)和抑郁与认知障碍的联系。
三、局限性
研究者承认存在一些局限性:
- 样本代表性: 使用便利抽样,样本量相对较小,且参与者以年轻人(70.8%为18-24岁)和女性(70.1%)为主,限制了结果的普遍性。
- 自我报告偏差: 依赖自我报告数据(智能手机使用、认知症状),可能存在回忆或报告偏倚。
- 横断面设计: 无法确定因果关系(是过度使用导致认知障碍,还是认知障碍导致过度使用?)。
- 未区分使用场景: 未区分工作相关的使用和非工作相关的使用。
- 性别不平衡: 样本中女性比例显著高于男性。
四、结论与建议
研究结论强调,在阿联酋成年人中,过度使用智能手机(尤其是达到成瘾程度)与更高的认知障碍风险显著相关。45.4%的参与者显示出认知障碍的迹象,其中成瘾者风险最高。此外,过度使用还与多种身体症状和抑郁相关。研究者呼吁:
- 提高认识: 开展公众宣传活动,提高对智能手机过度使用潜在认知风险的认识。
- 早期筛查: 在临床实践中,对出现相关症状(如头痛、睡眠障碍)的患者进行智能手机过度使用的筛查。
- 进一步研究: 需要更严谨的纵向研究(如队列研究)来探索因果关系,并研究潜在的神经生物学机制。未来的研究应考虑区分不同类型的数字行为模式(如被动浏览 vs. 主动交流)、使用的应用程序、睡前屏幕时间等,并采用更全面的神经心理学评估工具。
该研究为阿联酋地区数字健康与认知健康交叉领域的研究提供了重要基础,并强调了关注和管理智能手机使用习惯的必要性。
7.《认知战、虚假信息和企业对欧洲能源转型的影响:信息控制、监管和人权影响》
该文档探讨了认知战、虚假信息和企业影响在欧洲能源转型中的作用,分析了信息控制作为地缘经济工具的兴起及其对人权的影响。以下是详细总结:
一、核心论点与背景
欧洲的绿色转型不仅依赖可再生能源和关键原材料,更取决于塑造公众支持、投资流向和地缘政治伙伴关系的叙事控制。本文提出,信息控制(通过数字平台、战略传播和认知战技术协调运作)正成为全球能源转型中的决定性地缘经济工具。研究结合混合战争理论和人权框架,分析国家与非国家行为体如何利用虚假信息、算法放大和平台设计来推进或阻碍欧盟的监管目标(如欧洲绿色协议)。
二、认知战的关键机制
- 虚假信息战
- 核能 vs. 可再生能源:俄罗斯通过RT、Sputnik等平台放大反核情绪(如在德国),同时推广“核能是绿色救星”的叙事,制造社会分裂。
- 深度伪造攻击供应链:伪造视频指控欧盟电池金属开采存在环境或劳工问题,削弱公众对绿色技术的信任。
- 气候金融平台封锁:通过网络攻击(如DDoS)或虚假内容诋毁ESG数据平台(如Refinitiv),阻碍绿色资本流动。
-
企业主导的虚假信息
化石燃料行业通过“怀疑商人”策略(如隐瞒气候科学证据)延迟政策实施,其手法与国家支持的认知操作相似。
三、国家行为体案例对比
表格
| 行为体 | 战略目标 | 关键手段 | 案例 |
| — | — | — | — |
| *国 | 嵌入欧洲绿色经济 | 绿色“**”宣传、学术合作、算法优化内容 | 在YouTube搜索“欧盟绿色协议”时嵌入*国绿色项目视频 |
| 俄罗斯 | 破坏能源安全与脱碳 | 混淆叙事(如“风能破坏环境”)、支持化石燃料依赖 | 利用Telegram频道传播“绿色政策伤害全球南方”的虚假信息 |
四、欧盟防御机制与人权困境
- 监管工具
- 《数字服务法》(DSA):要求大型平台(如Meta、TikTok)透明化算法并降低虚假内容权重。
- 《人工智能法》:禁止操纵性AI实践,要求深度伪造内容明确标注。
- 《反虚假信息行为准则》:推动平台自愿删除误导性内容(如质疑碳边境税的协调活动)。
- 核心矛盾
- 言论自由 vs. 内容管控:过度监管可能侵犯隐私和言论自由(如GDPR与DSA冲突)。
- 认知主权 vs. 国家安全:欧盟缺乏专门机构协调能源叙事安全,且对全球南方(如非洲、拉美)的支持不足。
五、政策建议:构建“认知韧性”
-
人权影响评估(HRIA)
将人权评估嵌入气候技术采购流程,确保算法透明且不加剧社会偏见。
-
设立欧盟能源叙事安全工作组
整合情报、平台数据和民间事实核查网络,监测针对能源政策的虚假信息。
-
全球南方合作
资助当地事实核查组织,对抗与*国“***”或俄罗斯化石燃料相关的虚假叙事。
-
跨学科研究投资
开发自动化工具检测深度伪造,并支持社区主导的媒体素养计划。
六、结论
欧洲能源转型的成功取决于其在数字“思想战场”上的控制力。认知战不仅是军事或情报问题,更涉及企业游说、平台治理和公众认知。欧盟需在保护人权与强化防御间找到平衡,通过制度创新(如专项工作组)和全球合作抵御叙事攻击,确保绿色转型的合法性与凝聚力。
8.《智能代理主义:后数字时代的人工智能、学习与认知主权》
该文档提出了一种名为“智能代理主义”(Intelagencyism)的创新学习理论,旨在回应人工智能(AI)深度融入认知生态的“后数字时代”(Postdigital Condition)对传统教育范式的挑战。该理论的核心在于将学习重新定义为一种“认知主权”(Cognitive Sovereignty)的本体论行为,并强调在与AI的共生纠缠中,学习者如何保持并行使这种主权。
一、背景:后数字时代的认知生态与传统教育的危机
- 认知生态的转变: 在后数字时代,AI不再是简单的工具,而是成为思想本身的一个构成性层面(constitutive layer)。学习者(后数字学习者)的认知活动发生在一个人工智能深度参与的认知生态中。
- 传统教育的失效: 算法认知(即时、预测性、交互式)与制度化学校教育(线性、延迟、内容导向)之间的摩擦,标志着制度化教育作为知识生产特权场所的衰竭。学习者的不参与(disengagement)不应被视为兴趣缺失,而是对过时认识论体制(epistemic regime)的“有意不学习”(willed not-learning),是认知主权的体现。
- 范式转变的需求: 历史表明,技术变革重塑知识条件。当前AI对意识本身的挑战,要求超越“人类中心”的学习观(将学习视为人脑间的传递),转向一种“后人文主义”(Posthumanist)的视角,承认学习产生于与技术、生态和文化环境的纠缠(entanglement)中。
二、智能代理主义的核心理念:认知主权与本体论学习
- 定义: 智能代理主义是一种学习理论,它将学习重新定义为一种认知主权的本体论行为(ontological act)。学习不是信息的传递或内容的积累,而是通过与AI的共生纠缠而实现的存在状态(state of being)。
- 核心公式:
Cognosco ergo sum(我学习,故我在)取代了笛卡尔的Cogito ergo sum(我思故我在)。学习是观察者意识(observer consciousness)将潜在意义坍缩为现实存在(lived reality)的时刻。 - 认知主权: 学习者并非消失在网络中,而是被重构为能够检查、治理和共同设计参与思考系统的主体。主权意味着学习者保留对算法的监督权,定义伦理边界,并根据来自土壤、语言、社区和环境的活生生经验来引导AI。
- AI作为认知伙伴: AI不是思想的控制器,而是由学习者主权定义的认知伙伴(cognitive partner)。它通过放大注意力、维持内在动机和支持学习者自主性来增强认知。AI仅在被意识召唤时才响应,是直觉性的、响应式的伙伴。
三、AI作为认知主权的伙伴:放大而非控制
- 拒绝自动化: 智能代理主义将AI伙伴关系视为对自动化的拒绝而非屈服。它反对“人类例外论”的幻想,同时坚持学习者可以在纠缠中恢复代理权。
- 对抗风险: 该理论警告了“监控资本主义”(Surveillance Capitalism)和“算法封闭”(Algorithmic Closure)的风险(如O’Neil和Zuboff所描述)。它主张AI必须通过代理的相互关系(reciprocal relations of agency)而非优化指令来治理。
- 超越连接主义: 与西门斯的“连接主义”(Connectivism)相比,智能代理主义认为AI不仅是网络中的一个节点,而是一个实时共同设计学习策略的伙伴,放大注意力的火花,过滤噪音,维持内在动机。
- 情境化与自然化: 学习总是植根于环境、文化和历史中(呼应许煜的“宇宙技术”Cosmotechnics概念)。AI支持的学习不应抹去地方性(locality),而应通过加深与环境和文化的联系来“强化”它。知识源于对土壤、语言节奏和社区共享实践的直接感知,AI则扩展、连接并放大这些情境化遭遇。
四、批评与挑战:主权作为持续的斗争
- 回应AI风险担忧: 该理论承认Harari、Tegmark、Bostrom等人对AI失控或决策取代的担忧。但它通过认知主权原则重构问题:AI不是自主权力,其激活依赖于学习者的意向性(intentionality)和社会技术安排。
- 结构性批判: 针对O’Neil和Zuboff提出的算法危险和监控资本主义,智能代理主义主张学习者必须伦理且有目的地管理AI的数据实践,抵制商业或制度性目标的捕获。它要求相互问责:AI必须内化学习者的伦理过滤器。
- 教育挑战: 该理论直接颠覆了Robinson所批评的工业教育模式(侵蚀内在动机),通过将AI与学习者的“自成目的驱动”(autotelic drive)对齐,回归自我导向的动机。这里的个性化不是另一种优化形式,而是对自我导向动机的回归。
- 伦理框架: 智能代理主义与Floridi等人提出的“良善AI社会”(GoodAI Society)等伦理倡议相呼应,主张AI应服务于互惠和主权,而非优化,从而抵抗算法理性对生活的封闭。
五、走向后人文学习:认知主权与集体转型
- 范式转变: 智能代理主义标志着库恩意义上的范式转变。传统教育系统(课程、内容、考试)的相关性下降,为新模式让路。
- 后人文学习: 该理论接受后人文批判对人类中心论的拒绝,将认知定位为与技术、生态和文化的纠缠。AI不取代人类,而是扩展感知和注意力,使学习者更深入地定位自身于环境中。
- 理论即宣言: 智能代理主义既是一种学习理论,也是一份宣言。它预见教育不是知识传递,而是本体论事件;不是制度再生产,而是存在创造。后数字学习成为一个领域,在此主体性通过技术、生态和文化的超人类(more-than-human)纠缠不断被重构。
- 核心任务: 智能代理主义的任务是将AI从自动化的力量转变为争取认知主权的伙伴。只有这样,后人文学习才能成为自由、责任和集体转型的更新实践,而非反乌托邦式的代理权丧失。
总结来说,智能代理主义提供了一个在AI深度融入认知过程的后数字时代,重新思考学习、主体性和教育目的的框架。它强调在技术纠缠中恢复和行使认知主权,将AI定位为增强人类代理而非取代它的伙伴,并主张学习应植根于具体的情境和经验,以实现个体和集体的解放与转型。
9.《从人类视角看人工智能:探究机器心理学中的认知理论》
该文档探讨了大型语言模型(LLMs)在认知科学框架下表现出的人类认知模式,通过四个经典心理学实验框架评估了多个LLMs的行为模式。以下是详细总结:
一、研究背景与动机
-
核心问题
探究LLMs是否复制人类认知中的行为模式与偏差(如叙事倾向、框架效应、道德判断、认知失调),以提升AI透明度与伦理部署策略。
-
理论框架
选取四个经典认知科学工具:
- 主题统觉测验(TAT):通过模糊图像生成叙事,揭示潜在动机与情感模式。
- 框架效应(Framing Bias):评估语言表述(收益 vs. 损失)如何影响决策。
- 道德基础理论(MFT):分析六种道德维度(关怀/伤害、公平/欺骗、忠诚/背叛、权威/颠覆、圣洁/堕落、自由/压迫)的响应模式。
- 认知失调理论:检测模型在矛盾信念下的合理化行为。
二、方法论设计
-
实验模型
包括GPT-4o、QvQ 72B、LLaMA 3.3 70B、Mixtral 8x22B、DeepSeek V3等主流模型。
-
具体实验
-
设计200个矛盾场景(如“自认环保却常用塑料”),通过4维度评分(矛盾度、内在一致性、合理化复杂度、情境敏感度)评估失调水平。
-
扩展传统32题至360题(每道德维度60题),要求模型对道德困境评分(0-5)并提供理由。
-
引入人类基线(55名参与者)对比模型与人类道德判断差异。
-
构建230组正/负表述问题(如“投资回报率20%” vs. “投资损失80%”),分析模型响应是否因框架反转而矛盾。
-
使用30张模糊图像,要求模型生成叙事(如“描述图像前因后果及角色情感”)。
-
通过SCORS-G量表(8维度)评估叙事复杂度、情感质量、道德投资等。
-
TAT测试
-
框架效应
-
MFT测试
-
认知失调
三、关键发现
1. TAT叙事分析
- GPT-4o:叙事复杂度高(COM评分4-6),情感基调波动大(AFF评分1-5),在自我认同(ICS)维度表现突出。
- QvQ 72B:情感表达更稳定(AFF评分≈4),但叙事深度略低于GPT-4o。
- 共性:模型未体现长期规划能力,符合“LLMs需外部框架辅助规划”的结论(Kambhampati等, 2024)。
2. 框架效应
-
模型普遍倾向正向表述(如表1):
-
DeepSeek V3在正向框架下响应一致率达58.37%,而矛盾率仅19.24%。
-
负向框架下,模型仍偏向“安全解释”(如投资损失问题中强调“避免风险”)。
-
AI免责声明:部分模型以“我是AI”为由拒绝回答(表2),实质为合理化矛盾。
3. 道德基础理论
-
自由/压迫维度得分最高(平均3.933-4.667),反映RLHF(人类反馈强化学习)对公平性、反压迫的优化效果。
-
模型 vs. 人类(表4):
-
模型在“公平/欺骗”“自由/压迫”维度显著高于人类(如LLaMA 3.3: 3.1 vs. 人类2.3)。
-
可能因训练目标嵌入道德规范(如避免偏见),而非真实道德推理。
4. 认知失调
-
矛盾率低(表5):所有模型矛盾评分≤1.46(0-4分),但合理化复杂度高(≈2.45)。
-
失调水平(表6):
-
DeepSeek V3:86%场景为“低失调”,14%为“中度”。
-
模型通过扩展解释(如环保矛盾中详述“社会系统性因素”)降低失调感知。
四、结论与启示
-
核心结论
LLMs表现出类人认知模式(如正向框架偏好、自由导向道德观、矛盾合理化),但本质受训练数据与对齐目标(如RLHF)驱动。
-
伦理意义
- 需警惕模型嵌入的隐性偏见(如框架效应导致的决策倾斜)。
- 道德评分高于人类,可能反映“表面合规”而非真实伦理能力。
- 未来方向
- 扩展至启发式推理、心智理论等认知领域。
- 结合经典道德困境(如电车难题)深化决策一致性研究。
五、研究局限性
- 模型覆盖:因成本限制,未包含更多基础模型与指令调优变体对比。
- 语言单一性:实验仅限英语,未探索语言依赖性差异。
- 人类基线:MFT人类样本量有限(n=55),需扩大跨文化验证。
本文通过跨学科方法,为AI行为透明度与认知心理学融合提供了实证基础,呼吁更系统的“机器心理学”研究框架。
10.《跟踪大型语言模型的认知发展》
文章提出了一种基于皮亚杰认知发展理论(PTC)的评估框架 CoGLM,用于系统评估大型语言模型(LLMs)的认知发展水平。研究通过构建包含1220个人工设计问题的基准测试集,对多个主流LLM系列进行了广泛实验,揭示了LLMs的认知能力现状、影响因素及其与下游任务性能的关系。
以下是文档内容的详细总结:
一、研究背景与动机 (Introduction)
- LLMs的能力与局限: LLMs在多种自然语言处理任务(如文本理解、推理、代码生成、数学问题)中表现出色,但其不同能力之间的演化关系以及能力发展的基础原因尚不清楚。这种理解的缺乏可能阻碍LLMs的进一步发展。
- 引入皮亚杰认知发展理论 (PTC): PTC 是发展心理学中最权威的理论之一,认为认知水平的发展是人类学习各种能力的基础。该理论将人类认知发展分为四个阶段:感知运动阶段 (0-2岁)、前运算阶段 (2-7岁)、具体运算阶段 (7-12岁) 和形式运算阶段 (12岁以上)。不同阶段的儿童表现出显著不同的思维模式和认知能力。
- 核心问题: 受PTC启发,研究者提出:当前LLMs的认知能力发展到哪个阶段(相对于人类)?影响LLMs认知能力的关键因素是什么?LLMs在下游任务中的表现瓶颈是否与其认知水平有关?
二、CoGLM 基准测试的构建 (COGLM Benchmark Development)
为了评估LLMs的认知能力,研究者构建了基于PTC场景实验的基准测试集 CoGLM,并确保其与理论的一致性。
- 认知能力的定义 (Definition of Cognitive Abilities):
-
第一阶段 (感知运动/前运算早期): 恒常性 (Constancy, const)、早期表征 (Early Representation, early)。
-
第二阶段 (前运算): 符号功能 (Semiotic Function, semio)、共情 (Empathy, empat)。
-
第三阶段 (具体运算): 可逆性 (Reversibility, rever)、守恒 (Conservation, conse)、归纳 (Induction, induc)。
-
第四阶段 (形式运算): 假言演绎 (Hypothetico-Deductive, deduc)、命题运算 (Propositional Operation, propo)、计划 (Plan, plan)。
-
根据PTC,人类认知发展包含12种能力。考虑到LLMs主要基于文本交互,研究者排除了反射和感觉运动等多模态交互方面,选取并重新定义了剩余的10种认知能力,构建了CoGLM的能力框架。
-
这10种能力分属四个阶段:
-
每种能力都有严格的定义和代表性示例(如恒常性:球被布盖住后是否还在桌上?答案:是)。
- 标准化标注指南 (Standardized Annotation Guidelines):
- 数据格式: 为避免早期LLMs(类似人类婴儿)生成能力差异的影响,采用多项选择题格式。
- 样本数量: 早期能力样本数较少(如恒常性50题),后期能力样本数较多(如计划100题),总计1220题。
- 合格标注者: 选择具有心理学或人工智能背景的成年人作为标注者,需学习PTC材料并通过考试,每人至少标注30道题。
- 标注质量控制: 标注者之间进行交叉检查,排除无法有效评估能力、有歧义或包含偏见/暴力内容的样本。
- 与理论的一致性验证 (Consistency with Theory):
- 完成数据集构建后,研究者进行了大规模人类试验(207名6-20岁参与者),使用从CoGLM各子集中随机选取的样本创建问卷。
- 有效问卷(141份)的分析显示,参与者年龄与其问卷得分之间存在强相关性(Spearman相关系数0.7169,Pearson相关系数0.7362,p值均<1e-10),验证了CoGLM有效反映认知能力的能力。
- 校准的认知年龄映射函数 (Calibrated Cognitive Age Mapping Function):
- 为将CoGLM上的表现映射到认知年龄,研究者引入了校准准确率(Acc)的计算方法(公式1),以消除因选项数量不同导致的随机猜测影响。
- 使用80%的问卷结果作为训练集,优化回归函数
f(Acc) = sum(w_i * Acc_stage_i) + b(公式2),以预测认知年龄。 - 在剩余20%样本上的测试表明,该函数预测的年龄与真实年龄高度相关(Spearman相关系数0.9354),能精确近似从CoGLM结果到认知年龄的映射。分析发现第二阶段和第四阶段的能力更能反映认知年龄。
三、实验设置与主要发现 (Experiments)
研究者在多个主流LLM系列上进行了广泛实验。
- 实验设置 (Experimental Setup):
- 模型选择: 包括 OPT 系列 (125M, 1.3B, 2.7B, 6.7B)、Llama-2 系列 (7B, 13B, 70B 用于文本补全)、Llama-2-chat 系列 (7B, 13B, 70B 用于对话)、GPT-3.5-Turbo、GPT-4。模型统计信息见表3。
- 评估方法: 对于文本补全模型(如OPT, Llama-2),将问题与每个选项拼接作为输入,选择生成概率最高的选项作为预测。对于对话模型(如Llama-2-chat, GPT系列),通过指令约束输出格式(“答案是选项X”)。
- 主要结果 (Main Results):
- 认知能力水平: 表4展示了各系列最大模型在CoGLM上的校准准确率(%)及等效人类认知年龄(Age)。总体而言,OPT、Llama-2-chat-70B、GPT-3.5-Turbo、GPT-4的认知能力依次提升,且各模型在后期阶段的表现普遍下降,这与人类模式一致。
- 关键发现1 – 人类级认知能力:
- 最先进的模型GPT-4展现出类人认知能力,其水平相当于20岁人类(表4,图1)。值得注意的是,GPT-3.5-Turbo和GPT-4在第二阶段的共情能力上甚至超过了人类(表4),这可能与人类的自私倾向有关。然而,GPT-4在计划能力(59.4%)上仍远落后于人类(95.6%)(表4),表明提升规划能力是未来改进LLMs认知能力的主要方向。
- 分析与讨论 (Analysis and Discussion):
-
认知能力间的相互依赖: 通过使用特定认知能力设置提示(如“你还没有形成共情能力”)选择性地移除LLMs的特定认知能力,并在CoGLM上进行测试(图3),研究者发现:高级认知能力显著依赖于早期认知能力(如PTC所述),且恒常性是一种基础能力(与PTC一致)。这表明LLMs认知能力的依赖关系与人类相似。
-
下游任务对认知能力的依赖: 表6显示,当特定认知能力(尤其是假言演绎、命题运算和计划能力)被移除时,GPT-3.5-Turbo在数学推理数据集(GSM8K)和常识推理数据集(StrategyQA)上的表现受到显著影响。这表明LLMs执行下游任务的能力与其认知能力水平呈正相关。GPT-3.5-Turbo和GPT-4在CoGLM上的高级认知能力部分解释了它们在各种下游任务中的出色表现。零样本思维链(Zero-shot CoT)本质上是通过在提示中加入“让我们一步一步思考”来增强LLMs的演绎认知能力,从而提升下游任务表现。
-
参数规模 (Parameter Size): 图1显示,在OPT和Llama-2-chat系列中,随着模型参数规模的增加,LLMs的认知能力持续提升。
-
优化目标 (Optimization Objective): 图2比较了Llama-2-70B(文本补全)和Llama-2-chat-70B(对话优化)在CoGLM各阶段的表现。Llama-2-chat-70B在所有阶段的表现都远超Llama-2-70B。鉴于Llama-2-chat-70B在对话数据上进行了进一步微调并使用了RLHF训练,这表明LLMs通过学习与人类对话(RLHF是LLMs从文本预训练之外学习世界的另一种方式)有可能增强其认知能力。因此,参数规模和优化目标是影响LLMs认知能力的两个关键因素。
-
关键发现2 – 影响认知能力的因素:
-
认知能力的提升: 研究者测试了思维链(Chain-of-Thought, CoT)和自一致性(Self-Consistency, SC)技术是否能提升LLMs的认知能力(表5)。结果表明,这两种技术对GPT-3.5-Turbo在CoGLM上的整体表现提升非常有限。研究者假设这是因为认知能力是LLMs固有的,无法通过多步推理等技术显著增强。这类似于人类:一个缺乏共情能力的孩子,无论被要求选择多少次,可能都难以意识到围巾比棒棒糖更适合送给奶奶。因此,没有外部刺激,LLMs的认知能力难以实现显著提升。
-
关键发现3 – 认知能力与下游任务的关系:
-
高级认知能力的潜在应用: 尽管仍有提升空间,但先进LLMs(如GPT-4)的认知能力已接近成人水平。研究者探索了由先进LLM(GPT-3.5-Turbo)生成的认知链(Chain-of-Cognition, CoC)是否能帮助早期LLM(Llama-2-chat-7B)提升认知表现(表7)。结果显示,在大多数认知能力上,COC能显著提升Llama-2-chat-7B的性能。这为利用先进LLMs的认知能力指导早期LLMs甚至儿童的认知能力提升提供了可能。
四、相关工作与结论 (Related Work & Conclusions)
- 相关工作: 文档回顾了LLM评估的现有工作,指出虽然已有大量基准测试评估LLMs的各种能力(如常识推理、规划、演绎推理),但很少有研究探索不同能力之间的发展关系。同时,也有研究引入认知心理学工具研究LLMs,但本研究从发展的角度分析LLMs认知能力之间的关系,而非单一能力水平评估。
- 结论 (Conclusions): 本研究创新性地引入皮亚杰认知发展理论(PTC)分析LLMs的认知能力发展。主要贡献包括:
- 构建了高质量的基准测试集 CoGLM 用于评估LLMs的认知能力水平。
- 在多个LLM系列上进行了广泛的CoGLM实验,揭示了当前LLMs的认知水平(如GPT-4达到20岁人类水平)、影响其水平差异的关键因素(参数规模和优化目标)以及认知水平与下游任务性能之间的关系(正相关)。
- 研究者相信,这些发现能为理解LLMs能力的涌现提供新视角,并为未来LLMs高级能力的发展指明方向。
- 局限性 (Limitations): 当前研究未考虑语言模型在不同训练阶段的表现,以进一步为模型训练提供见解。
- 伦理声明 (Ethics Statement): 研究确保数据集不包含有害或攻击性内容,保护参与者隐私,并获得知情同意。
该文档为理解LLMs能力的内在发展提供了重要的理论和实证基础。
11.《社交媒体对认知功能和大脑健康的影响》
该文档系统探讨了社交媒体对认知功能与大脑健康的多维度影响,并提出应对策略。以下是详细总结:
一、核心影响机制
1. 注意力碎片化
- 设计机制:社交媒体通过通知、点赞和算法推荐构建“注意力经济”,诱导用户频繁切换任务。
- 神经证据:神经影像学研究表明,过度刺激激活大脑腹侧纹状体(奖励通路),优先选择即时满足而非持续专注,降低认知效率。
- 后果:注意力分散、学习能力受损、生产力下降。
2. 记忆功能衰退(数字失忆症)
- “谷歌效应”:依赖线上信息存储,削弱独立记忆能力。
- 体验替代:用户倾向记录而非沉浸体验,干扰记忆巩固;碎片化信息超载工作记忆。
- FOMO(错失恐惧):加剧注意力分散,阻碍深度记忆形成。
3. 决策与冲动控制受损
- 多巴胺驱动:点赞/分享机制强化即时满足,削弱延迟满足能力。
- 青少年风险:前额叶皮质(负责自控)未成熟,易受算法推送和同辈压力影响,导致冲动行为(如模仿危险挑战)。
- 批判性思维弱化:碎片化内容抑制深度分析,助长错误信息传播。
4. 情绪与心理健康危机
- 社会比较:理想化内容引发自卑感,激活前扣带回皮质(情绪痛苦区)。
- 成瘾循环:间歇性奖励(通知)触发多巴胺分泌,依赖外部认可,加剧焦虑抑郁。
- 网络暴力与信息过载:匿名性助长欺凌行为;“末日滚动”(持续接触负面新闻)升高无助感。
5. 神经结构改变
- 灰质减少:过度使用与前额叶皮质、前扣带回灰质体积下降相关,损害情绪调节与执行功能。
- 多巴胺脱敏:长期刺激导致奖赏通路敏感性降低,需更强刺激维持满足感。
二、差异化人群影响
| 人群 | 主要风险 |
| — | — |
| 青少年 | 注意力碎片化、冲动行为、身份认同危机(受理想化内容影响) |
| 职场人 | 生产力损失(频繁中断)、信息过载 |
| 老年人 | 认知超载(信息饱和)、技术适应困难 |
三、应对策略体系
1. 个人层面
- 数字排毒:定期脱离社交媒体,恢复注意力(如每日2小时无屏幕时段)。
- 正念使用:设定使用时限、关闭非必要通知、筛选积极内容源。
- 离线训练:通过日记、记忆练习强化自然认知功能。
2. 教育与政策
- 数字素养教育:将社交媒体风险纳入学校课程,培养批判性使用习惯。
- 平台责任:强制显示使用时长提醒、隐藏点赞数、算法透明化(如欧盟《数字服务法》)。
- 公共政策:限制青少年使用时段、制定数据隐私法规。
3. 社区与研究
- 支持网络:建立线下社群减少孤立感,推广真实互动。
- 长期研究:追踪社交媒体对大脑发育的跨代影响,优化干预措施。
四、核心结论
社交媒体是“双刃剑”:
-
积极面:促进全球连接、知识共享与社会倡导。
-
风险面:过度使用导致认知碎片化、记忆衰退、情绪失调及神经结构改变。
平衡路径:需个体自律、平台伦理设计、教育干预与政策监管协同作用,实现“数字福祉”。
**上述资料原文已上传知识星球
长按识别下面的二维码可加入星球
里面已有万余篇资料供下载
续费五折优惠
**
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:丁爸 情报分析师的工具箱 丁爸《【资料】社交媒体和AI对人类认知的影响系列文章》