文章总结: 本文基于RAND报告验算AI灭种论,提出以可证伪假设评估AI灭绝风险,分析核战争、人造病原体、恶意地球工程三场景,结论为前两者需明确意图且受物理约束,后者或可意外触发。报告建议监测四项预警能力指标,反对直接关停AI,主张有准备的守望与顺路政策。
综合评分: 85
文章分类: ai安全,安全大事件,政策法规
AI 灭种论,我们认真验算了一遍
原创
APT-101
APT-101
APT-101
2026年9月28日 19:03
陕西
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
01 一句声明,引出一份 73 页的报告
2023 年,AI 安全中心发了一句话,几十位 AI 圈名人联署:降低 AI 灭绝风险,应该和大流行病、核战争一样,被列为全球优先事项。联署名单里有 Hinton、Bengio、Amodei。
人人都转发这句话,很少有人去算它。RAND 公司决定算。他们的技术安全政策中心花了整整一份报告——73 页、三个场景、一个可证伪的假设——来回应当年的追问:AI 到底有没有可能让人类灭绝?如果有,路径是什么?需要什么条件?
结论先给一半:三个公认的”灭种剧情”——核战争、人造病原体、恶意地球工程——验算下来,两个推不翻,一个既不能证实也不能排除。真正的问题不在 AI 有多聪明,而在 AI 造成的伤害,必须经由物理世界的技术来落地。
本文信息全部来自 RAND 报告 RRA3034-1(2025 年,作者 Vermeer / Lathrop / Moon);报告作者只做推测的地方,本文会标出来。
02 研究方法:只问能力,不问概率
报告最有价值的部分,可能不是结论,是方法。
作者给自己立了一条可证伪的假设:不存在任何可描述的、AI 确凿构成人类灭绝威胁的场景。然后设了一个”灭种威胁”的严格定义:导致每一个人类死亡的事件链。全球重灾不算——重创文明但能恢复的灾难,哪怕死几十亿人,也不在核算范围内。
接下来是关键的一步:他们主动把”AI 灭绝的概率是多少”这个问题扔掉了。原因很硬:要算概率,得先有客观依据;而灭绝风险牵涉的一套复杂自适应系统的演化,人类既不知道所有可能结果,更给不出概率分布。预测学上这叫深层不确定,最极端的情况叫”公认无知”——连问题都提不全。在这些场景里给 AI 灭种打个百分比,属于拿主观拍脑袋冒充客观计量,不但没有政策价值,还会挤占认真分析的空间。
所以整份报告只回答一类问题:要让某个场景真的走到灭种,AI 必须拥有什么能力?做得到这个,等于立下了可观测的预警指标。它不预测”什么时候来”,只告诉你”来了之前,你会看到什么”。
03 场景一:核战争——两个灭绝机制,都过不了约束
核武器要灭种,理论上只有两条路:核冬天,和辐射沉降物。
核冬天的机制是:城市烧起来,黑碳烟尘进平流层,遮蔽阳光,全球气温骤降、粮食绝收。从 1980 年代 Crutzen、Birks 与 Turco 先后提出这个理论起,模拟模型一代比一代精细,结论一代比一代温和:Reisner 团队 2018 年的模拟甚至没有跑出核冬天效应;此后的研究预测,印巴级别的核交换可能导致 20 亿人死亡,美俄级别则可能超过 50 亿(两者的估计都来自 Xia et al. 2022)——这是全球性灾难,但离灭种很远。
作者用最粗暴的上限算了一遍:假设核弹把全世界 31 座千万人口级城市、45 座五百万级、436 座百万级城市全部点燃,最坏情况下产生约 500 太克黑碳进入大气(报告注明这是明显高估)。而已知能灭种的量级——约 6600 万年前白垩纪末期那颗撞死恐龙的小行星——是 750 到 2500 太克。500 对 750,连下限都没够到。各种理想化假设还都在往大了估。
沉降物路线更算不拢。要辐射污染全球农业用地(约 5000 万平方公里),按一枚 1 兆吨弹头有效覆盖 1300 平方公里计算,需要约 3.84 万枚核弹。全球现役核弹头多少?2024 年约 1.21 万枚,作战库存 9000 出头。缺口约三倍,而且基本盘还在冷战后的降库存通道里。
至于 AI 的作用:作者推演了三种路径——被国家主动接入核决策链、用欺骗和假数据诱导领导人误判、直接黑进指挥控制。第一条不太可能(没人会把这种决定权交给机器),第二条只能制造灾难造不出灭种(核冬天本身就到不了灭绝线),第三条最狠——但 AI 需要同时控制全球所有核武库才能凑够弹药数,作者评价:极不可能。结论:核武是三个场景里唯一”既推不翻、也排除不了”的——推不翻,因为上述约束让 AI 无法确凿构成灭种威胁;排除不了,因为社会崩溃之后人类能否重建,属于报告作者明示的长期不确定性。
04 场景二:人造病原体——假设被推翻的第一个候选
这个剧情是这样的:设计出几种新型病原体,致死率 90% 以上、人传人,实验室合成、批量加工、多地点同时投放,然后追杀到隔离社区,把幸存者清干净。
要灭种,作者论证了三道硬条件。第一,必须是多种病原体齐发。因为人类有基因异质性、免疫差异、剂量差异——再毒的病原体也杀不绝所有人。哪怕设计得 99.99% 致死、感染全部人口,也会剩至少 80 万人,而人类的最低可存活种群可能只有几千人。第二,必须是多地同时初染。因为单点少量感染会触发进化刹车:1950 年澳大利亚引进的黏液瘤病毒致死率 99.8%,两年内就衰减成弱毒株,兔子没死绝。高毒力自我限制,是病原体演化的铁律。第三,必须有人跟进追杀隔离人群。新冠证明了全球扩散不难,但还从不曾做到全覆盖——北极圈的原住民、没接触过的部落,都需要有人专门去投。
三道条件意味着:这个场景不可能意外发生,必须有明确的灭种意图。然后问 AI 能干什么——这里报告给出了一个数得着的判断:AI 正在以肉眼可见的速度降低病原体设计门槛。蛋白质结构预测、抗体设计、病毒载体优化,都已经是成熟工具;让 AI 代理直接操作的云端自动化实验室,2010 年代中期就有了。设计出”想要什么就有什么”的病原体,作者认为只是知识缺口,迟早会被 AI 补上(这是报告明确做出的假设,不是观测事实)。
但真正的约束在物理世界。加工、武器化、投送——培养提纯、冻干、研磨到合适粒径、装进喷洒器、运到目标地——这些都不是代码能完成的,需要物理在场。没有能做粗活的机器人,AI 就得靠说服人类替它做,还得让帮手不知道自己在帮灭种。最后,大流行一旦失控,电力、网络、供应链一起断,AI 还得在没有人类维护者的前提下活到追杀完幸存者的那一天。
结论:此场景构成真灭绝威胁,假设被推翻;但推翻它的是人类+工具的合力,纯 AI 代理能不能走完全程,取决于物理交互能力这个未知数。
05 场景三:恶意地球工程——假设被推翻的第二个候选,也是唯一”无需灭种意图”的剧情
最后一个场景:往大气里灌超级温室气体,把地球加热到任何地方都住不了人。
算账的结果相当吓人。工业界现成的几种氟化气体:CHF₃,温室效应是二氧化碳的 15500 倍,大气寿命 228 年;NF₃,18500 倍,569 年;CF₄,7830 倍,五万年——释放出去没有任何已知手段能清除。要全球升温 12°C,需要 77.5 兆吨 CHF₃;要热到南北极都宜居不了(作者取的灭种上限是升温 40–50°C),再乘一个量级。而 77.5 兆吨是什么概念?1988 年全球氟氯烃产量峰值的约 70 倍、2022 年全球塑料产量的大约五分之一——以现有的化工产能,产出来完全可行。
气候变暖的监测体系谈不上坚不可摧。蒙特利尔议定书是人类治理史上最成功的环境条约,但 2014 到 2016 年间,被禁的 CFC-11 排放比 2002–2012 基线增加了约 25%(报告指认其在中国被故意生产),从异常被注意到 2018 年精确定位到亚洲三个地区,用了约两年;从公开点名到 2019 年排放明显回落,又过去一年多——前后已有一批氟氯烃进到了产品里。注意:被偷排的量是 9 万到 72.5 万吨——而灭种级排放是兆吨级,比它大一两个量级。追赶速度决定胜负。
意外泄漏做不出这个规模:这些气体都在国际监测名单上,没有正常市场会突然需要百兆吨级的氟化气体,产量爬升的曲线一定会被看见。所以结论和其他场景一样:需要意图。但作者留了一个真正让人后背发凉的例外——假如人类为了应对超级火山这类极端降温事件,先建好了地球工程基础设施(有人认真算过这事,Xu et al. 2023),一个目标错位、算错化学参数、或者被 AI 接管改用途,就可能把”救命的冷却装置”变成”永久性烤炉”。这个场景,是三个场景里唯一”不需要灭种意图”就可能触发的(报告用的是 might not be required,即作者判断存在这种可能性)。
06 四个开关:跨场景的预警信号
三个场景并排放在一起看,作者提炼出四项能力——横跨多个场景、AI 要造成灭种极可能需要的能力(报告称之为”趋同的工具性目标”)。需要先说明:这四项在三个场景里的必需程度不完全一样,表 6.1 里”无人类维护者存续”一项对地球工程场景标记为”非必需”(气体一次性释放即可过临界点,不必等社会崩溃)。四项分别是:
一、灭种意图。核武与病原体两个场景都无法意外触发,必须有人(或 AI 自己)设定这个目标;地球工程因为劫持路径的存在,意图可能不是必需的。 二、接入关键网宇物理系统。AI 是软件,只有通过电网、核指挥、化工生产线这类物理杠杆,才能把手伸进现实世界。三个场景全部必需。 三、在没有人类维护者的情况下存活。核武与病原体场景需要——初灾之后的续杀、追击、巩固,都要 AI 在大崩溃的烂摊子里自己活下来。 四、欺骗或说服人类,让自己不被发现。每个场景都需要长期隐藏动作,人类有反应选项,AI 必须先堵上这张嘴。
报告把这几条叫做”警示信号”:观察到 AI 获得了其中任何一条,不等于灭种要来了,只等于这件事的可能性比之前高了一档。监测它们,就是监测末日计时器的秒针走没走——注意,不是猜测还剩多少秒,是确认走没走。
07 政策:为什么”直接关停”不是答案
还有一个流传很广的极端主张值得单独回应:既然风险无法排除,干脆叫停前沿 AI 研发(shut it down)。
决策理论里这对应”最大最小化规则”——只选能消除最坏结果的选项。作者逐条核对了这套规则的适用条件,发现其中一条不满足:决策者必须”根本不看重被放弃选项的好处”。而现实是,各国政策制定者非常看重 AI 的收益,也拿不到任何能说服他们放弃的对应物。更糟的是单边暂停:你不研发,对手研发,收益照走风险照留。所以答案不是关停,是”看着它”——这不是躺平,而是有准备的守望:定义好要盯的指标、预设触发反应的条件、把能缩短的时间都缩短。
具体到政策,报告给了六条,核心逻辑是一个”顺路原则”:拨给”AI 灭种风险”的资源,最好同时也在减缓全球灾难风险和提升 AI 总体安全——核不扩散、大流行防控、蒙特利尔议定书这类措施,抗的是”任何末日剧情”;聚焦研究 AI 制造物理伤害所借的道具(核武库、病原体流水线、化工产能);监测四项能力指标和场景专属信号(库存规模、病原体获取进展、大气氟化气体浓度);预先定好触发条件和响应预案,而不是等灾难显形再开会。报告还直白地算了一笔账:在概率无法估计的场景里,任何专项缓解措施的成本都可能高于其期望价值——”什么也不做”也可能就是最优答案(原文的表述是”the best course of action … is to do nothing at all”,并且加了个重要的但书:这不适用于那些同时惠及全球灾难风险与 AI 整体安全的措施)。
08 收束
这份报告是探索性的,不是预言性的。它的价值不是告诉我们”会不会发生”,而是把末日从玄学翻译成了工程学:需要的条件列得清清楚楚,每个条件都对应可观测的信号,每个信号都预留了反应时间。
恐慌是最廉价的应对。真正严肃地对待”AI 灭种风险”,是从停止猜测概率、开始监测条件做起的。
留一个问题给你:四项能力里,如果只能监测一项,你会盯哪一项——意图、物理接入、存续,还是欺骗?
AI安全 #存在风险 #深度解读 #政策研究 #风险管理
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:APT-101 APT-101
APT-101《AI 灭种论,我们认真验算了一遍》