文章总结: Cloudflare于2025年12月5日因配置变更触发旧代码缺陷导致全球25分钟宕机,28%HTTP流量受影响。事故源于处理CVE-2025-55182漏洞时WAF缓冲区扩容至1MB,关闭内部测试工具时FL1智能体Lua运行错误引发HTTP500。公司已冻结网络变更并计划改进发布机制和故障旁路流程。
综合评分: 88
文章分类: 安全大事件,漏洞分析,应急响应,云安全,安全建设
Cloudflare配置变更触发旧代码缺陷引发25分钟全球性宕机
安全学习那些事儿
2025年12月6日 09:26
上海
2025年12月5日,Cloudflare突发网络故障,导致部分服务在全球范围内出现约25分钟中断。Cloudflare官方今日发布了有关此次事故的调查报告。该起事故从08:47UTC开始,至09:12完全恢复,约28%的HTTP流量受到影响。
此次故障并非由网络攻击或恶意活动引发,而是在应对React Server Components相关的行业级安全漏洞时,内部对请求体解析逻辑进行调整,引发连锁错误。
事故出现前,Cloudflare正逐步扩大Web应用防火墙(WAF)用于检测请求体内容的缓冲区,从原有的128KB提升至1MB,以协助客户缓解CVE-2025-55182漏洞风险。
升级过程中,团队发现一款内部测试工具无法支持新的缓冲区大小,随后决定通过另一套全球配置系统关闭该工具。由于该系统会在短时间内向整个服务器集群推送配置,而非按区域逐步发布,这一变更迅速影响了全网。
在Cloudflare的旧版FL1智能体中,该关闭操作在特定条件下触发了规则模块中的旧有代码缺陷,导致系统在处理名为“execute”的规则动作时出现Lua运行错误,最终返回HTTP500状态码。
出现问题的规则原本用于内部规则验证机制,关闭后系统在处理结果时访问了不存在的对象,从而触发异常。Cloudflare表示,该代码问题已存在多年,而在新版基于Rust的FL2智能体中不会出现。
故障确认后,Cloudflare于09:12进行回滚,所有服务恢复正常。受影响的客户主要是仍使用FL1智能体并启用Cloudflare托管规则集的用户;中国大陆网络服务不受影响。
Cloudflare也回顾了11月18日发生的另一场类似事故。公司表示,两次故障均由全网快速传播的配置更改触发,这暴露出部署机制在安全更新场景下的脆弱性。Cloudflare强调,目前正在推进多项系统性工程,包括增强发布机制、完善故障旁路流程、在关键数据平面启用更安全的“Fail-Open”模式等,但这些改进尚未完全落地。官方计划在下周公布更详尽的韧性建设方案。
Cloudflare表示已冻结所有网络变更,直至建立更安全的回滚和验证机制,并再次就此次事件对客户和互联网造成的影响致歉。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全学习那些事儿 《Cloudflare配置变更触发旧代码缺陷引发25分钟全球性宕机》