文章总结: AI推理阶段,光纤可能成为AI基础设施的重要瓶颈,AgenticAI和PhysicalAI的兴起进一步增加了对网络的需求,AI数据中心的位置和电力供应成为新的限制因素,光纤的重要性从连接变为算力基础设施。
综合评分: 85
文章分类: 网络安全,数据安全,应用安全,网络安全,办公安全
GPU之后,AI基础设施的新瓶颈可能是光纤
原创
wljslmz瑞哥
wljslmz瑞哥
网络技术联盟站
2026年9月27日 08:17
江苏
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
过去几年,人工智能基础设施的竞争焦点几乎全部集中在GPU、数据中心和算力集群上。企业不断采购更强大的加速器,云厂商持续建设新的AI数据中心,整个行业都在讨论如何获得更多算力。
但随着AI从训练阶段逐渐进入大规模推理阶段,一个容易被忽视的问题正在变得越来越明显:算力增长的同时,网络也必须跟着扩容,而光纤很可能成为AI基础设施接下来需要面对的重要瓶颈。
近日,RCR Wireless援引KPMG美国技术负责人Phil Wong的观点指出,AI推理和Agentic AI工作负载会产生越来越多的数据流量,使云基础设施、AI计算资源和最终用户之间的连接承受更大压力。对于这种高带宽、低延迟的通信需求,光纤仍然是最核心的基础设施之一。
AI的变化,让网络流量变得更加复杂
AI训练和AI推理虽然都需要大量网络资源,但两者对网络的需求并不完全一样。
大型模型训练通常集中在规模庞大的数据中心内部,大量GPU通过高速网络连接起来,服务器、存储和加速器之间持续交换数据。这种场景对数据中心内部的网络带宽要求非常高,但流量具有明显的集中性。
AI推理则完全不同。
当一个大模型真正进入日常应用之后,计算请求不再只发生在某个巨型数据中心内部。用户、企业、手机、汽车、机器人、工业设备等都可能成为AI服务的入口。请求产生之后,需要在终端、边缘节点、云端AI计算中心以及数据库之间不断传输数据。
这意味着AI网络流量正在从单纯的“数据中心内部高速传输”,逐渐变成更加广泛的“计算中心与用户之间的数据交换”。
RCR近期的分析也指出,随着分布式推理、Agentic AI和Physical AI的发展,部分计算任务会越来越靠近数据产生的位置。特别是实时语音、视频、自动驾驶、工业应用以及需要实时交互的AI代理,对网络延迟、可靠性和上行带宽都会提出更高要求。
这也是光纤压力开始增加的重要原因。
Agentic AI会进一步放大网络需求
传统聊天机器人往往是用户输入问题,模型处理之后返回答案,整个过程虽然需要大量算力,但数据交互模式相对简单。
Agentic AI则不一样。
AI代理需要获取数据、读取上下文、调用工具、访问数据库、执行任务,再根据执行结果继续推理。在一个复杂任务中,AI可能需要连续访问多个系统,而不是完成一次计算之后立即结束。
这会让AI应用产生更加频繁的数据交互。
Phil Wong认为,推理工作负载将推动高速、低延迟连接需求不断增长,而Agentic AI由于需要访问数据、上下文和记忆,会进一步增加传统云环境与专用AI计算资源之间的通信量。
更进一步,如果Physical AI大规模发展,推理流量还可能继续向网络边缘扩散。
例如机器人需要实时感知环境,自动驾驶系统需要快速处理摄像头和传感器数据,工业设备需要根据现场情况实时决策。这些应用无法完全依赖距离很远的中心数据中心完成所有计算,因为网络延迟本身就可能成为影响体验甚至系统安全的因素。
于是,AI计算会越来越分布式,网络也必须跟着变得更加分布式。
AI数据中心正在向传统区域之外扩张
另一个变化来自数据中心本身。
AI数据中心对电力和土地的需求远高于传统数据中心。当一个地区无法提供足够的电力或者合适的土地时,建设者就不得不寻找新的地点。
这意味着未来一些AI计算中心可能并不会位于传统的大城市和互联网核心区域。
计算中心搬到新的地方之后,问题并没有结束。GPU需要连接存储系统,需要连接其他数据中心,也需要连接云平台和用户。于是,新的AI数据中心往往还需要建设配套的中长途光纤网络。
这会给光纤运营商带来一个现实问题:新的线路可能需要穿越过去并不具备大量人口和企业客户的区域。
传统通信网络的建设逻辑通常比较容易理解,人口密集区、商业中心以及互联网交换中心天然具有更高的网络需求。但AI数据中心的选址逻辑越来越受到电力、土地和基础设施条件影响。
因此,未来可能出现一种新的网络建设模式:计算中心的位置决定了光纤线路必须延伸到哪里,而不是用户密度决定网络应该建设在哪里。
RCR的相关分析也指出,AI基础设施扩张正在带来新的中程和长途光纤需求,但运营商需要认真评估这些新线路的投资回报,因为部分线路可能并不会经过传统的人口和商业中心。
真正限制AI扩张的,不只是光纤
虽然光纤的重要性正在上升,但目前AI基础设施面临的最大现实约束其实仍然是电力。
Phil Wong认为,未来三到五年,可靠电力供应仍将是AI基础设施扩张最主要的限制因素,供应链延迟和劳动力不足也会进一步影响项目建设速度。
这几个因素实际上是互相影响的。
AI数据中心需要大量GPU,而GPU需要电力;大量GPU产生的计算能力又需要高速网络连接;网络扩张需要光模块、光纤、交换设备和施工资源;新的数据中心如果距离现有网络较远,还需要额外建设中程甚至长途光纤线路。
因此,AI基础设施已经不再是单独增加服务器这么简单。
它正在变成一个由电力、土地、GPU、存储、交换机、光模块、光纤和数据中心共同组成的庞大系统。任何一个环节出现瓶颈,都可能影响整个AI计算能力的释放。
光纤的价值正在从“连接”变成“算力基础设施”
过去很多人理解光纤,更多是把它看成一种通信线路。
但AI时代的光纤,其意义正在发生变化。
对于大型AI集群来说,高速光互连直接影响GPU之间的数据交换效率。对于分布式AI来说,光纤又承担着数据中心之间的连接任务。到了AI推理阶段,它还需要把计算能力进一步延伸到用户和边缘节点附近。
因此,未来光纤网络的重要性可能越来越接近电力基础设施。
近期行业分析已经开始关注400G、800G甚至1.6T光网络的发展方向,同时也更加重视确定性性能、能耗效率、网络遥测和自动化能力。
这也意味着,简单地“铺更多光纤”并不能完全解决问题。
运营商还需要考虑线路容量、光模块技术、网络架构、延迟、可靠性以及未来扩容能力。尤其当AI计算中心越来越分散之后,网络本身也需要具备更好的弹性。
AI产业早期拼的是GPU数量,随后开始拼数据中心规模和电力资源,而现在网络的重要性正在快速上升。
这并不意味着光纤马上会取代GPU成为AI产业最大的瓶颈,而是说明AI基础设施已经进入一个更加复杂的阶段。算力增加之后,必须有足够强大的网络把这些算力真正连接起来。
尤其是当AI应用从模型训练转向推理,从集中式云计算转向云边端协同,再进一步进入Agentic AI和Physical AI时代,网络承担的任务只会越来越重。
未来一座AI数据中心可能拥有成千上万甚至更多的GPU,但如果它没有足够的电力,没有高速互联,也没有可靠的长距离光纤连接,那么这些算力很难真正转化成用户能够感受到的AI能力。
所以,AI产业下一阶段值得关注的,不只有芯片和服务器。
藏在数据中心背后的光纤、光模块、交换机以及整个光网络体系,同样可能成为决定AI扩张速度的重要基础设施。
当AI开始从“集中训练”走向“无处不在的推理”,真正需要升级的,也将不只是计算中心,而是连接这些计算能力的整张网络。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:网络技术联盟站 wljslmz瑞哥
wljslmz瑞哥《GPU之后,AI基础设施的新瓶颈可能是光纤》