本文来自千家网(www.qianjia.com)。

随着生成式人工智能、大模型训练以及智能化应用快速普及,企业IT基础设施正在经历一场深刻变革。过去,网络主要承担用户访问应用、服务器之间的数据交换以及云服务连接等任务;而如今,AI工作负载正在重新定义计算、存储与网络之间的关系。
对于企业而言,一套高性能GPU集群的价值,并不仅仅取决于GPU数量和计算能力,更取决于支撑其运行的网络基础设施。如果网络无法提供足够的带宽、稳定的低延迟以及高效的数据交换能力,昂贵的AI算力资源可能无法得到充分利用。
AI时代,网络正在从传统的“连接基础设施”转变为“算力基础设施的重要组成部分”。综合布线系统、数据中心网络架构、高速以太网技术以及智能化运维能力,都将成为企业构建AI基础设施的重要支撑。
AI正在改变计算与网络之间的关系
传统企业网络主要围绕用户、应用服务器、数据库、互联网以及云平台之间的数据传输进行设计。网络规划通常关注服务器规模、访问数量、峰值流量以及应用响应时间。
然而,AI工作负载改变了这一逻辑。在大型AI模型训练过程中,计算任务通常被分布到数百甚至数千个GPU节点上。这些GPU不仅需要完成自身计算任务,还需要持续交换模型参数、梯度信息以及中间计算结果。
例如,在大语言模型训练过程中,多个GPU之间需要频繁同步模型参数(Model Parameters)、梯度数据(Gradients)、激活值(Activations)以及中间计算状态(Intermediate States)。这意味着网络性能将直接影响AI训练效率。
如果GPU之间的数据同步速度不足,即使GPU本身拥有强大的计算能力,也可能因为等待网络传输而处于空闲状态,导致算力资源浪费。因此,企业在建设AI基础设施时,需要重新评估网络能力,包括哪些业务需要高性能网络、需要多少带宽、如何降低通信延迟,以及网络投资是否能够真正提升GPU利用率。
AI工作负载带来全新的流量模型
AI应用最大的变化之一,是数据流量模式正在发生改变。
传统企业网络更多关注“南北向流量”(North-South Traffic),即用户访问数据中心、应用系统连接互联网以及云服务之间的数据交换。而AI基础设施更加依赖“东西向流量”(East-West Traffic),即服务器、GPU节点、存储系统以及AI计算集群之间的大规模内部通信。
不同类型的AI任务,对网络提出了不同要求。在AI训练场景中,通常采用多GPU并行计算模式,包括数据并行(Data Parallelism)、模型并行(Model Parallelism)、张量并行(Tensor Parallelism)、流水线并行(Pipeline Parallelism)以及专家并行(Expert Parallelism)等技术。
其中,数据并行模式下,每个GPU处理不同的数据样本,然后同步更新模型参数;而模型并行、张量并行等方式,则需要多个GPU共同完成同一个模型计算任务,因此GPU之间通信更加频繁。
这种通信模式具有三个明显特点:首先是高带宽需求。大量模型参数和计算数据需要在GPU之间快速交换。其次是高度同步性。多个GPU通常需要等待彼此完成通信后,才能进入下一阶段计算。第三是对延迟高度敏感。如果其中一个节点通信延迟增加,整个训练任务可能被迫等待。
因此,AI训练网络关注的并不仅仅是峰值带宽,而是在大量GPU同时通信情况下,网络是否仍然能够保持稳定性能。
AI推理对网络提出低延迟要求
相比模型训练,AI推理更加关注用户体验和服务响应速度。智能客服、AI搜索、工业视觉检测、自动驾驶以及企业知识助手等应用,都要求模型能够快速返回结果。
在推理场景中,企业需要关注两个关键指标:一是首Token时间(Time to First Token),即用户提交请求后,AI生成第一个结果所需要的时间。二是尾延迟(Tail Latency),即大量请求同时发生时,最慢部分请求的响应时间。
随着大型模型规模不断扩大,AI推理任务也正在从单服务器部署转向多GPU、多节点协同运行。
同时,RAG(检索增强生成)架构进一步增加了网络通信复杂度。用户请求可能需要经过AI模型、向量数据库、企业数据系统等多个环节,最终生成答案。因此,未来AI推理网络也将成为连接计算、数据和应用的重要基础设施。
从南北向网络走向东西向AI Fabric
传统数据中心网络通常采用三层架构:
- 接入层(Access)
- 汇聚层(Aggregation)
- 核心层(Core)
这种架构适合传统企业应用,因为大部分服务器之间通信需求有限,因此网络通常采用一定比例的超额订阅(Oversubscription)设计。
例如,服务器端拥有较高接入带宽,但多个服务器共享有限的上联链路,通过降低网络建设成本提升整体经济性。
然而,对于AI集群而言,这种方式面临明显挑战。当数百个GPU同时交换数据时,大量节点可能同时占用上联链路,造成严重网络拥塞,影响训练效率。
因此,AI数据中心正在逐渐采用更加扁平化的Leaf-Spine(叶脊网络)架构。在Leaf-Spine架构中服务器连接Leaf交换机;Leaf交换机连接多个Spine交换机;任意计算节点之间拥有多条通信路径。这种架构能够减少网络层级,提高东西向通信效率,并降低数据传输瓶颈。
未来,大规模AI集群还将进一步向无阻塞网络(Non-blocking Fabric)、高密度交换网络以及高速以太网Fabric方向发展。
AI时代需要“无损网络”保障GPU效率
传统企业网络允许一定程度的数据包丢失。当发生丢包时,TCP协议可以通过重新传输数据进行恢复,对于普通业务而言,只会增加一定延迟。
但对于AI训练集群而言,一个数据包延迟可能影响整个GPU集群。原因在于,分布式AI训练具有高度同步特点。如果某一个GPU等待网络通信完成,其他GPU也可能必须等待,最终导致GPU利用率下降。
因此,AI网络越来越强调Lossless Networking(无损网络)。需要注意的是,无损网络并不是完全消除网络拥塞,而是在发生拥塞时避免数据包丢失。
实现无损网络,需要综合应用:优先级流量控制(PFC),保障关键数据优先传输;显式拥塞通知(ECN),提前反馈网络拥塞状态;智能缓冲管理,避免交换设备缓存溢出;网络遥测(Telemetry),实时监控队列状态、丢包情况、延迟变化以及拥塞热点。
AI推动综合布线体系向高速化演进
AI数据中心的发展,也正在推动综合布线系统升级。传统数据中心可能以Cat6A、10GbE、25GbE网络为主,但AI算力中心正在快速迈向100GbE、200GbE、400GbE甚至800GbE。
未来,1.6TbE级别网络也可能逐步进入大型AI基础设施。这对物理基础设施提出更高要求。
首先,高速铜缆与光纤融合将成为趋势。短距离服务器连接可能采用DAC高速铜缆、AEC主动铜缆,而更长距离连接则需要依赖多模光纤(MMF)和单模光纤(SMF)。
其次,高密度机柜布线成为重要挑战。随着GPU服务器功耗持续提升,AI机柜密度快速增加,综合布线需要同时考虑更高端口密度;更优化的线缆管理;更合理的散热设计;更便捷的维护升级。
此外,AI基础设施生命周期通常超过5年,因此网络建设不能只满足当前需求,还需要考虑未来交换设备升级、光模块演进以及算力规模扩展。
企业如何建设AI Ready网络?
对于企业而言,建设AI网络不能简单依靠采购高速交换设备,而需要从业务需求出发进行整体规划。
首先,需要明确AI工作负载类型。大型模型训练、企业模型微调、AI推理服务以及边缘AI应用,对网络需求完全不同。
其次,需要分析计算、存储和应用之间的数据路径。企业需要明确GPU部署位置、数据存储位置、模型调用方式以及推理服务是否分布式部署,从而确定网络架构。
第三,需要合理规划网络容量。重点关注单服务器网络连接能力;GPU节点通信需求;存储吞吐能力;上联带宽;超额订阅比例及网络冗余能力。
同时,AI流量具有明显突发特点,因此网络设计需要预留足够扩展空间,包括带宽余量、端口资源、光纤资源以及机柜空间。
最后,企业需要提升网络运维能力。AI网络复杂度远高于传统网络,需要建设自动化配置、网络可观测、智能故障分析以及AIOps运维体系。通过关联网络状态、GPU利用率以及AI任务性能,企业才能真正优化算力效率。
结语:网络正在成为AI时代的核心竞争力
过去,企业竞争关注的是“拥有多少服务器”。未来,竞争力将更多取决于“能否让计算资源高效协同”。AI正在推动企业网络从传统连接体系向高性能计算网络演进。
对于数据中心建设者、综合布线企业以及网络设备厂商而言,未来竞争重点将不再只是提供更高速率的链路,而是构建具备高带宽;低延迟;高可靠;可扩展;智能运维能力的新一代AI基础设施。
在AI时代,网络已经不再是计算背后的辅助系统,而正在成为释放算力价值、提升AI应用效率的关键基础设施。
