您的当前位置:首页 > 标签 > InfiniBand与RoCEv2网络对比
AIDC行业专题报告:国内智算中心建设提速重视产业链相关机遇-250313(19页).pdf
2026InfiniBand与RoCEv2网络对比:万卡集群vs千卡集群,智算网络方案选择|甬兴证券
甬兴证券对比InfiniBand与RoCEv2网络方案:InfiniBand支持万卡集群(端到端时延更低),RoCEv2支持千卡集群(成本更低),NVIDIA/华为/新华三等供应商格局,智算中心网络架构演进。
 2026-07-29
 AI产业
 19页
1张图表
数据来源:
AIDC行业专题报告:国内智算中心建设提速重视产业链相关机遇-250313(19页) 查看报告
AI大模型训练对网络提出了超大规模组网、超高带宽、超低时延及抖动、超高稳定性的要求。甬兴证券研究报告对比了智算中心两大主流网络方案——InfiniBand和RoCEv2。InfiniBand支持单集群万卡GPU规模且保证整体性能不下降,端到端时延更低,但成本较高,供应商以NVIDIA为主。RoCEv2支持千卡规模,通用性强、价格相对较低,华为、新华三等国内厂商主导。两种方案各有适用场景,共同支撑AIDC网络架构升级。

AI大模型对网络的要求——超大规模、超高带宽、超低时延

AI大模型训练对网络提出四高要求:超大规模组网——训练超大模型需要数千GPU组成的集群;超高带宽——网络需求从传统云计算的10-100Gbps提升至100-400Gbps;超低时延及抖动——网络变化因素引入的时延抖动对训练效率产生显著影响;超高稳定性——分布式训练系统的整体算力并非随着节点增加而线性增长,存在加速比且小于1,网络稳定性直接影响算力利用率。RDMA(远程直接内存访问)是降低多机多卡间端到端通信时延的关键技术,当前主要采用InfiniBand和RoCEv2两种方案。

InfiniBand网络方案——原生无损,万卡扩展

InfiniBand网络由Subnet Manager(SM)、InfiniBand网卡、InfiniBand交换机和连接线缆组成。核心优势包括:原生无损网络——采用基于credit信令机制从根本上避免缓冲区溢出丢包;万卡扩展能力——Adaptive Routing基于逐包的动态路由,在超大规模组网情况下保证网络最优利用。InfiniBand网络设备供应商主要包括NVIDIA、Intel、Cisco、Hewlett Packard Enterprise,其中NVIDIA在市场占据主导地位。InfiniBand在业务性能、业务规模和运维成熟度上均优于RoCEv2,是追求极致性能的超大规模智算集群的首选方案。

RoCEv2网络方案——通用性强,成本优势明显

RoCEv2网络是纯分布式的网络,由支持RoCEv2的网卡和交换机组成,一般情况下是两层架构。核心优势包括:通用性强——除用于构建高性能RDMA网络外,还可以在传统的以太网络中使用;价格相对较低——InfiniBand交换机的成本要比以太交换机高。但在交换机上的Headroom、PFC、ECN相关参数的配置比较复杂,在万卡超大规模场景下整个网络的吞吐性能较InfiniBand网络要弱一些。RoCE网络设备供应商主要包括华为、新华三等国内厂商,支持RoCE的网卡当前市场占有率较高的是NVIDIA的ConnectX系列。

两种方案的适用场景选择

具体到实际业务场景,RoCEv2是足够的方案,InfiniBand是特别好的方案。业务性能上,InfiniBand端到端时延小于RoCEv2,但RoCEv2的性能也能满足绝大部分智算场景的业务性能要求。业务规模上,InfiniBand能支持单集群万卡GPU规模且保证整体性能不下降,RoCEv2网络能在单集群支持千卡规模且整体网络性能也无太大降低。业务运维上,InfiniBand较RoCEv2更成熟,包括多租户隔离能力、运维诊断能力等。业务成本上,InfiniBand的成本要高于RoCEv2。供应商选择上,InfiniBand以NVIDIA为主,RoCEv2供应商较多(华为、新华三等)。大型互联网云厂商倾向于混合使用两种方案,关键训练集群用InfiniBand,推理和一般业务用RoCEv2。

数据中心网络架构演进——传统三级→Clos组网→直连拓扑

数据中心网络架构正在向适配AI大模型训练需求的方向演进。传统三级网络架构分为接入层、汇聚层、核心层,适应早期数据中心南北向流量。Clos组网架构(Fat-Tree胖树架构与Spine-Leaf叶脊架构)适应数据中心东西流量需求,是当前智算中心网络主流。直连拓扑组网架构网络直径短、低成本、端到端通信跳数少,是超算中心主流。无阻塞网络设计的关键是采用Fat-Tree网络架构,交换机下联上联带宽采用1:1无收敛设计,实现全端口无阻塞转发。
InfiniBand与RoCEv2方案对比
对比维度InfiniBandRoCEv2
业务性能端到端时延更低满足绝大部分场景
业务规模万卡集群千卡集群
业务运维更成熟配置较复杂
业务成本较高较低
主要供应商NVIDIA为主华为、新华三等

投资建议

InfiniBand和RoCEv2网络方案的竞争将带动相关产业链发展。InfiniBand方案利好NVIDIA生态相关的网络设备和连接器件供应商;RoCEv2方案利好国内以太网交换机厂商(中兴通讯、紫光股份、锐捷网络)和光模块厂商(中际旭创、光迅科技)。高性能交换机的核心是转发芯片,博通Tomahawk系列芯片是当前市场主流,国内盛科通信等厂商正加速国产替代。建议关注在网络架构升级中受益的交换机和光连接环节。
客服
商务合作
小程序
服务号
折叠