您的当前位置:首页 > 标签 > GPUDirect RDMA技术
先进计算产业发展联盟:2026基于国产GPU算力平台的低时延通信技术研究报告(90页).pdf
GPUDirect RDMA技术:国产GPU绕过CPU实现微秒级通信,64B小消息延迟从150μs降至1.2μs|国产算力平台
GPUDirect RDMA技术允许GPU直接与网络设备交换数据,绕过CPU和系统内存。国产GPU平台实测64B小消息延迟从150μs降至1.2μs,整机柜聚合带宽超400GB/s。
 2026-07-30
 计算机产业
 90页
36张图表
数据来源:
先进计算产业发展联盟:2026基于国产GPU算力平台的低时延通信技术研究报告(90页) 查看报告
传统TCP/IP通信模式下,GPU间数据传输需经过CPU和系统内存中转,64B小消息延迟高达150μs——这已成为分布式AI训练的显著瓶颈。GPUDirect RDMA技术通过允许GPU直接与网络设备交换数据、绕过CPU和系统主存,将国产GPU平台的64B小消息延迟降至1.2μs左右,性能提升超100倍。本报告系统解析了GPUDirect技术的四阶段演进、GPUDirect RDMA在国产平台上的实现路径,以及其在AI大模型分布式训练中的关键价值。

GPUDirect技术四阶段演进

GPUDirect是NVIDIA最早开发的一项技术,可实现GPU与其他设备(网络接口卡、存储设备)之间的直接通信和数据传输,而不涉及CPU。技术发展经历了四个阶段:
2010年,GPUDirect Shared Memory支持GPU与网卡、存储等设备共享内存。2011年,NVIDIA推出GPUDirect P2P(Peer-to-Peer),支持同一PCIe或NVLink总线上的GPU之间的内存访问。2012年底,GPUDirect RDMA完美解决了计算集群节点间GPU卡PCIe总线的通信问题。如今,GPUDirect技术已形成包括GPUDirect P2P、GPUDirect RDMA、GPUDirect Storage和GPUDirect Video四组重要技术的完整组合。
国产化适配挑战在于:国产GPU需设计兼容的互连拓扑结构(如类似NVLink的高速接口),需优化驱动层对P2P的支持,确保多GPU协作时的内存一致性。

GPUDirect RDMA——绕过CPU的微秒级通信

GPUDirect RDMA被设计用来支持GPU间快速跨机通信。在传统的TCP/IP网络通信中,数据发送方需要将数据进行多次内存拷贝,并经过一系列网络协议的数据包处理工作,服务器间的通信时延往往在毫秒级别。
GPUDirect RDMA允许外围PCIe设备直接访问GPU显存,通过零拷贝和内核旁路两种途径达到高性能的远程直接数据存取。其核心优势包括:零拷贝——应用程序直接执行数据传输,数据无需被复制到网络层;内核旁路——应用程序直接在用户态执行数据传输,无需在内核态与用户态间做上下文切换;不需要CPU干预——应用程序可访问远程主机内存而不消耗远程主机中的任何CPU。
在GPU大规模集群Scale Out组网中,GPUDirect RDMA结合了GPU加速计算和RDMA技术,实现了在GPU和RDMA网络设备之间直接进行数据传输和通信的能力,显著降低传输延迟,加快数据交换速度,释放CPU计算能力。

国产平台实测——从150μs到1.2μs

在本报告设计的低时延架构中,数据流路径被极大缩短。传统TCP/IP模式下,GPU完成梯度计算后需将数据拷贝至系统内存,CPU读取后按TCP/IP协议封装打包,经网卡发送,接收端CPU解析拆解后再拷贝至本地GPU。整个链路层级多、数据流转路径长,64B小消息通信延迟约150μs,1MB大消息约200μs。
优化后的GPUDirect RDMA路径:AI框架调用优化后的集合通信库,通信库获取待同步梯度数据在GPU显存中的物理地址;云豹智能网卡利用RDMA引擎直接从源端GPU显存读取数据,封装成RoCEv2报文发送;目标节点网卡接收数据并直接写入目标GPU指定显存区域。整个过程无需CPU介入、无系统内存拷贝,64B小消息通信延迟降至1.2μs左右,1MB大消息降至5μs左右。
测试数据显示,基于昆仑芯P800+云豹智能网卡+国产交换机的4台计算节点整机柜,16对测试进程对32张AI加速卡进行RDMA读写测试,两组节点测试带宽分别为203GB/s和224GB/s,整机柜聚合带宽超427GB/s。
客服
商务合作
小程序
服务号
折叠