传统TCP/IP通信模式下,GPU间数据传输需经过CPU和系统内存中转,64B小消息延迟高达150μs——这已成为分布式AI训练的显著瓶颈。GPUDirect RDMA技术通过允许GPU直接与网络设备交换数据、绕过CPU和系统主存,将国产GPU平台的64B小消息延迟降至1.2μs左右,性能提升超100倍。本报告系统解析了GPUDirect技术的四阶段演进、GPUDirect RDMA在国产平台上的实现路径,以及其在AI大模型分布式训练中的关键价值。
GPUDirect技术四阶段演进
GPUDirect是NVIDIA最早开发的一项技术,可实现GPU与其他设备(网络接口卡、存储设备)之间的直接通信和数据传输,而不涉及CPU。技术发展经历了四个阶段:
2010年,GPUDirect Shared Memory支持GPU与网卡、存储等设备共享内存。2011年,NVIDIA推出GPUDirect P2P(Peer-to-Peer),支持同一PCIe或NVLink总线上的GPU之间的内存访问。2012年底,GPUDirect RDMA完美解决了计算集群节点间GPU卡PCIe总线的通信问题。如今,GPUDirect技术已形成包括GPUDirect P2P、GPUDirect RDMA、GPUDirect Storage和GPUDirect Video四组重要技术的完整组合。
国产化适配挑战在于:国产GPU需设计兼容的互连拓扑结构(如类似NVLink的高速接口),需优化驱动层对P2P的支持,确保多GPU协作时的内存一致性。
2010年,GPUDirect Shared Memory支持GPU与网卡、存储等设备共享内存。2011年,NVIDIA推出GPUDirect P2P(Peer-to-Peer),支持同一PCIe或NVLink总线上的GPU之间的内存访问。2012年底,GPUDirect RDMA完美解决了计算集群节点间GPU卡PCIe总线的通信问题。如今,GPUDirect技术已形成包括GPUDirect P2P、GPUDirect RDMA、GPUDirect Storage和GPUDirect Video四组重要技术的完整组合。
国产化适配挑战在于:国产GPU需设计兼容的互连拓扑结构(如类似NVLink的高速接口),需优化驱动层对P2P的支持,确保多GPU协作时的内存一致性。
GPUDirect RDMA——绕过CPU的微秒级通信
GPUDirect RDMA被设计用来支持GPU间快速跨机通信。在传统的TCP/IP网络通信中,数据发送方需要将数据进行多次内存拷贝,并经过一系列网络协议的数据包处理工作,服务器间的通信时延往往在毫秒级别。
GPUDirect RDMA允许外围PCIe设备直接访问GPU显存,通过零拷贝和内核旁路两种途径达到高性能的远程直接数据存取。其核心优势包括:零拷贝——应用程序直接执行数据传输,数据无需被复制到网络层;内核旁路——应用程序直接在用户态执行数据传输,无需在内核态与用户态间做上下文切换;不需要CPU干预——应用程序可访问远程主机内存而不消耗远程主机中的任何CPU。
在GPU大规模集群Scale Out组网中,GPUDirect RDMA结合了GPU加速计算和RDMA技术,实现了在GPU和RDMA网络设备之间直接进行数据传输和通信的能力,显著降低传输延迟,加快数据交换速度,释放CPU计算能力。
GPUDirect RDMA允许外围PCIe设备直接访问GPU显存,通过零拷贝和内核旁路两种途径达到高性能的远程直接数据存取。其核心优势包括:零拷贝——应用程序直接执行数据传输,数据无需被复制到网络层;内核旁路——应用程序直接在用户态执行数据传输,无需在内核态与用户态间做上下文切换;不需要CPU干预——应用程序可访问远程主机内存而不消耗远程主机中的任何CPU。
在GPU大规模集群Scale Out组网中,GPUDirect RDMA结合了GPU加速计算和RDMA技术,实现了在GPU和RDMA网络设备之间直接进行数据传输和通信的能力,显著降低传输延迟,加快数据交换速度,释放CPU计算能力。
国产平台实测——从150μs到1.2μs
在本报告设计的低时延架构中,数据流路径被极大缩短。传统TCP/IP模式下,GPU完成梯度计算后需将数据拷贝至系统内存,CPU读取后按TCP/IP协议封装打包,经网卡发送,接收端CPU解析拆解后再拷贝至本地GPU。整个链路层级多、数据流转路径长,64B小消息通信延迟约150μs,1MB大消息约200μs。
优化后的GPUDirect RDMA路径:AI框架调用优化后的集合通信库,通信库获取待同步梯度数据在GPU显存中的物理地址;云豹智能网卡利用RDMA引擎直接从源端GPU显存读取数据,封装成RoCEv2报文发送;目标节点网卡接收数据并直接写入目标GPU指定显存区域。整个过程无需CPU介入、无系统内存拷贝,64B小消息通信延迟降至1.2μs左右,1MB大消息降至5μs左右。
测试数据显示,基于昆仑芯P800+云豹智能网卡+国产交换机的4台计算节点整机柜,16对测试进程对32张AI加速卡进行RDMA读写测试,两组节点测试带宽分别为203GB/s和224GB/s,整机柜聚合带宽超427GB/s。
优化后的GPUDirect RDMA路径:AI框架调用优化后的集合通信库,通信库获取待同步梯度数据在GPU显存中的物理地址;云豹智能网卡利用RDMA引擎直接从源端GPU显存读取数据,封装成RoCEv2报文发送;目标节点网卡接收数据并直接写入目标GPU指定显存区域。整个过程无需CPU介入、无系统内存拷贝,64B小消息通信延迟降至1.2μs左右,1MB大消息降至5μs左右。
测试数据显示,基于昆仑芯P800+云豹智能网卡+国产交换机的4台计算节点整机柜,16对测试进程对32张AI加速卡进行RDMA读写测试,两组节点测试带宽分别为203GB/s和224GB/s,整机柜聚合带宽超427GB/s。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
计算机产业
90页
36张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录