您的当前位置:首页 > 标签 > Ascend 950DT NPU算力
华为:2026年Atlas 650E 服务器技术白皮书(92页).pdf
Ascend 950DT NPU算力详解:单颗243 TFLOPs HF32,整机3.888 PFLOPs FP16,片上内存96GB|华为
华为Ascend 950DT NPU算力规格详解——单颗HF32 243 TFLOPs、FP16 486 TFLOPs、FP8 919 TFLOPs,片上内存96GB带宽4.0TB/s,Atlas 650E整机8颗NPU提供3.888PFLOPs算力。
 2026-07-29
 计算机产业
 92页
53张图表
数据来源:
华为:2026年Atlas 650E 服务器技术白皮书(92页) 查看报告
单颗Ascend 950DT NPU提供243 TFLOPs HF32算力、486 TFLOPs FP16算力、919 TFLOPs FP8算力,8颗NPU整机FP16算力达3.888 PFLOPs——华为自研Ascend 950DT是Atlas 650E服务器的AI算力核心。本文详解其算力规格、片上内存架构、互联带宽与整机配置。

Ascend 950DT算力规格

Ascend 950DT是华为自研的高性能通用NPU计算芯片,面向大模型训练与推理场景。单颗处理器支持多种精度格式的算力规格如下:HF32总算力243/212 TFLOPs(Cube 216.3/189.2 TFLOPs + Vector 27/23.7 TFLOPs);FP16/BF16总算力486/425 TFLOPs;FP8/HiF8/mxF8总算力919/804 TFLOPs;INT8总算力919/804 TFLOPs;mxFP4总算力1784/1561 TFLOPs。
整机配置8颗Ascend 950DT NPU模组,整机算力规格:FP16/BF16总算力3.888/3.400 PFLOPs;INT8总算力7.352/6.432 POPS;mxFP4总算力14.274/12.488 PFLOPs。算力为稳定提供的峰值稠密算力,实测可能存在1%误差。

片上内存与带宽规格

片上内存是Ascend 950DT的关键性能指标之一。单模组最大支持84GB或96GB配置:当片上内存为84GB时,带宽速率最大为3.5TB/s;当片上内存为96GB时,带宽速率最大为4.0TB/s。8颗NPU模组共提供最高768GB片上内存,总带宽最高达32TB/s,为大模型训练中的大规模并行计算提供充足的高速缓存支持。

NPU互联架构

每个NPU模组支持15个UB端口和1个参数面端口。框内互联方面,每个NPU通过7个UB端口与其他NPU互联,实现8个NPU FullMesh全互联拓扑,确保框内任意两颗NPU之间通信只需一跳。出框互联方面,每个NPU通过8个UB端口与其他NPU互联,跨框采用光互连。
单机场景框内8个NPU模组采用FullMesh结构,NPU互联理论带宽达到ALL to ALL双向784GB/s(7×112GB/s)。双机场景NPU互联理论总带宽达8×1.68TB/s(双向),显著提升跨服务器通信能力。

NPU模组硬件设计

NPU模组是以高性能通用NPU计算芯片为核心的高密高功耗基础AI硬件单元,采用54V DC供电。主要集成1颗NPU芯片和电源、时钟、Flash芯片、低速连接器、高速连接器等部件。高速信号通过10个Luna连接器对外引出,然后通过CableTray线缆模组或光笼子线缆与其他NPU芯片、CPU芯片或光模块连接实现高速信号交互。
NPU模组在服务器内部的编号为1~8,其中A1槽位(底层)NPU抽屉对应1/2/3/4,A2槽位(上层)NPU抽屉对应5/6/7/8,NPU5相对位置在NPU1正上方。每个NPU模组配备模组导风罩、散热器和散热齿,通过风冷实现高效散热。
客服
商务合作
小程序
服务号
折叠