您的当前位置:首页 > 标签 > DeepSeek技术突破解读
【中原证券】计算机行业深度分析:三大要素齐发力,AI应用步入全面加速期-250307(25页).pdf
DeepSeek技术突破解读:FP8混合精度与DualPipe算法,H800性能超H200达151%|中原证券
中原证券详解DeepSeek技术突破,FP8混合精度训练与DualPipe算法使H800推理性能超H200达151%,训练成本仅为GPT-4o的1/20,DeepSeek技术突破的底层逻辑。
 2026-07-30
 信息技术
 25页
1张图表
数据来源:
【中原证券】计算机行业深度分析:三大要素齐发力,AI应用步入全面加速期-250307(25页) 查看报告
中原证券报告对DeepSeek的技术突破进行了深度解读。DeepSeek-V3通过MLA和MoE架构减少算力消耗,在训练架构上展现强大的软硬协同优化能力——FP8混合精度训练框架、DualPipe算法、跨节点All-to-All通信内核等系列创新。在带宽和显存落后的H800上,DeepSeek实现了较英伟达H200 151%的推理性能超越。训练成本仅为GPT-4o的二十分之一,DeepSeek开创了大模型发展的新范式。

MLA+MoE架构创新,算力消耗大幅降低

DeepSeek-V3模型架构中减少算力消耗的两个关键点均来自架构层面的创新。

多头潜注意力机制首次在V2中引入,通过对传统多头注意力机制的改进,将低秩近似方法引入键值缓存压缩,大概贡献了2-4倍的计算效率提升。传统多头注意力的KVCache较大,DeepSeek通过压缩技术显著降低了显存占用和计算开销。

DeepSeekMoE架构对传统MoE架构进行改进,贡献了4倍以上的计算效率提升。V3总参数6710亿,但每个Token仅激活370亿参数。相比传统MoE,DeepSeek使用专家数量大幅提升,并通过无辅助损失的负载平衡策略提高训练稳定性,实现更高的训练效率。V3训练基于自研HAI-LLM框架,在模型架构之外展现出软硬协同优化能力,成为超越其他大模型团队的关键。

FP8混合精度训练,首个成功案例

FP8虽然可以提升计算速度和降低存储需求,但由于计算精度不高容易损失数据信息。DeepSeek结合自身在GPU硬件架构和训练误差方面的强大整合分析能力,专门设计出针对FP8的训练框架体系。

DeepSeek将大多数计算密集型操作在FP8中进行,而一些关键操作保持原有数据格式,兼顾了训练效率和稳定性。DeepSeek成为首个成功使用FP8混合精度训练超大规模大模型的公司。FP8训练框架的突破意味着在同等硬件条件下可以实现更高的训练效率,对于受GPU供应限制的国内AI产业具有特殊意义。

DualPipe算法与通信优化,隐藏通信开销

DualPipe算法实现高效的流水线并行,通过计算和通信的重叠,隐藏了大模型训练中的大部分通信开销。该算法规避了单个服务器中8个GPU共享一个IB NIC流水线并行期间出现的网络带宽竞争。在代表8个GPU的流水线并行中,不同任务的穿插计算使"气泡时间"得到极大压缩。

跨节点All-to-All通信内核使用PTX编程,充分利用节点间InfiniBand和NVLink带宽。对显存分配进行优化,无需使用昂贵的张量并行即可完成训练。DeepSeek通过破译英伟达后台指令并巧妙使用,极致优化了算法性能。

H800性能超越H200达151%

英伟达在2月25日公布8张H200和B200节点的R1推理吞吐分别为5899 tokens/s和21088 tokens/s。DeepSeek通过算法优化,在显存(80GB vs 141GB)和带宽(2TB/s vs 4.8TB/s)远不及H200的情况下,单节点平均输出吞吐达8575 tokens/s,实现了对H200 151%的性能超越。

在训练方面,DeepSeek-V3用2048张H800,总训练GPU卡时278.8万小时。Grok-3累计训练时长达2亿GPU小时,是DeepSeek-V3的约72倍。DeepSeek-V3性能比肩GPT-4o,验证了精细化训练路径的有效性。
DeepSeek关键技术创新汇总
技术领域创新点效率提升
模型架构多头潜注意力(MLA)2-4倍计算效率
模型架构DeepSeekMoE4倍以上计算效率
训练框架FP8混合精度训练首个超大规模FP8模型
训练架构DualPipe算法隐藏大部分通信开销
推理优化软硬协同优化H800性能超H200 151%

精细化路线引领大模型发展方向

从目前大模型能力构建路径来看大致分为两类:一是通过精细化模型和软硬件结合的训练架构,实现较低算力消耗下的模型能力建设,DeepSeek展现出超强能力和开创性;二是通过大算力投入带动整体模型能力提升,xAI的Grok-3证明了堆算力路径暂时有效。

无论从经济性还是能源消耗来看,简单依靠大力出奇迹的发展路径瓶颈都显而易见。DeepSeek所处的精细化处理发展路径,给后续大模型应用推广和能力提升创造了更多发展空间。结合中国在互联网应用、数据积累和工程师团队方面的优势,在底层模型能力实现突破后,中国在AI应用发展上有望实现全球领先。
客服
商务合作
小程序
服务号
折叠