中原证券报告对DeepSeek的技术突破进行了深度解读。DeepSeek-V3通过MLA和MoE架构减少算力消耗,在训练架构上展现强大的软硬协同优化能力——FP8混合精度训练框架、DualPipe算法、跨节点All-to-All通信内核等系列创新。在带宽和显存落后的H800上,DeepSeek实现了较英伟达H200 151%的推理性能超越。训练成本仅为GPT-4o的二十分之一,DeepSeek开创了大模型发展的新范式。
MLA+MoE架构创新,算力消耗大幅降低
DeepSeek-V3模型架构中减少算力消耗的两个关键点均来自架构层面的创新。
多头潜注意力机制首次在V2中引入,通过对传统多头注意力机制的改进,将低秩近似方法引入键值缓存压缩,大概贡献了2-4倍的计算效率提升。传统多头注意力的KVCache较大,DeepSeek通过压缩技术显著降低了显存占用和计算开销。
DeepSeekMoE架构对传统MoE架构进行改进,贡献了4倍以上的计算效率提升。V3总参数6710亿,但每个Token仅激活370亿参数。相比传统MoE,DeepSeek使用专家数量大幅提升,并通过无辅助损失的负载平衡策略提高训练稳定性,实现更高的训练效率。V3训练基于自研HAI-LLM框架,在模型架构之外展现出软硬协同优化能力,成为超越其他大模型团队的关键。
多头潜注意力机制首次在V2中引入,通过对传统多头注意力机制的改进,将低秩近似方法引入键值缓存压缩,大概贡献了2-4倍的计算效率提升。传统多头注意力的KVCache较大,DeepSeek通过压缩技术显著降低了显存占用和计算开销。
DeepSeekMoE架构对传统MoE架构进行改进,贡献了4倍以上的计算效率提升。V3总参数6710亿,但每个Token仅激活370亿参数。相比传统MoE,DeepSeek使用专家数量大幅提升,并通过无辅助损失的负载平衡策略提高训练稳定性,实现更高的训练效率。V3训练基于自研HAI-LLM框架,在模型架构之外展现出软硬协同优化能力,成为超越其他大模型团队的关键。
FP8混合精度训练,首个成功案例
FP8虽然可以提升计算速度和降低存储需求,但由于计算精度不高容易损失数据信息。DeepSeek结合自身在GPU硬件架构和训练误差方面的强大整合分析能力,专门设计出针对FP8的训练框架体系。
DeepSeek将大多数计算密集型操作在FP8中进行,而一些关键操作保持原有数据格式,兼顾了训练效率和稳定性。DeepSeek成为首个成功使用FP8混合精度训练超大规模大模型的公司。FP8训练框架的突破意味着在同等硬件条件下可以实现更高的训练效率,对于受GPU供应限制的国内AI产业具有特殊意义。
DeepSeek将大多数计算密集型操作在FP8中进行,而一些关键操作保持原有数据格式,兼顾了训练效率和稳定性。DeepSeek成为首个成功使用FP8混合精度训练超大规模大模型的公司。FP8训练框架的突破意味着在同等硬件条件下可以实现更高的训练效率,对于受GPU供应限制的国内AI产业具有特殊意义。
DualPipe算法与通信优化,隐藏通信开销
DualPipe算法实现高效的流水线并行,通过计算和通信的重叠,隐藏了大模型训练中的大部分通信开销。该算法规避了单个服务器中8个GPU共享一个IB NIC流水线并行期间出现的网络带宽竞争。在代表8个GPU的流水线并行中,不同任务的穿插计算使"气泡时间"得到极大压缩。
跨节点All-to-All通信内核使用PTX编程,充分利用节点间InfiniBand和NVLink带宽。对显存分配进行优化,无需使用昂贵的张量并行即可完成训练。DeepSeek通过破译英伟达后台指令并巧妙使用,极致优化了算法性能。
跨节点All-to-All通信内核使用PTX编程,充分利用节点间InfiniBand和NVLink带宽。对显存分配进行优化,无需使用昂贵的张量并行即可完成训练。DeepSeek通过破译英伟达后台指令并巧妙使用,极致优化了算法性能。
H800性能超越H200达151%
英伟达在2月25日公布8张H200和B200节点的R1推理吞吐分别为5899 tokens/s和21088 tokens/s。DeepSeek通过算法优化,在显存(80GB vs 141GB)和带宽(2TB/s vs 4.8TB/s)远不及H200的情况下,单节点平均输出吞吐达8575 tokens/s,实现了对H200 151%的性能超越。
在训练方面,DeepSeek-V3用2048张H800,总训练GPU卡时278.8万小时。Grok-3累计训练时长达2亿GPU小时,是DeepSeek-V3的约72倍。DeepSeek-V3性能比肩GPT-4o,验证了精细化训练路径的有效性。
在训练方面,DeepSeek-V3用2048张H800,总训练GPU卡时278.8万小时。Grok-3累计训练时长达2亿GPU小时,是DeepSeek-V3的约72倍。DeepSeek-V3性能比肩GPT-4o,验证了精细化训练路径的有效性。
| 技术领域 | 创新点 | 效率提升 |
|---|---|---|
| 模型架构 | 多头潜注意力(MLA) | 2-4倍计算效率 |
| 模型架构 | DeepSeekMoE | 4倍以上计算效率 |
| 训练框架 | FP8混合精度训练 | 首个超大规模FP8模型 |
| 训练架构 | DualPipe算法 | 隐藏大部分通信开销 |
| 推理优化 | 软硬协同优化 | H800性能超H200 151% |
精细化路线引领大模型发展方向
从目前大模型能力构建路径来看大致分为两类:一是通过精细化模型和软硬件结合的训练架构,实现较低算力消耗下的模型能力建设,DeepSeek展现出超强能力和开创性;二是通过大算力投入带动整体模型能力提升,xAI的Grok-3证明了堆算力路径暂时有效。
无论从经济性还是能源消耗来看,简单依靠大力出奇迹的发展路径瓶颈都显而易见。DeepSeek所处的精细化处理发展路径,给后续大模型应用推广和能力提升创造了更多发展空间。结合中国在互联网应用、数据积累和工程师团队方面的优势,在底层模型能力实现突破后,中国在AI应用发展上有望实现全球领先。
无论从经济性还是能源消耗来看,简单依靠大力出奇迹的发展路径瓶颈都显而易见。DeepSeek所处的精细化处理发展路径,给后续大模型应用推广和能力提升创造了更多发展空间。结合中国在互联网应用、数据积累和工程师团队方面的优势,在底层模型能力实现突破后,中国在AI应用发展上有望实现全球领先。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共54套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
信息技术
25页
1张图表
0731-84720580
商务合作:really158d
微信扫码登录
手机快捷登录
账号登录