财通证券研究报告深度解析了DeepSeek于2025年2月24日至28日开展的开源周。五天时间,DeepSeek连续开源了FlashMLA、DeepEP、DeepGEMM、DualPipe与EPLB优化并行策略、3FS并行文件系统六大代码库,覆盖训练、推理、通信、负载均衡及数据加速的全链路。开源周结束后第6天,DeepSeek进一步发布V3/R1推理系统概述,披露了高达545%的理论成本利润率。这一系列开源动作不仅展示了DeepSeek在AI基础设施层面的工程能力,更通过极致的开源精神向全球开发者社区释放了巨大的技术红利。
开源周全景:五天六弹,全链路技术覆盖
DeepSeek开源周自2月24日启动,连续五天每天开源一个核心技术项目。第一天发布FlashMLA——专为Hopper架构打造的高效MLA解码器,可高效处理变长序列,优化内存管理。第二天发布DeepEP——首个为MoE量身定制的灵活GPU资源控制通信库。第三天推出DeepGEMM——支持稠密和MoE模型的FP8计算库,核心逻辑仅约300行代码。第四天推出优化并行策略,包括DualPipe双向流水线并行算法和EPLB专家并行负载均衡工具。第五天发布3FS并行文件系统和轻量化数据处理工具Smallpond。开源周结束后第6天,DeepSeek又惊喜发布V3/R1推理系统概述文档。
在GitHub上,这些开源项目累计获得星星数量接近2.8万颗。从技术栈来看,DeepSeek此次开源覆盖了从硬件底层优化(FlashMLA的PTX级调优)、通信层(DeepEP的RDMA优化)、计算层(DeepGEMM的FP8矩阵乘法)、并行策略层(DualPipe和EPLB)到数据存储层(3FS)的完整技术栈。这种全链路、系统级的开源策略在AI行业中极为罕见,体现了DeepSeek“没有象牙塔,只有纯粹的车库创业精神”的开源理念。
在GitHub上,这些开源项目累计获得星星数量接近2.8万颗。从技术栈来看,DeepSeek此次开源覆盖了从硬件底层优化(FlashMLA的PTX级调优)、通信层(DeepEP的RDMA优化)、计算层(DeepGEMM的FP8矩阵乘法)、并行策略层(DualPipe和EPLB)到数据存储层(3FS)的完整技术栈。这种全链路、系统级的开源策略在AI行业中极为罕见,体现了DeepSeek“没有象牙塔,只有纯粹的车库创业精神”的开源理念。
FlashMLA:榨取Hopper GPU极致性能
FlashMLA是DeepSeek专为英伟达Hopper GPU开发的高效MLA解码内核,特别针对变长序列进行了优化。MLA(多头潜在注意力)是DeepSeek在DeepSeek-V2及后续模型中引入的核心技术,通过低秩近似方法将每次查询所需的KV缓存减少了约93.3%。FlashMLA在此基础上进一步优化了MLA解码和分页KV缓存管理,支持BF16精度和块大小为64的分页KV缓存。
经实测,在H800 SXM5平台(CUDA 12.8)上,FlashMLA在内存受限配置下可达到最高3000GB/s的带宽,在计算受限配置下可达到580TFLOPS的峰值性能。作为对比,H800 SXM5的峰值内存带宽为3.35TB/s,峰值算力为990TFLOPS。FlashMLA将H800的内存带宽利用率推至近90%,计算性能利用率达58.6%。网友评价道:“向工程团队致以崇高的敬意,从Hopper的张量核中挤出了每一个FLOP”。
经实测,在H800 SXM5平台(CUDA 12.8)上,FlashMLA在内存受限配置下可达到最高3000GB/s的带宽,在计算受限配置下可达到580TFLOPS的峰值性能。作为对比,H800 SXM5的峰值内存带宽为3.35TB/s,峰值算力为990TFLOPS。FlashMLA将H800的内存带宽利用率推至近90%,计算性能利用率达58.6%。网友评价道:“向工程团队致以崇高的敬意,从Hopper的张量核中挤出了每一个FLOP”。
DeepEP与DeepGEMM:通信与计算的双重突破
DeepEP是首个专为MoE(混合专家系统)和专家并行定制的通信库。MoE模型通过“门控网络”将任务分配给最擅长的专家处理,但专家并行时GPU间通信成为瓶颈。DeepEP提供高吞吐量和低延迟的all-to-all GPU内核,支持NVLink和RDMA,并实现了基于回调机制的通信-计算重叠方法,不占用SM资源。在H800测试中,纯RDMA低延迟内核在256专家并行下分派延迟仅194微秒、带宽39GB/s。腾讯技术团队随后对DeepEP进行深度优化,使其性能进一步提升30%。
DeepGEMM是支持稠密和MoE模型的FP8低精度通用矩阵乘法库。FP8将32位或16位数据压缩至8位存储,内存占用减少、计算速度更快,但面临精度丢失风险。DeepGEMM采用两级累积防错设计——先在Hopper Tensor Core上用FP8进行大批量乘法,再在CUDA核心上以BF16精度累加。核心逻辑仅约300行代码,采用轻量级JIT编译,在大多数矩阵规模下超越专家级优化内核。
DeepGEMM是支持稠密和MoE模型的FP8低精度通用矩阵乘法库。FP8将32位或16位数据压缩至8位存储,内存占用减少、计算速度更快,但面临精度丢失风险。DeepGEMM采用两级累积防错设计——先在Hopper Tensor Core上用FP8进行大批量乘法,再在CUDA核心上以BF16精度累加。核心逻辑仅约300行代码,采用轻量级JIT编译,在大多数矩阵规模下超越专家级优化内核。
| 开源项目 | 发布时间 | 核心功能 | 关键性能指标 |
|---|---|---|---|
| FlashMLA | Day 1 | Hopper GPU高效MLA解码内核 | 3000GB/s带宽,580TFLOPS算力 |
| DeepEP | Day 2 | MoE模型通信库 | 256专家下194微秒延迟,39GB/s带宽 |
| DeepGEMM | Day 3 | FP8矩阵乘法库 | 1350+ TFLOPS算力,300行核心代码 |
| DualPipe+EPLB | Day 4 | 双向流水线并行+负载均衡 | 计算与通信完全重叠 |
| 3FS+Smallpond | Day 5 | 并行文件系统+数据处理 | 6.6TiB/s读取,3.66TiB/min排序 |
推理系统:545%理论成本利润率的技术解码
DeepSeek-V3/R1推理系统通过三大负载均衡器实现高吞吐量和低延迟。Prefill Load Balancer平衡各GPU的core-attention计算量和输入token数量;Decode Load Balancer平衡各GPU的KVCache占用量和请求数量;Expert-Parallel Load Balancer平衡每个GPU上的专家计算量。推理服务在H800 GPU上运行,矩阵乘法和分派传输采用FP8格式,核心MLA计算和组合传输使用BF16格式。
在24小时统计周期内(2月27日12点至2月28日12点),V3和R1处理了6080亿输入token(56.3%命中磁盘KV缓存)和1680亿输出token。平均节点占用数为226.75个(每节点8个H800 GPU),按每小时2美元租赁成本计算,日总成本为87,072美元。若按R1定价收费,理论日收入为561,975美元,成本利润率高达545%。不过DeepSeek表示实际收入远低于此,因V3定价较低、网页和APP免费、夜间有折扣。
在24小时统计周期内(2月27日12点至2月28日12点),V3和R1处理了6080亿输入token(56.3%命中磁盘KV缓存)和1680亿输出token。平均节点占用数为226.75个(每节点8个H800 GPU),按每小时2美元租赁成本计算,日总成本为87,072美元。若按R1定价收费,理论日收入为561,975美元,成本利润率高达545%。不过DeepSeek表示实际收入远低于此,因V3定价较低、网页和APP免费、夜间有折扣。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
计算机产业
18页
15张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录