您的当前位置:首页 > 标签 > 2026年DeepSeek开源周技术解读
计算机行业专题报告:DeepSeek开源六连击尽显极客风采-250302(18页).pdf
2026年DeepSeek开源周技术解读:六大代码库覆盖全链路,545%成本利润率刷新AI盈利天花板|财通证券
财通证券发布DeepSeek开源周技术解读,545%理论成本利润率刷新全球AI盈利天花板。FlashMLA实现H800上3000GB/s带宽+580TFLOPS算力,六大开源代码库覆盖训练、推理、通信、负载均衡全链路。
 2026-07-30
 计算机产业
 18页
15张图表
数据来源:
计算机行业专题报告:DeepSeek开源六连击尽显极客风采-250302(18页) 查看报告
财通证券研究报告深度解析了DeepSeek于2025年2月24日至28日开展的开源周。五天时间,DeepSeek连续开源了FlashMLA、DeepEP、DeepGEMM、DualPipe与EPLB优化并行策略、3FS并行文件系统六大代码库,覆盖训练、推理、通信、负载均衡及数据加速的全链路。开源周结束后第6天,DeepSeek进一步发布V3/R1推理系统概述,披露了高达545%的理论成本利润率。这一系列开源动作不仅展示了DeepSeek在AI基础设施层面的工程能力,更通过极致的开源精神向全球开发者社区释放了巨大的技术红利。

开源周全景:五天六弹,全链路技术覆盖

DeepSeek开源周自2月24日启动,连续五天每天开源一个核心技术项目。第一天发布FlashMLA——专为Hopper架构打造的高效MLA解码器,可高效处理变长序列,优化内存管理。第二天发布DeepEP——首个为MoE量身定制的灵活GPU资源控制通信库。第三天推出DeepGEMM——支持稠密和MoE模型的FP8计算库,核心逻辑仅约300行代码。第四天推出优化并行策略,包括DualPipe双向流水线并行算法和EPLB专家并行负载均衡工具。第五天发布3FS并行文件系统和轻量化数据处理工具Smallpond。开源周结束后第6天,DeepSeek又惊喜发布V3/R1推理系统概述文档。

在GitHub上,这些开源项目累计获得星星数量接近2.8万颗。从技术栈来看,DeepSeek此次开源覆盖了从硬件底层优化(FlashMLA的PTX级调优)、通信层(DeepEP的RDMA优化)、计算层(DeepGEMM的FP8矩阵乘法)、并行策略层(DualPipe和EPLB)到数据存储层(3FS)的完整技术栈。这种全链路、系统级的开源策略在AI行业中极为罕见,体现了DeepSeek“没有象牙塔,只有纯粹的车库创业精神”的开源理念。

FlashMLA:榨取Hopper GPU极致性能

FlashMLA是DeepSeek专为英伟达Hopper GPU开发的高效MLA解码内核,特别针对变长序列进行了优化。MLA(多头潜在注意力)是DeepSeek在DeepSeek-V2及后续模型中引入的核心技术,通过低秩近似方法将每次查询所需的KV缓存减少了约93.3%。FlashMLA在此基础上进一步优化了MLA解码和分页KV缓存管理,支持BF16精度和块大小为64的分页KV缓存。

经实测,在H800 SXM5平台(CUDA 12.8)上,FlashMLA在内存受限配置下可达到最高3000GB/s的带宽,在计算受限配置下可达到580TFLOPS的峰值性能。作为对比,H800 SXM5的峰值内存带宽为3.35TB/s,峰值算力为990TFLOPS。FlashMLA将H800的内存带宽利用率推至近90%,计算性能利用率达58.6%。网友评价道:“向工程团队致以崇高的敬意,从Hopper的张量核中挤出了每一个FLOP”。

DeepEP与DeepGEMM:通信与计算的双重突破

DeepEP是首个专为MoE(混合专家系统)和专家并行定制的通信库。MoE模型通过“门控网络”将任务分配给最擅长的专家处理,但专家并行时GPU间通信成为瓶颈。DeepEP提供高吞吐量和低延迟的all-to-all GPU内核,支持NVLink和RDMA,并实现了基于回调机制的通信-计算重叠方法,不占用SM资源。在H800测试中,纯RDMA低延迟内核在256专家并行下分派延迟仅194微秒、带宽39GB/s。腾讯技术团队随后对DeepEP进行深度优化,使其性能进一步提升30%。

DeepGEMM是支持稠密和MoE模型的FP8低精度通用矩阵乘法库。FP8将32位或16位数据压缩至8位存储,内存占用减少、计算速度更快,但面临精度丢失风险。DeepGEMM采用两级累积防错设计——先在Hopper Tensor Core上用FP8进行大批量乘法,再在CUDA核心上以BF16精度累加。核心逻辑仅约300行代码,采用轻量级JIT编译,在大多数矩阵规模下超越专家级优化内核。
表1:DeepSeek开源周六大项目核心性能指标
开源项目发布时间核心功能关键性能指标
FlashMLADay 1Hopper GPU高效MLA解码内核3000GB/s带宽,580TFLOPS算力
DeepEPDay 2MoE模型通信库256专家下194微秒延迟,39GB/s带宽
DeepGEMMDay 3FP8矩阵乘法库1350+ TFLOPS算力,300行核心代码
DualPipe+EPLBDay 4双向流水线并行+负载均衡计算与通信完全重叠
3FS+SmallpondDay 5并行文件系统+数据处理6.6TiB/s读取,3.66TiB/min排序

推理系统:545%理论成本利润率的技术解码

DeepSeek-V3/R1推理系统通过三大负载均衡器实现高吞吐量和低延迟。Prefill Load Balancer平衡各GPU的core-attention计算量和输入token数量;Decode Load Balancer平衡各GPU的KVCache占用量和请求数量;Expert-Parallel Load Balancer平衡每个GPU上的专家计算量。推理服务在H800 GPU上运行,矩阵乘法和分派传输采用FP8格式,核心MLA计算和组合传输使用BF16格式。

在24小时统计周期内(2月27日12点至2月28日12点),V3和R1处理了6080亿输入token(56.3%命中磁盘KV缓存)和1680亿输出token。平均节点占用数为226.75个(每节点8个H800 GPU),按每小时2美元租赁成本计算,日总成本为87,072美元。若按R1定价收费,理论日收入为561,975美元,成本利润率高达545%。不过DeepSeek表示实际收入远低于此,因V3定价较低、网页和APP免费、夜间有折扣。
客服
商务合作
小程序
服务号
折叠