您的当前位置:首页 > 标签 > DeepSeek技术创新
DeepSeek深度:市场表现、发展展望、产业机遇及相关公司深度梳理-250214(30页).pdf
2026 DeepSeek技术创新:训练成本557万美元,推理成本较O1降96%|多家券商
综合民生、兴业、国信、招商等券商报告显示,DeepSeek-V3训练仅需557万美元为GPT-4o的1/10,R1推理成本较O1降96%;MLA+MoE架构降算力,蒸馏技术赋能小模型,算法创新重塑AI生产函数。
 2026-07-30
 AI产业
 30页
1张图表
数据来源:
DeepSeek深度:市场表现、发展展望、产业机遇及相关公司深度梳理-250214(30页) 查看报告
DeepSeek近期发布V3和R1两款大模型,以557.6万美元的超低训练成本实现比肩GPT-4o和Claude-3.5-Sonnet的性能,R1推理模型对标OpenAI o1正式版。MLA与MoE架构创新、FP8混合精度训练、蒸馏技术等多维度突破,使DeepSeek在算法层面重塑了AI生产函数。

DeepSeek-V3——性能比肩顶尖闭源模型,训练成本仅为1/10

2024年12月26日,DeepSeek发布V3并同步开源。V3在MMLU得分88.5%超越Qwen2.5-72B(85.3%),与Claude-3.5-Sonnet-1022(88.8%)和GPT-4o-0513(87.2%)不分伯仲。在代码测试HumanEval-Mul得分82.6%领先所有开源模型,数学测试AIME 2024达39.2%远超其他开源模型。V3仅使用2048块H800 GPU训练2个月,共消耗278.8万GPU小时,正式训练成本仅557.6万美元——约为Llama3-405B的1/11、GPT-4o等同等性能模型的1/10。生成吐字速度从20TPS大幅提升至60TPS,是V2.5模型的3倍。API服务定价为每百万输入tokens 0.5元(缓存命中)/2元(未命中),每百万输出tokens 8元,价格仅为GPT-4o的约1/30。

R1——推理能力比肩o1,蒸馏技术赋能小模型

2025年1月20日,DeepSeek发布推理模型R1,在后训练阶段大规模使用强化学习技术,仅用极少标注数据即极大提升推理能力。在AIME 2024测评中R1获得79.8%的pass@1得分,略微超过OpenAI o1;在MATH-500获得97.3%的得分,与o1性能相当。R1上线API开放思维链输出,定价为每百万输入tokens 1元(缓存命中)/4元(未命中),每百万输出tokens 16元,约为OpenAI o3-mini的1/8。DeepSeek还通过R1的输出蒸馏了6个小模型开源,其中32B和70B模型在多项能力上对标o1-mini。蒸馏模型参数量从671B降至32B,推理速度提升约50倍,使小模型在端侧部署成为可能。

MLA与MoE——降算力、降内存的核心架构创新

DeepSeek通过多头潜在注意力(MLA)和DeepSeekMoE两大架构创新实现低算力高性能。MLA通过对注意力键和值进行低秩压缩减少KV缓存,大幅降低推理时的显存占用,同时保持与标准多头注意力相当的性能。DeepSeekMoE将模型分解为多个专家模型和门控网络,门控网络根据输入数据特点智能选择专家处理,671B总参数下每个Token仅激活37B参数,计算开销较传统MoE降低40%。无辅助损失的负载均衡策略引入偏置项优化专家负载,避免性能下降。MLA+MoE组合使V3在保持性能的同时显著降低训练和推理时的内存占用和计算量。

FP8混合精度与DualPipe——工程优化进一步降本

DeepSeek引入FP8混合精度训练,大部分计算密集型操作在FP8精度下进行,少数关键操作保持在原始数据格式,计算速度比传统BF16方法提高一倍,同时减少内存需求。为解决低精度计算的数值稳定性问题,DeepSeek在GEMM操作内部维度引入每组缩放因子,保障低精度训练结果的准确性。DualPipe算法实现高效的管道并行,在单独的前向后向块内部重叠计算和通信,采用双向管道调度从管道两端供给数据,使大部分通信完全重叠。在V3训练时跨节点专家并行性带来的通信开销通过DualPipe极大优化,计算与通信比率从约1:1实现有效改善。

DeepSeek模型核心性能与成本参数一览

| 模型 | 总参数 | 激活参数 | 训练GPU小时 | 训练成本 | 每百万输入价格 | 每百万输出价格 |

|

|

|

|

|

|

|

|

| DeepSeek-V3 | 671B | 37B | 278.8万 | 557.6万美元 | 0.5-2元 | 8元 |

| DeepSeek-R1 | 671B | 37B | 基于V3微调 | <557.6万美元 | 1-4元 | 16元 |

| DeepSeek-R1-Distill-32B | 32B | — | 蒸馏 | 极低 | — | — |

| GPT-4o | 约1.8T | — | 数千万 | 约1亿美元 | ~35-100元 | ~105元 |

| o1-mini | — | — | — | — | ~55元 | ~440元 |

来源:DeepSeek技术报告、各券商研究所整理

DeepSeek技术突破的产业意义

DeepSeek通过算法创新证明了“算力堆砌并非唯一解”。其技术路径表明:在算力受限的情况下,通过精细化的架构设计、训练策略优化和工程实现,同样可以产出顶尖性能的模型。这一突破对于中国AI产业意义尤为重大——在先进制程芯片受限的背景下,DeepSeek展示了“算法补硬件”的可行路径。同时,超低的训练和推理成本将加速AI应用的普及,推动AI从“少数巨头的游戏”走向“普惠化”的新阶段。
客服
商务合作
小程序
服务号
折叠