DeepSeek近期发布V3和R1两款大模型,以557.6万美元的超低训练成本实现比肩GPT-4o和Claude-3.5-Sonnet的性能,R1推理模型对标OpenAI o1正式版。MLA与MoE架构创新、FP8混合精度训练、蒸馏技术等多维度突破,使DeepSeek在算法层面重塑了AI生产函数。
DeepSeek-V3——性能比肩顶尖闭源模型,训练成本仅为1/10
2024年12月26日,DeepSeek发布V3并同步开源。V3在MMLU得分88.5%超越Qwen2.5-72B(85.3%),与Claude-3.5-Sonnet-1022(88.8%)和GPT-4o-0513(87.2%)不分伯仲。在代码测试HumanEval-Mul得分82.6%领先所有开源模型,数学测试AIME 2024达39.2%远超其他开源模型。V3仅使用2048块H800 GPU训练2个月,共消耗278.8万GPU小时,正式训练成本仅557.6万美元——约为Llama3-405B的1/11、GPT-4o等同等性能模型的1/10。生成吐字速度从20TPS大幅提升至60TPS,是V2.5模型的3倍。API服务定价为每百万输入tokens 0.5元(缓存命中)/2元(未命中),每百万输出tokens 8元,价格仅为GPT-4o的约1/30。
R1——推理能力比肩o1,蒸馏技术赋能小模型
2025年1月20日,DeepSeek发布推理模型R1,在后训练阶段大规模使用强化学习技术,仅用极少标注数据即极大提升推理能力。在AIME 2024测评中R1获得79.8%的pass@1得分,略微超过OpenAI o1;在MATH-500获得97.3%的得分,与o1性能相当。R1上线API开放思维链输出,定价为每百万输入tokens 1元(缓存命中)/4元(未命中),每百万输出tokens 16元,约为OpenAI o3-mini的1/8。DeepSeek还通过R1的输出蒸馏了6个小模型开源,其中32B和70B模型在多项能力上对标o1-mini。蒸馏模型参数量从671B降至32B,推理速度提升约50倍,使小模型在端侧部署成为可能。
MLA与MoE——降算力、降内存的核心架构创新
DeepSeek通过多头潜在注意力(MLA)和DeepSeekMoE两大架构创新实现低算力高性能。MLA通过对注意力键和值进行低秩压缩减少KV缓存,大幅降低推理时的显存占用,同时保持与标准多头注意力相当的性能。DeepSeekMoE将模型分解为多个专家模型和门控网络,门控网络根据输入数据特点智能选择专家处理,671B总参数下每个Token仅激活37B参数,计算开销较传统MoE降低40%。无辅助损失的负载均衡策略引入偏置项优化专家负载,避免性能下降。MLA+MoE组合使V3在保持性能的同时显著降低训练和推理时的内存占用和计算量。
FP8混合精度与DualPipe——工程优化进一步降本
DeepSeek引入FP8混合精度训练,大部分计算密集型操作在FP8精度下进行,少数关键操作保持在原始数据格式,计算速度比传统BF16方法提高一倍,同时减少内存需求。为解决低精度计算的数值稳定性问题,DeepSeek在GEMM操作内部维度引入每组缩放因子,保障低精度训练结果的准确性。DualPipe算法实现高效的管道并行,在单独的前向后向块内部重叠计算和通信,采用双向管道调度从管道两端供给数据,使大部分通信完全重叠。在V3训练时跨节点专家并行性带来的通信开销通过DualPipe极大优化,计算与通信比率从约1:1实现有效改善。
DeepSeek模型核心性能与成本参数一览
| 模型 | 总参数 | 激活参数 | 训练GPU小时 | 训练成本 | 每百万输入价格 | 每百万输出价格 |
|
|
|
|
|
|
|
|
| DeepSeek-V3 | 671B | 37B | 278.8万 | 557.6万美元 | 0.5-2元 | 8元 |
| DeepSeek-R1 | 671B | 37B | 基于V3微调 | <557.6万美元 | 1-4元 | 16元 |
| DeepSeek-R1-Distill-32B | 32B | — | 蒸馏 | 极低 | — | — |
| GPT-4o | 约1.8T | — | 数千万 | 约1亿美元 | ~35-100元 | ~105元 |
| o1-mini | — | — | — | — | ~55元 | ~440元 |
来源:DeepSeek技术报告、各券商研究所整理
|
|
|
|
|
|
|
|
| DeepSeek-V3 | 671B | 37B | 278.8万 | 557.6万美元 | 0.5-2元 | 8元 |
| DeepSeek-R1 | 671B | 37B | 基于V3微调 | <557.6万美元 | 1-4元 | 16元 |
| DeepSeek-R1-Distill-32B | 32B | — | 蒸馏 | 极低 | — | — |
| GPT-4o | 约1.8T | — | 数千万 | 约1亿美元 | ~35-100元 | ~105元 |
| o1-mini | — | — | — | — | ~55元 | ~440元 |
来源:DeepSeek技术报告、各券商研究所整理
DeepSeek技术突破的产业意义
DeepSeek通过算法创新证明了“算力堆砌并非唯一解”。其技术路径表明:在算力受限的情况下,通过精细化的架构设计、训练策略优化和工程实现,同样可以产出顶尖性能的模型。这一突破对于中国AI产业意义尤为重大——在先进制程芯片受限的背景下,DeepSeek展示了“算法补硬件”的可行路径。同时,超低的训练和推理成本将加速AI应用的普及,推动AI从“少数巨头的游戏”走向“普惠化”的新阶段。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
AI产业
30页
1张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录