DeepSeek以算法工程创新颠覆了“算力至上”的传统AI发展路径。湘财证券研报系统拆解了DeepSeek的四项核心技术创新:MoE混合专家架构(256个专家模块)、MLA多头潜在注意力(显存占用降30-50%)、FP8混合精度训练(速度+50%、内存-40%)、GRPO强化学习算法(计算成本显著降低)。这些创新使DeepSeek-V3训练成本仅550万美元(Claude 3.5 Sonnet数千万美元),推理价格仅为GPT-4o的1/30,验证了算法优化可以大幅降低算力依赖。
DeepSeek四项核心算法创新拆解
DeepSeek在算法工程方面的创新主要体现在四个层面,均为底层技术突破而非简单的工程优化:
MoE(混合专家模型)架构:MoE架构最早由谷歌在2017年Transformer模型中引入,2023年法国Mistral AI最早大规模开源。DeepSeek在2024年5月V2版本中较早使用MoE架构,包含256个专家模块,每个词元仅激活37B参数。动态选择最相关专家处理任务,既降低计算资源消耗,又保持了千亿级参数模型的性能,在数学、代码生成等任务中表现尤为突出。
MLA(多头潜在注意力)机制:DeepSeek 2024年5月在DeepSeek-V2论文中首次提出。该注意力机制在MHA(多头注意力)基础上进行优化创新。通过低秩压缩机制减少键值缓存需求,显存占用降低30%-50%,推理效率提升3倍。目前仅有DeepSeek在V2/V3两款模型中大规模使用。
FP8混合精度训练:2022年英伟达、Arm和Intel联合提出FP8格式,但此前美国科技公司普遍不够算力,且FP8训练会增加复杂度,未被深入探索。DeepSeek构建了FP8混合精度训练框架,根据不同计算任务动态选择FP8或FP32精度,训练速度提高50%,内存占用降低40%。
GRPO强化学习算法:OpenAI 2024年9月发布o1时使用强化学习技术,DeepSeek在此基础上推出GRPO(组相对策略优化),在显著降低计算成本的同时提高模型训练效率,使强化学习训练更加高效可控。
MoE(混合专家模型)架构:MoE架构最早由谷歌在2017年Transformer模型中引入,2023年法国Mistral AI最早大规模开源。DeepSeek在2024年5月V2版本中较早使用MoE架构,包含256个专家模块,每个词元仅激活37B参数。动态选择最相关专家处理任务,既降低计算资源消耗,又保持了千亿级参数模型的性能,在数学、代码生成等任务中表现尤为突出。
MLA(多头潜在注意力)机制:DeepSeek 2024年5月在DeepSeek-V2论文中首次提出。该注意力机制在MHA(多头注意力)基础上进行优化创新。通过低秩压缩机制减少键值缓存需求,显存占用降低30%-50%,推理效率提升3倍。目前仅有DeepSeek在V2/V3两款模型中大规模使用。
FP8混合精度训练:2022年英伟达、Arm和Intel联合提出FP8格式,但此前美国科技公司普遍不够算力,且FP8训练会增加复杂度,未被深入探索。DeepSeek构建了FP8混合精度训练框架,根据不同计算任务动态选择FP8或FP32精度,训练速度提高50%,内存占用降低40%。
GRPO强化学习算法:OpenAI 2024年9月发布o1时使用强化学习技术,DeepSeek在此基础上推出GRPO(组相对策略优化),在显著降低计算成本的同时提高模型训练效率,使强化学习训练更加高效可控。
| 创新技术 | 首创方 | DeepSeek应用 | 核心效果 |
|---|---|---|---|
| MoE架构 | 谷歌(2017) | 256专家、37B激活 | 降低计算消耗 |
| MLA机制 | DeepSeek(2024) | V2/V3大规模应用 | 显存降30-50% |
| FP8训练 | 英伟达/Intel/Arm(2022) | 混合精度框架 | 速度+50%,内存-40% |
| GRPO算法 | DeepSeek(2024) | 首创强化学习优化 | 计算成本显著降低 |
550万美元训练成本验证算法工程价值
DeepSeek-V3论文中提到的550万美元训练成本,仅指单次训练成本,不包括前期实验成本、薪资支出及服务器购置。Claude 3.5 Sonnet的训练成本为数千万美元,DeepSeek通过算法优化将训练成本降低了一个数量级。
根据SemiAnalysis分析,DeepSeek总服务器成本为16.29亿美元/年(A100/H20/H800/H100合计6万张GPU),总支出25.73亿美元/年。幻方量化2021年已投资10亿元配置超1万张英伟达A100,长期的技术积累为模型训练提供了硬件基础。
根据SemiAnalysis分析,DeepSeek总服务器成本为16.29亿美元/年(A100/H20/H800/H100合计6万张GPU),总支出25.73亿美元/年。幻方量化2021年已投资10亿元配置超1万张英伟达A100,长期的技术积累为模型训练提供了硬件基础。
推理价格仅为GPT-4o的1/30,性能全面对标闭源模型
DeepSeek-V3正常价格输入0.14元/1M tokens、输出0.28元/1M tokens,约为GPT-4o的1/30。DeepSeek-V3的MMLU达88.5分(GPT-4o 87.2分),AIME 2024达39.2分(GPT-4o 9.3分),MATH-500达90.2分。在数学推理等复杂任务上显著超越闭源模型,验证了算法工程创新的实际效果。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共54套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
计算机产业
16页
9张图表
0731-84720580
商务合作:really158d
微信扫码登录
手机快捷登录
账号登录