中原证券报告对DeepSeek推理成本进行了详细测算。数据显示,DeepSeek用278台H800服务器(2224张GPU)提供推理服务,日均处理输入Token 6080亿、输出Token 1680亿。按R1价格测算,每日推理服务理论收入56.2万美元,理论毛利率高达84.5%。API调用成本仅为OpenAI o1的三十分之一。DeepSeek通过MLA架构和MoE架构大幅降低算力消耗,为AI应用的规模化落地提供了经济可行性。
DeepSeek推理成本详解,理论毛利率高达84.5%
根据DeepSeek在3月1日发布的《DeepSeek-V3/R1推理系统概览》,其线上系统实际统计数据揭示了原厂在性能优化后提供MaaS服务的真实盈利水平。
在硬件配置方面,DeepSeek用278台H800服务器提供推理服务,对应GPU数量2224张。由于夜间需求减少,DeepSeek会减少推理节点,用剩余算力满足研究和训练需求,平均占用GPU数量为1814张,这一数量远低于市场预期。大约在每日9点到24点时段所有节点提供推理服务,低谷阶段仍有约四分之一节点提供推理。
在业务数据方面,日输入Token为6080亿(其中缓存命中3420亿,命中率56.25%),日输出Token为1680亿。每节点平均输入吞吐量73.7k tokens/s,平均输出吞吐量14.8k tokens/s。并发请求数约8.8-9.7万次/秒,平均输出速度20-22 tps。
在财务数据方面,按R1价格(缓存命中0.14美元/百万token,缓存未命中0.55美元/百万token,输出2.19美元/百万token)测算,每日推理服务理论收入56.2万美元。日成本方面,H800租赁成本按2美元/卡/小时计算,日成本8.7万美元。理论毛利率高达84.5%。
在硬件配置方面,DeepSeek用278台H800服务器提供推理服务,对应GPU数量2224张。由于夜间需求减少,DeepSeek会减少推理节点,用剩余算力满足研究和训练需求,平均占用GPU数量为1814张,这一数量远低于市场预期。大约在每日9点到24点时段所有节点提供推理服务,低谷阶段仍有约四分之一节点提供推理。
在业务数据方面,日输入Token为6080亿(其中缓存命中3420亿,命中率56.25%),日输出Token为1680亿。每节点平均输入吞吐量73.7k tokens/s,平均输出吞吐量14.8k tokens/s。并发请求数约8.8-9.7万次/秒,平均输出速度20-22 tps。
在财务数据方面,按R1价格(缓存命中0.14美元/百万token,缓存未命中0.55美元/百万token,输出2.19美元/百万token)测算,每日推理服务理论收入56.2万美元。日成本方面,H800租赁成本按2美元/卡/小时计算,日成本8.7万美元。理论毛利率高达84.5%。
DeepSeek与OpenAI成本对比,效率差距悬殊
2024年10月TheInformation报道,根据OpenAI财务文件,预计2023年到2028年OpenAI将蒙受440亿美元损失,其中2024年损失50亿美元,到2026年年度损失可能高达140亿美元,到2029年或才能扭亏为盈。
对比来看,DeepSeek凭借强大的成本控制能力,已可实现MaaS服务盈利,理论毛利率高达84.5%。OpenAI推理成本约占总成本的27%,而DeepSeek通过MLA和MoE架构将推理成本降至闭源模型的数十分之一。
在模型训练成本方面,DeepSeek-V3仅用278.8万GPU小时完成训练,而Grok-3累计训练时长达2亿GPU小时,是DeepSeek-V3的约72倍。但DeepSeek-V3在ChatbotArena等评测中成绩比肩GPT-4o,证明了精细化训练路径的有效性。
对比来看,DeepSeek凭借强大的成本控制能力,已可实现MaaS服务盈利,理论毛利率高达84.5%。OpenAI推理成本约占总成本的27%,而DeepSeek通过MLA和MoE架构将推理成本降至闭源模型的数十分之一。
在模型训练成本方面,DeepSeek-V3仅用278.8万GPU小时完成训练,而Grok-3累计训练时长达2亿GPU小时,是DeepSeek-V3的约72倍。但DeepSeek-V3在ChatbotArena等评测中成绩比肩GPT-4o,证明了精细化训练路径的有效性。
算力节省的关键技术解析
DeepSeek实现算力节省的两个关键点来自模型架构创新。一是多头潜注意力机制,通过对传统多头注意力机制的改进,将低秩近似方法引入键值缓存压缩,贡献约2-4倍计算效率提升。二是DeepSeekMoE架构,V3总参数6710亿,但每个Token仅激活370亿参数,贡献4倍以上计算效率提升,通过无辅助损失的负载平衡策略提高训练稳定性。
在训练架构层面,DeepSeek展现出强大的软硬协同优化能力。FP8混合精度训练框架使其成为首个成功使用FP8训练超大规模模型的公司,将大多数计算密集型操作在FP8中进行,关键操作保持原有数据格式,兼顾训练效率和稳定性。DualPipe算法实现高效的流水线并行,通过计算和通信重叠隐藏大部分通信开销。跨节点All-to-All通信内核使用PTX编程,充分利用InfiniBand和NVLink带宽,无需张量并行即可完成训练。
在训练架构层面,DeepSeek展现出强大的软硬协同优化能力。FP8混合精度训练框架使其成为首个成功使用FP8训练超大规模模型的公司,将大多数计算密集型操作在FP8中进行,关键操作保持原有数据格式,兼顾训练效率和稳定性。DualPipe算法实现高效的流水线并行,通过计算和通信重叠隐藏大部分通信开销。跨节点All-to-All通信内核使用PTX编程,充分利用InfiniBand和NVLink带宽,无需张量并行即可完成训练。
| 指标 | 数值 |
|---|---|
| 推理服务服务器总数 | 278台(8×H800/台) |
| 平均占用GPU数量 | 1814张 |
| 日输入Token | 6080亿(缓存命中56.25%) |
| 日输出Token | 1680亿 |
| 日推理服务理论收入 | 56.2万美元 |
| 日推理服务成本 | 8.7万美元 |
| 理论毛利率 | 84.5% |
推理成本下降对AI应用爆发的意义
DeepSeek高达84.5%的理论毛利率成为MaaS服务的效率标杆,将吸引更多厂商加大在DeepSeek相关服务的投入。虽然大模型推理成本在下降,但由此带来的应用爆发有望催生更多需求,成为下一阶段拉动算力增长的主要驱动力。
从模型单次调用到Agent通过一系列调用产生结果,服务请求密度将几何级增长;从App搜索提问到手机终端日常调用,模型调用需求在种类和频次上将获得极大提升。2025年中国科技圈DeepSeek、QwQ到Manus等亮点频现,正在完成从量变到质变的过程。
从模型单次调用到Agent通过一系列调用产生结果,服务请求密度将几何级增长;从App搜索提问到手机终端日常调用,模型调用需求在种类和频次上将获得极大提升。2025年中国科技圈DeepSeek、QwQ到Manus等亮点频现,正在完成从量变到质变的过程。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
信息技术
25页
1张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录