您的当前位置:首页 > 标签 > AI推理成本下降分析
【中原证券】计算机行业深度分析:三大要素齐发力,AI应用步入全面加速期-250307(25页).pdf
AI推理成本下降分析:DeepSeek毛利率85%与日收入56万美元,MaaS经济模型测算|中原证券
中原证券测算DeepSeek推理服务理论毛利率84.5%、日收入56万美元,278台H800支撑日处理7760亿Token。API成本降至o1的1/30,AI推理成本下降的经济效益分析。
 2026-07-30
 信息技术
 25页
1张图表
数据来源:
【中原证券】计算机行业深度分析:三大要素齐发力,AI应用步入全面加速期-250307(25页) 查看报告
中原证券报告对DeepSeek推理成本进行了详细测算。数据显示,DeepSeek用278台H800服务器(2224张GPU)提供推理服务,日均处理输入Token 6080亿、输出Token 1680亿。按R1价格测算,每日推理服务理论收入56.2万美元,理论毛利率高达84.5%。API调用成本仅为OpenAI o1的三十分之一。DeepSeek通过MLA架构和MoE架构大幅降低算力消耗,为AI应用的规模化落地提供了经济可行性。

DeepSeek推理成本详解,理论毛利率高达84.5%

根据DeepSeek在3月1日发布的《DeepSeek-V3/R1推理系统概览》,其线上系统实际统计数据揭示了原厂在性能优化后提供MaaS服务的真实盈利水平。

在硬件配置方面,DeepSeek用278台H800服务器提供推理服务,对应GPU数量2224张。由于夜间需求减少,DeepSeek会减少推理节点,用剩余算力满足研究和训练需求,平均占用GPU数量为1814张,这一数量远低于市场预期。大约在每日9点到24点时段所有节点提供推理服务,低谷阶段仍有约四分之一节点提供推理。

在业务数据方面,日输入Token为6080亿(其中缓存命中3420亿,命中率56.25%),日输出Token为1680亿。每节点平均输入吞吐量73.7k tokens/s,平均输出吞吐量14.8k tokens/s。并发请求数约8.8-9.7万次/秒,平均输出速度20-22 tps。

在财务数据方面,按R1价格(缓存命中0.14美元/百万token,缓存未命中0.55美元/百万token,输出2.19美元/百万token)测算,每日推理服务理论收入56.2万美元。日成本方面,H800租赁成本按2美元/卡/小时计算,日成本8.7万美元。理论毛利率高达84.5%。

DeepSeek与OpenAI成本对比,效率差距悬殊

2024年10月TheInformation报道,根据OpenAI财务文件,预计2023年到2028年OpenAI将蒙受440亿美元损失,其中2024年损失50亿美元,到2026年年度损失可能高达140亿美元,到2029年或才能扭亏为盈。

对比来看,DeepSeek凭借强大的成本控制能力,已可实现MaaS服务盈利,理论毛利率高达84.5%。OpenAI推理成本约占总成本的27%,而DeepSeek通过MLA和MoE架构将推理成本降至闭源模型的数十分之一。

在模型训练成本方面,DeepSeek-V3仅用278.8万GPU小时完成训练,而Grok-3累计训练时长达2亿GPU小时,是DeepSeek-V3的约72倍。但DeepSeek-V3在ChatbotArena等评测中成绩比肩GPT-4o,证明了精细化训练路径的有效性。

算力节省的关键技术解析

DeepSeek实现算力节省的两个关键点来自模型架构创新。一是多头潜注意力机制,通过对传统多头注意力机制的改进,将低秩近似方法引入键值缓存压缩,贡献约2-4倍计算效率提升。二是DeepSeekMoE架构,V3总参数6710亿,但每个Token仅激活370亿参数,贡献4倍以上计算效率提升,通过无辅助损失的负载平衡策略提高训练稳定性。

在训练架构层面,DeepSeek展现出强大的软硬协同优化能力。FP8混合精度训练框架使其成为首个成功使用FP8训练超大规模模型的公司,将大多数计算密集型操作在FP8中进行,关键操作保持原有数据格式,兼顾训练效率和稳定性。DualPipe算法实现高效的流水线并行,通过计算和通信重叠隐藏大部分通信开销。跨节点All-to-All通信内核使用PTX编程,充分利用InfiniBand和NVLink带宽,无需张量并行即可完成训练。
DeepSeek推理服务日运营数据测算
指标数值
推理服务服务器总数278台(8×H800/台)
平均占用GPU数量1814张
日输入Token6080亿(缓存命中56.25%)
日输出Token1680亿
日推理服务理论收入56.2万美元
日推理服务成本8.7万美元
理论毛利率84.5%

推理成本下降对AI应用爆发的意义

DeepSeek高达84.5%的理论毛利率成为MaaS服务的效率标杆,将吸引更多厂商加大在DeepSeek相关服务的投入。虽然大模型推理成本在下降,但由此带来的应用爆发有望催生更多需求,成为下一阶段拉动算力增长的主要驱动力。

从模型单次调用到Agent通过一系列调用产生结果,服务请求密度将几何级增长;从App搜索提问到手机终端日常调用,模型调用需求在种类和频次上将获得极大提升。2025年中国科技圈DeepSeek、QwQ到Manus等亮点频现,正在完成从量变到质变的过程。
客服
商务合作
小程序
服务号
折叠