DeepSeek-R1的横空出世正在改变全球大模型的竞争格局。光大证券《互联网大厂如何受益于DeepSeek-R1"破圈"?》报告显示,DeepSeek-R1在AIME 2024、MATH-500、LiveCodeBench等多个基准测试中超越OpenAI-o1,在Chatbot Arena排名全球第四(1,361分),超越OpenAI o1(1,351分)。在几乎没有任何广告投放的情况下,DeepSeek 7天完成1亿用户增长,成为史上最快达成该里程碑的应用。本文从性能表现、技术突破、传播路径三个维度,解析DeepSeek-R1的"破圈"密码。
性能全面对标OpenAI-o1,多个基准测试实现超越
DeepSeek-R1在多个权威基准测试中展现了与OpenAI-o1正面竞争的实力。在AIME 2024 pass@1测试中,DeepSeek-R1得分79.2%,大幅超越o1-mini的63.6%;在MATH-500达96.4%;在LiveCodeBench达63.4%;在Codeforces rating达2,061(超过93.4%人类程序员)。在AIME 2024 cons@64测试中,DeepSeek-R1得分97.3%,o1-mini仅80.0%。DeepSeek-R1仅在GPQA Diamond(65.7% vs o1-0912的73.1%)等少数科学推理测试中略逊于OpenAI-o1-0912。这一性能水平使DeepSeek-R1成为首个在推理能力上全面对标o1的开源模型,填补了OpenAI o1闭源后行业对高质量推理模型的迫切需求。
Chatbot Arena排名全球第四,开发者社区高度认可
Chatbot Arena是一个基于人类偏好评估LLM的开放平台,采用成对比较方法,用户投票选出两个模型响应中更好的一个。截至2025年2月9日,平台共收集到超过260万次用户投票。DeepSeek-R1以1,361分的Arena Elo分数排名全球第四,仅次于Gemini-2.0-Flash-Thinking-Exp-01-21(1,384分)、Gemini-2.0-Pro-Exp-02-05(1,379分)和ChatGPT-4o-latest(1,365分),超越OpenAI o1(1,351分)。值得注意的是,DeepSeek-R1上线时间较晚,投票次数仅4,193次(前十名中最少),但仍获得高排名。海外科技媒体arstechnica对DeepSeek-R1与OpenAI-o1和o1-Pro进行评测,结果显示DeepSeek-R1在多个日常提问中返回优于o1系列的回复,包括创意写作、数学推理、指令遵循等领域。
| 基准测试 | DeepSeek-R1 | OpenAI-o1-mini | OpenAI-o1-0912 |
|---|---|---|---|
| AIME 2024 pass@1 | 79.2% | 63.6% | — |
| AIME 2024 cons@64 | 97.3% | 80.0% | — |
| MATH-500 | 96.4% | 90.0% | — |
| Codeforces rating | 2,061 | 1,820 | — |
| GPQA Diamond | 65.7% | 60.0% | 73.1% |
GRPO+MoE+MLA+FP8——多项算法工程突破叠加的技术奇迹
DeepSeek-R1的技术突破是多年迭代积累的结果。自2023年11月发布DeepSeek-Coder以来,DeepSeek逐步在GRPO算法、DeepSeekMoE架构、MLA机制、FP8精度、MTP方法等多方面实现突破。GRPO(群组相对策略优化)算法是DeepSeek在强化学习上的核心创新,省去了传统PPO方法中需要额外训练价值网络的步骤,通过组内比较评估动作优劣,大幅节省计算资源。R1-Zero完全跳过了监督微调(SFT)阶段,仅用强化学习训练,模型自行出现了“顿悟时刻”——响应平均时长从约150 token提升至约1,800 token,学会了用更长的思维链进行深度推理思考。DeepSeek-V3的MoE架构拥有6,710亿总参数,但每个输入仅激活约370亿参数;MLA机制降低KV缓存量;FP8精度实现加速训练和减少GPU内存使用。多项技术突破的叠加,使DeepSeek能够在有限的算力资源下实现与闭源巨头相当的性能。
7天用户破亿,开源+免费重塑大模型传播范式
DeepSeek-R1采用了完全开源策略(MIT许可证),允许商用和修改,并在技术报告中详细公布训练思路。同时推出免费的C端产品,使普通用户首次体验到优质的AI推理模型。根据Questmobile数据,DeepSeek在1月28日日活首次超越豆包,2月1日突破3,000万大关。根据AI产品榜,1月DeepSeek用户增长达1.25亿(Web+App累加不去重),其中80%以上来自最后一周,即7天完成1亿用户增长,超越ChatGPT(约2个月)和TikTok(约6个月)的增速纪录。开源策略吸引了海内外开发者和研究人员的广泛关注,免费策略降低了C端用户的体验门槛,两者结合形成了“口碑传播+技术社区共振”的裂变效应,使中国大模型首次受到海外AI科技界的全面推崇认可。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共54套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
互联网产业
29页
17张图表
0731-84720580
商务合作:really158d
微信扫码登录
手机快捷登录
账号登录