您的当前位置:首页 > 标签 > AI推理模型进展
计算机行业深度分析:三大要素齐发力AI应用步入全面加速期-250307(25页).pdf
2026 AI推理模型进展:强化学习验证有效性,DeepSeek-R1追赶o1|中原证券
中原证券研报显示,o1开启逻辑推理提升路径,DeepSeek-R1通过强化学习使AIME精度从15.6%升至71%,首次公开验证推理能力可不依赖监督微调,推理模型正成为AI新范式。
 2026-07-29
 计算机产业
 25页
26张图表
数据来源:
计算机行业深度分析:三大要素齐发力AI应用步入全面加速期-250307(25页) 查看报告
中原证券2025年3月发布的计算机行业深度报告指出,AI应用落地的三大关键要素——逻辑推理能力提升、推理成本下降、开源阵营性能超越——已全面就位。其中,推理能力突破是根本前提。OpenAI的o1开启了逻辑推理能力提升的新路径,而DeepSeek-R1首次公开验证了强化学习对于大模型推理能力提升的有效性。这一突破使AI从“会说”走向“会思考”,为Agent等高级应用奠定了基础。

o1开创推理新范式,解决LLM逻辑短板

2024年9月,OpenAI发布o1模型,标志着大模型从纯语言模型向推理模型的跨越。此前,科学界对于LLM能否在提高语言能力同时高效提升逻辑推理能力存在质疑。2024年6月,麻省理工学院在Nature发表论文《语言主要是一种交流的工具,而不是一种思考的工具》,证明负责语言的神经和负责思维的神经在脑中是分离的。o1的发布打破了这一质疑,其通过强化学习训练,在解决科学、编码、数学等领域复杂问题时表现显著优于传统语言模型,是OpenAI在AGI道路上的里程碑式突破。

强化学习验证有效,推理能力可自主进化

DeepSeek-R1-Zero以DeepSeek-V3-Base为基础模型,仅通过强化学习而不依赖监督微调(SFT)进行训练,其AIME2024得分从15.6%提升至71.0%,首次公开验证了大模型推理能力可通过RL独立训练获得。更关键的是,随着训练迭代增加,模型的平均响应时长同步增长,表明模型自主学会了通过延长思考时间来解决复杂问题——这是一种自我进化的能力,而非人工编程。强化学习的优点在于不依赖先验知识和人工标注数据,模型可能涌现出超越人类思维上限的推理能力,为通向超级智能开辟了道路。

蒸馏技术将推理能力迁移至轻量模型

为使推理能力能部署于资源受限场景,DeepSeek用R1对Llama和Qwen系列模型进行蒸馏,得到6个参数从1.5B到70B的小模型。蒸馏后的模型在推理能力上显著提升,且部署成本大幅降低。例如,DeepSeek-R1-Distill-Qwen-32B在硅基流动上的调用价格仅为1.26美元/百万token(输入/输出),而完整R1为4/16美元。这使得推理能力可广泛渗透至边缘端、移动端等多样化场景。

推理模型驱动算力需求结构性变化

推理模型的出现改变了算力消耗的分布格局。以往模型算力主要集中在预训练阶段,未来后训练(强化学习)和推理阶段的算力消耗将大幅增加。单次推理因模型需要更长时间“思考”而消耗更多算力,同时Agent等应用通过多轮推理链完成复杂任务,将带来请求密度指数级增长。推理成本的下降并不会减少算力总需求,反而会因应用爆发驱动新一轮算力扩张。
表:推理模型与语言模型关键差异
维度传统语言模型推理模型(如o1/R1)
训练方式监督微调(SFT)为主强化学习(RL)为核心
逻辑推理能力较弱强,可解决复杂数学/编码问题
推理时思考一次性输出多步思考,可延长思考时间提精度
算力消耗分布集中于预训练后训练+推理占比提升
客服
商务合作
小程序
服务号
折叠