您的当前位置:首页 > 标签 > o3 AGI推理模型
AI行业专题报告:OpenAI 12天发布会总结——向AGI“泛化”-250214(20页).pdf
o3 AGI推理模型:ARC-AGI 87.5%,deliberative alignment减少人工标注|甬兴证券
甬兴证券研报显示OpenAI o3在ARC-AGI达87.5%(o1仅25%),提出deliberative alignment新范式,AGI能力亮眼,推理模型进入新阶段。
 2026-07-30
 AI产业
 20页
24张图表
数据来源:
AI行业专题报告:OpenAI 12天发布会总结——向AGI“泛化”-250214(20页) 查看报告
甬兴证券报告聚焦OpenAI压轴发布的o3模型。Day12发布的o3模型在ARC-AGI基准测试中取得87.5%的高分(低计算75.7%),而o1仅25%,性能达三倍以上。o3可在响应前暂停、考虑相关提示并解释推理过程,可调推理时间分为低/中/高三种计算级别。o3提出训练端新范式deliberative alignment,可减少对人工标注训练内容的依赖。o3的发布标志着推理模型从“能用”进入“好用”阶段,AGI能力显著加强,为AI Agent在复杂决策场景中的应用奠定基础。

o3性能突破——ARC-AGI 87.5%,达o1三倍

o3模型在ARC-AGI(抽象推理语料库)基准测试中表现亮眼。ARC-AGI被认为是衡量AI系统向通用人工智能(AGI)进展的重要标尺,要求模型在未见过的抽象推理任务上展现灵活性和适应性。o3在高计算设置下获得87.5%的分数,低计算设置下得分为75.7%,而o1系列仅25%。这一跨越式的性能提升表明o3在推理能力上实现了质的飞跃。

o3还支持可调推理时间,分为低、中、高三种计算级别。计算级别越高,o3的任务执行性能越好。用户可根据任务复杂度灵活调配计算资源,在性能与成本之间取得平衡。o3 mini版本同步发布,为不同场景需求提供更轻量化的选择。

deliberative alignment——减少人工标注依赖的新范式

o3提出训练端新范式deliberative alignment。传统RLHF(基于人类反馈的强化学习)依赖大量人工标注数据,成本高、扩展性有限。deliberative alignment可在训练过程中减少对人工标注的依赖,通过模型自身推理能力实现对齐。

这一技术突破具有深远产业意义:大幅降低大模型训练的人力成本,使中小企业和开发者也能定制高性能模型;加速AI能力的泛化,使模型在特定垂直领域(如法律、医疗、金融)快速获得接近o3级别的推理能力;为AGI发展提供更高效的技术路径,从“数据驱动”转向“推理驱动”。

推理模型产业影响——AI Agent迈向高级推理时代

o3的发布标志着推理模型从“能用”进入“好用”阶段。推理能力一直是制约AI应用场景拓展的关键瓶颈。o3的突破使AI Agent能够处理更具挑战性的任务流程,从简单的指令执行升级为具备结构化思维的智能协作者。

在金融分析、科研探索等对推理深度要求较高的专业领域,Agent将能够提供更接近人类专家水平的决策支持。API成本方面,o1模型API较预览版思考成本降低60%,附带高级视觉功能。GPT-4o音频成本降低60%,mini版本价格降低10倍。低成本推理模型将加速AI Agent在各垂直领域的商业化落地。
o3 vs o1性能对比
指标o1系列o3提升
ARC-AGI得分(高计算)25%87.5%3.5倍
ARC-AGI得分(低计算)75.7%
推理时间可调低/中/高三档灵活计算
训练范式RLHF(人工标注)Deliberative Alignment减少人工标注
客服
商务合作
小程序
服务号
折叠