AI大模型正面临“数据饥饿”危机。财通证券研报指出,GPT-5项目已进行18个多月、至少两次大型训练未达预期,一次六个月训练运行成本高达约5亿美元,微软原预计2024年年中看到新模型的计划也已落空。OpenAI联合创始人Ilya Sutskever在NeurIPS 2024明确表示“我们所知道的预训练将会结束”,因为“数据如同人工智能的化石燃料,正在被人们使用殆尽”。高质量数据枯竭已成为Scaling Law继续生效的核心瓶颈,合成数据、算法优化和强化学习成为破局关键。
高质量数据:AI的“化石燃料”正在枯竭
2024年12月,《华尔街日报》发表的《The Next Great Leap in AI Is Behind Schedule and Crazy Expensive》一文揭示了OpenAI GPT-5项目的困境。GPT-5已进行18个多月,至少两次大型训练结果未达预期。一次六个月的训练运行计算成本可能高达约5亿美元,技术调整后还需更多数据,成本将进一步增加。
Ilya Sutskever在NeurIPS 2024演讲中指出,计算能力在不断提升(硬件更好、算法更优、集群更大),但数据量却没有增长——“因为只有一个互联网,数据就如同人工智能的化石燃料,是在某个时候被创造出来,现在正在被人们使用殆尽。”公共互联网数据量不足直接限制了GPT-5的智能提升。
高质量数据的稀缺性体现在多个维度:公共互联网的高质量文本数据已被大量抓取,版权数据获取存在法律和商业障碍,专业领域数据(医疗、金融、科研等)获取成本高昂且受隐私保护限制。数据增长速度远低于模型规模增长速度,已成为Scaling Law继续生效的最大瓶颈。
Ilya Sutskever在NeurIPS 2024演讲中指出,计算能力在不断提升(硬件更好、算法更优、集群更大),但数据量却没有增长——“因为只有一个互联网,数据就如同人工智能的化石燃料,是在某个时候被创造出来,现在正在被人们使用殆尽。”公共互联网数据量不足直接限制了GPT-5的智能提升。
高质量数据的稀缺性体现在多个维度:公共互联网的高质量文本数据已被大量抓取,版权数据获取存在法律和商业障碍,专业领域数据(医疗、金融、科研等)获取成本高昂且受隐私保护限制。数据增长速度远低于模型规模增长速度,已成为Scaling Law继续生效的最大瓶颈。
| 维度 | 挑战 | 影响 |
|---|---|---|
| 公共互联网数据 | 高质量文本数据已大量抓取 | GPT-5智能提升受限 |
| 版权数据 | 获取存在法律和商业障碍 | 训练数据多样性不足 |
| 专业领域数据 | 获取成本高昂、隐私保护限制 | 垂直领域模型优化困难 |
| 数据增速 | 远低于模型规模增速 | Scaling Law边际效益递减 |
Transformer架构与人脑思考机制的差距
Transformer架构未能完全表达人脑的思考机制。当前LLM的主流框架依旧是Transformer架构,通过模仿人脑的思考机制,利用自注意力机制并行处理序列元素,显著提升了训练速度和长距离依赖建模能力。
然而,从神经科学的角度来看,人脑的复杂性依然远远超过当前的LLM。尽管LLM的参数和连接数已达到数万亿个,但仍无法与人脑的复杂性相提并论。人类大脑的进化依赖于选择和投注机制,以较低的容量实现更高效的信息处理。
当前AI的局限性可能不仅在于数据不足,更在于学习效率低下。真正的智能不仅仅是数据量的堆积,更在于对信息的压缩和提炼,类似于通过总结第一性原理的方式获取更深层次的智能。除了Transformer架构中提出的注意力机制外,人脑中仍有许多尚未被算法表达的思考机制,这些机制在未来可能进一步推动大语言模型实现能力的跃升。
然而,从神经科学的角度来看,人脑的复杂性依然远远超过当前的LLM。尽管LLM的参数和连接数已达到数万亿个,但仍无法与人脑的复杂性相提并论。人类大脑的进化依赖于选择和投注机制,以较低的容量实现更高效的信息处理。
当前AI的局限性可能不仅在于数据不足,更在于学习效率低下。真正的智能不仅仅是数据量的堆积,更在于对信息的压缩和提炼,类似于通过总结第一性原理的方式获取更深层次的智能。除了Transformer架构中提出的注意力机制外,人脑中仍有许多尚未被算法表达的思考机制,这些机制在未来可能进一步推动大语言模型实现能力的跃升。
破局方向:合成数据、算法优化与强化学习
面对数据枯竭,业界正在探索多条破局路径。合成数据是重要方向之一——通过AI生成训练数据来扩充数据集,但需防范模型坍缩风险(模型使用自身生成的数据训练可能导致性能退化)。算法优化方面,DeepSeek通过MoE架构、FP8混合精度训练等技术,将训练效率提升了数倍,验证了算法创新可以部分替代数据扩张。
强化学习成为激活现有模型推理能力的关键工具。DeepSeek-R1-Zero首次完全摒弃监督微调、完全依赖强化学习训练,证明无监督或弱监督学习在提升模型推理能力方面具有巨大潜力。OpenAI o1/o3模型也验证了后训练阶段强化学习存在Scaling Law。
OpenAI CEO Sam Altman表示,AI使用成本每12个月约降低10倍,智能水平增长的社会经济价值呈超级指数型增长。建议关注AI算力产业链中受益于算法优化和推理需求增长的方向,包括CPU/GPU与服务器、IDC厂商、AI服务器液冷和电源等环节。
强化学习成为激活现有模型推理能力的关键工具。DeepSeek-R1-Zero首次完全摒弃监督微调、完全依赖强化学习训练,证明无监督或弱监督学习在提升模型推理能力方面具有巨大潜力。OpenAI o1/o3模型也验证了后训练阶段强化学习存在Scaling Law。
OpenAI CEO Sam Altman表示,AI使用成本每12个月约降低10倍,智能水平增长的社会经济价值呈超级指数型增长。建议关注AI算力产业链中受益于算法优化和推理需求增长的方向,包括CPU/GPU与服务器、IDC厂商、AI服务器液冷和电源等环节。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共54套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
计算机产业
15页
18张图表
0731-84720580
商务合作:really158d
微信扫码登录
手机快捷登录
账号登录