您的当前位置:首页 > 标签 > 高质量数据枯竭AI影响
计算机行业大模型系列报告(二):Scaling Law启示录-250221(15页).pdf
高质量数据枯竭AI影响:GPT-5训练5亿美元未达预期,合成数据与算法优化成破局关键|财通证券
财通证券研报显示,GPT-5一次六个月训练成本高达5亿美元、至少两次大型训练未达预期。Ilya指出互联网数据如同化石燃料面临枯竭,高质量数据增速远低于模型规模增长。合成数据、算法优化和强化学习成Scaling Law新方向。
 2026-07-30
 计算机产业
 15页
18张图表
数据来源:
计算机行业大模型系列报告(二):Scaling Law启示录-250221(15页) 查看报告
AI大模型正面临“数据饥饿”危机。财通证券研报指出,GPT-5项目已进行18个多月、至少两次大型训练未达预期,一次六个月训练运行成本高达约5亿美元,微软原预计2024年年中看到新模型的计划也已落空。OpenAI联合创始人Ilya Sutskever在NeurIPS 2024明确表示“我们所知道的预训练将会结束”,因为“数据如同人工智能的化石燃料,正在被人们使用殆尽”。高质量数据枯竭已成为Scaling Law继续生效的核心瓶颈,合成数据、算法优化和强化学习成为破局关键。

高质量数据:AI的“化石燃料”正在枯竭

2024年12月,《华尔街日报》发表的《The Next Great Leap in AI Is Behind Schedule and Crazy Expensive》一文揭示了OpenAI GPT-5项目的困境。GPT-5已进行18个多月,至少两次大型训练结果未达预期。一次六个月的训练运行计算成本可能高达约5亿美元,技术调整后还需更多数据,成本将进一步增加。

Ilya Sutskever在NeurIPS 2024演讲中指出,计算能力在不断提升(硬件更好、算法更优、集群更大),但数据量却没有增长——“因为只有一个互联网,数据就如同人工智能的化石燃料,是在某个时候被创造出来,现在正在被人们使用殆尽。”公共互联网数据量不足直接限制了GPT-5的智能提升。

高质量数据的稀缺性体现在多个维度:公共互联网的高质量文本数据已被大量抓取,版权数据获取存在法律和商业障碍,专业领域数据(医疗、金融、科研等)获取成本高昂且受隐私保护限制。数据增长速度远低于模型规模增长速度,已成为Scaling Law继续生效的最大瓶颈。
高质量数据枯竭核心表现
维度挑战影响
公共互联网数据高质量文本数据已大量抓取GPT-5智能提升受限
版权数据获取存在法律和商业障碍训练数据多样性不足
专业领域数据获取成本高昂、隐私保护限制垂直领域模型优化困难
数据增速远低于模型规模增速Scaling Law边际效益递减

Transformer架构与人脑思考机制的差距

Transformer架构未能完全表达人脑的思考机制。当前LLM的主流框架依旧是Transformer架构,通过模仿人脑的思考机制,利用自注意力机制并行处理序列元素,显著提升了训练速度和长距离依赖建模能力。

然而,从神经科学的角度来看,人脑的复杂性依然远远超过当前的LLM。尽管LLM的参数和连接数已达到数万亿个,但仍无法与人脑的复杂性相提并论。人类大脑的进化依赖于选择和投注机制,以较低的容量实现更高效的信息处理。

当前AI的局限性可能不仅在于数据不足,更在于学习效率低下。真正的智能不仅仅是数据量的堆积,更在于对信息的压缩和提炼,类似于通过总结第一性原理的方式获取更深层次的智能。除了Transformer架构中提出的注意力机制外,人脑中仍有许多尚未被算法表达的思考机制,这些机制在未来可能进一步推动大语言模型实现能力的跃升。

破局方向:合成数据、算法优化与强化学习

面对数据枯竭,业界正在探索多条破局路径。合成数据是重要方向之一——通过AI生成训练数据来扩充数据集,但需防范模型坍缩风险(模型使用自身生成的数据训练可能导致性能退化)。算法优化方面,DeepSeek通过MoE架构、FP8混合精度训练等技术,将训练效率提升了数倍,验证了算法创新可以部分替代数据扩张。

强化学习成为激活现有模型推理能力的关键工具。DeepSeek-R1-Zero首次完全摒弃监督微调、完全依赖强化学习训练,证明无监督或弱监督学习在提升模型推理能力方面具有巨大潜力。OpenAI o1/o3模型也验证了后训练阶段强化学习存在Scaling Law。

OpenAI CEO Sam Altman表示,AI使用成本每12个月约降低10倍,智能水平增长的社会经济价值呈超级指数型增长。建议关注AI算力产业链中受益于算法优化和推理需求增长的方向,包括CPU/GPU与服务器、IDC厂商、AI服务器液冷和电源等环节。
客服
商务合作
小程序
服务号
折叠