您的当前位置:首页 > 标签 > VLA大模型城市NOA
2025智能驾驶行业策略:VLA大模型接力城市NOA渗透率有望继续高增-250323(19页).pdf
VLA大模型城市NOA:理想MindVLA 7月发布,端到端2.0时代开启|西部证券
西部证券报告显示,理想MindVLA将于2025年7月随i8发布,将空间智能/语言智能/行为智能统一,VLA模型需10万辆级数据+Thor高算力芯片,城市NOA体验从“可用”迈向“爱用”。
 2026-07-29
 无人驾驶
 19页
2张图表
数据来源:
2025智能驾驶行业策略:VLA大模型接力城市NOA渗透率有望继续高增-250323(19页) 查看报告
2025年智能驾驶技术基调基本确定——大模型赋能下的端到端2.0,即VLA(视觉-语言-动作模型)。西部证券最新策略报告指出,理想MindVLA将于2025年7月伴随纯电SUV车型i8同步发布,元戎启行正基于英伟达Thor芯片研发VLA模型。VLA将空间智能、语言智能和行为智能统一在一个模型里,赋予自动驾驶物理系统感知、思考和适应环境的能力,推动城市NOA体验从“可用”迈向“爱用”。

VLA模型——端到端2.0的技术内核

VLA模型不是简单地将端到端模型和VLM模型结合在一起,而是将空间智能、语言智能和行为智能统一在一个模型里。所有模块全新设计,3D空间编码器与语言模型和逻辑推理结合,给出驾驶决策并输出action token,最终通过diffusion优化出最佳驾驶策略,整个推理过程在车端实时运行。关键技术包括:使用能够承载丰富语义的设计打破传统自动驾驶技术框架;从0开始设计和训练适合VLA的LLM基座模型;使用语言模型处理复杂交通规则和场景理解,Diffusion用于生成优化的驾驶行为;实现模型参数规模与实时推理性能之间的平衡。

理想MindVLA——听得懂、看得见、找得到的专职司机

根据理想官方公众号,MindVLA赋能的汽车是听得懂、看得见、找得到的专职司机。“听得懂”指用户可通过语音指令改变车辆路线和行为——例如用户在陌生园区寻找超市,只需说“带我去找超市”,车辆将在没有导航信息的情况下自主漫游找到目的地;行驶过程中用户还可以说“开太快了”“应该走左边这条路”,MindVLA能理解并执行这些指令。VLA模型的应用将城市NOA从“规则驱动”推向“认知驱动”,体验从“能用”迈向“爱用”。

VLA落地条件——10万辆级数据+Thor高算力芯片

根据元戎启行CEO周光介绍,VLA模型的成功不仅依赖于强大的算力支持,如英伟达Thor芯片(300/500/700/1000/2000TOPS,2025年量产),还需要大量的数据积累——VLA架构至少需要10万辆级的量产车数据。VLA大模型对算力需求更大,将推动Thor芯片的起量。英伟达Thor相较Orin-X(254TOPS)算力提升显著,为VLA模型在车端实时运行提供算力保障。理想智驾总里程2024年12月达29.3亿公里,训练算力8.1EFLOPS,为MindVLA落地提供数据基础。

端到端+VLM到VLA的演进路径

2024年中理想发布“端到端+VLM”双系统架构,端到端系统负责感知、决策和执行全过程,VLM作为辅助系统提供对复杂交通场景的理解和语义解析。但该架构存在两个模型计算频率不同、联合训练困难、LLM对3D空间理解不足、OrinX算力带宽受限等问题。针对这些挑战,理想计划将两个模型合二为一,推动VLA落地。其他前瞻技术还包括视觉大语言模型VLM基座、基于扩散模型的端到端轨迹联合预测、端到端闭环仿真的3DGS和生成技术、世界模型解锁自动驾驶未来演进。
VLA模型关键技术参数
技术维度关键信息
发布时间理想MindVLA 2025年7月随i8发布
算力需求英伟达Thor(300-2000TOPS)
数据需求至少10万辆级量产车数据
技术架构3D空间编码器+LLM+Diffusion
核心功能听得懂(语音指令改变路线)、看得见(场景理解)、找得到(自主漫游)


2025年VLA大模型将开启端到端2.0时代,理想MindVLA于7月随i8发布,元戎启行同步推进。VLA将空间智能、语言智能和行为智能统一,推动城市NOA从“能用”迈向“爱用”。VLA落地需要10万辆级数据+Thor高算力芯片双重支撑,建议关注理想汽车、元戎启行产业链及相关芯片、数据标的。
客服
商务合作
小程序
服务号
折叠