1、知行融贯发育:通用具身智能的基石与引擎浙江人形机器人创新中心有限公司具身智能是支撑人形机器人万亿市场的关键物理实体的行为智能,通过与环境交互获得知识(by 图灵)并泛化应用LLM多模态基础模型底座VLM顶层 Agent 认知框架Agentic 智能体Code as Policy 代码策略主流算法主干VLA/VLN 端到端具身策略WAM 世界动作模型AC-WM 动作条件世界模型Policy ModelWorld ModelSystem2:慢脑决策任务规划与序列决策System1:快脑规划动作生成与动态响应System0:实时控制底层运动与伺服调节快慢脑分层架构/问题与挑战1、VLM 模型不完善,
2、开放混杂场景下容易看不清、识不准2、VLM 不包含物理交互信息,难以支撑行为的高精准、高可靠3、WM 统计学习到视觉表征的简单常规物理,难以支撑机器人真实物理交互控制4、当前行为主要为抓放,难以满足多样化任务需求5、学习结果受数据及VLM、WM能力约束,迁移泛化能力有限6、视力触兼具的大规模高质量具身交互数据匮乏机器人应用需求:可泛化、高精准、高可靠、高效率、低成本mm级亚mm级99.99%人工效率机器人+算力?浙江人形具身智能架构:SPIRESPIRE真实世界环境物体行为仿真环境大规模新数据生成与训练重构重定向VLM已有专家模型已有专家模型机器人在真实场景下具体任务执行真机强化部分力触交互少
3、量真机训练ZeroShot推理生成预预测测模模型型行行为为策策略略视力触通用表征浙江人形具身智能架构:SPIRE世 界 模 型具 身 模 型C2L2:适应混杂开放场景长序列探索规划的大脑 认知基础模型:增强VLM空间能力感知重构模型:稀疏+稠密+语义即时预测模型:非接触式/接触式M2S2:适应各种物体的多模态语义技能小脑数 据人类数据仿真数据:Real2Sim重构及生成真机数据+即时预测模型即时预测行为策略模型 认知基础模型+感知重构模型+即时探索调整策略 专 家 模 型以分层加强、深度融合、协同进化为核心思想兼顾沿途下蛋落地应用与高效端到端模型学习数据:多源融合,实现低成本、高质量数据的大规
4、模获取 人类数据=义务教育通过大规模人类行为数据和环境数据预训练,让模型获得通识理解能力,知道“真实世界是怎样、正常人会怎么做”仿真数据=高等教育通过高保真场景重构、生成、扩增,让模型在仿真中大规模反复练习,掌握可泛化精准作业的基础知识 真机数据=职业教育通过多模态真机数据,在特定场景中高效完成真实任务,让模型“毕业即上岗”数据:多源融合,实现低成本、高质量数据的大规模获取人类行为数据学习与迁移泛化人类世界数据高保真重构与生成大规模仿真训练数据:多源融合,实现低成本、高质量数据的大规模获取头、手、臂、腰全身联动和柔顺交互,实现视、力、触、及运动信息的精准获取视力触兼具的高质量真机数据采集世界模
5、型:分层强化,并与行为深度融合 认知基础模型=通识增强VLM的物体和空间关系的认知与理解能力形成应对各种场景和未来不确定性的可迁移基础能力 感知重构模型=述真 构建机器人当前环境的信息,疏密结合,语义融合支撑高效鲁棒长序列规划与决策 即时预测模型=想象预测环境中各类物体接触/非接触下的状态提升机器人行为规划和决策的有效性与安全性世界模型:分层强化,并与行为深度融合1、认知基础模型:通识,增强VLM的物体和空间关系的认知与理解能力为VLM扩增物体级空间语义知识,让大模型准确理解场景中的空间关系、物体位姿等几何信息形成基于检索增强的行为规划新框架RAM,能将复杂语言或图像指令分解为带有精确空间约束
6、的可执行子步骤在位置、姿转、空间等推理维度上对比SOTA平均提升超40%在涵盖多物体、长程依赖与复杂空间约束的实机操作任务中平均成功率达92%“Move the spoon to the right of the plate”1.Grasp the light blue spoon using its handle.The gripper should at the of blue spoon 0 to grasp this object.2.Lift the light blue spoon vertically.The of light blue spoon 0 should be pos