1、具身智能 Agent:从VLA/VA模型到物理世界交互的落地实践李元庆家庭机器人的“理想”与“现实”隐形的需求与意图非结构化的室内环境交互的多模态与情感化出厂即定型,无法真的成长“需要被照顾的电子设备”家庭场景中,机器人的价值不在于它出厂时会多少技能,而在于它能否持续学习这个家庭的习惯、预判需求、并安全地融入日常生活。这需要我们从根本上改变设计逻辑:从“交付功能”转向“交付成长能力”家庭场景的“四座大山”离身智能能力具身智能能力语言理解视觉识别知识广度推理能力“还不错”物理交互场景适应鲁棒性持续学习“还不行”从“功能固化”到“持续进化”的最新技术栈Rule-BasedLearning-Base
2、d:Modular-BasedLearning-Based:End-to-EndPerceptionNavigation基于规划的Manipulation Rules/Constrains显式特征Latent隐式特征信息复用模型能力 NVIDIA WAM Physical Intelligence HelixReferencesa)World Action Models are Zero-shot Policiesb)RL Token:Bootstrapping Online RL with Vision-Language-Action Modelsc)A Vision-Language-Ac
3、tion Model for Generalist Humanoid Control Agent OpenClawClaude Code Skills RL:HIL-SERLDiffusion PolicyReasoning/AI/Memory/Verification/Locomotion/EvolutionManipulation:Learning with Auxiliary Tasks技术层拓展智能机器人扩充技术层HMIVRARMRXR动作捕捉技术新型交互方式控制层控制层数孪虚拟测试交互层交互层高保真仿真技术控制模型层控制模型层可视化建模多体动力学建模模型融合技术数据驱动建模数据安全网
4、络安全恶劣环境保护高密度能量电池能源-结构-感知一体化安全保障安全保障能源保障能源保障传统机器人已有技术层模型层模型层几何与结构建模数字孪生模型模型轻量化与部署交互层交互层智能决策层智能决策层HMI生物学一体控制生成式AI自然语言处理通用大模型深度学习强化学习统计学习优化算法姿态控制导航定位运动控制生物学一体控制操作平台操作平台硬件抽象与虚拟化开源定制化操作系统云化操作平台通信层通信层传统有限通信技术物联网协议5G/6G感知层感知层传统感知技术多模态感知技术执行层执行层执行驱动技术高动态响应执行一体化硬件技术辅助任务学习是一类训练范式,它在核心操作任务目标之外,引入额外的自监督或弱监督目标,以
5、强化策略学习。这些辅助目标促使模型学习环境、动作与目标的结构化表征,从而提升样本效率、泛化能力与鲁棒性。Learning with Auxiliary Tasks世界模型图像/视频预测对比学习掩码重建文本驱动目标提取视觉驱动目标提取主要路径OpenClaw 技术架构Gateway 网关:控制平面WebSocket网络通信执行大脑:Pi Agent 与 技能系统Pi Agent运行时(PRC模式)ClawHub技能注册表聊天指令集ToolStreamingBlock Streaming自动搜索扣取新功能内置技能工作空间技能ThinkResetStatusRPC安全与部署层安全沙箱Sandboxi
6、ng非主会话在独立Docker中运行限制对主机的访问权限敏感工具黑白名单管理部署与远程访问本体/远程灵活部署内网穿透连接生态:多渠道通信(Channels)多频道集成路由规则支持WhatsApp、Telegram、Slack、Discord、Google Chat、Signal、iMessage、Microsoft Teams、Matrix 等多种通讯平台复杂的群组路由逻辑,包括提及门控、回复标签处理以及针对不同频道的自动消息分块WS执行终端:Nodes&Apps跨平台支持macOS 菜单栏应用、iOS 节点和 Android 节点硬件能力调用摄像头拍/录像、屏幕录制、地理位置获取等Voice