ღ◈✿,最好能在动手之前ღ◈✿,能够像人类在脑海里“过一遍”ღ◈✿,预判哪种动作更稳妥ღ◈✿。5月31日ღ◈✿,上海创智学院罗剑岚团队发布开源具身世界模型τ-WMღ◈✿,通过多源异构数据预训练ღ◈✿,围绕动作预测ღ◈✿、未来状态模拟和部署阶段动作优化ღ◈✿,构建了一套完整系统ღ◈✿,试图让
相比大语言模型擅长理解文字ღ◈✿,传统控制程序擅长执行固定动作ღ◈✿,具身世界模型要解决的是ღ◈✿:如何理解“动作改变现实世界”ღ◈✿。
罗剑岚解释ღ◈✿,它像是给装上一个带有物理常识ღ◈✿、能够预测未来画面的“大脑”ღ◈✿。“不仅看见眼前有什么ღ◈✿,也不只是机械地输出下一步动作ღ◈✿,而是能把候选动作放进模型里推演ღ◈✿:这样抓会怎样ღ◈✿,那样倒会怎样ღ◈✿,哪一种更可能成功ღ◈✿、更安全ღ◈✿。”
以倒果汁任务为例ღ◈✿,机器人左手拿杯第4色最新地址ღ◈✿、右手拿瓶时第4色最新地址ღ◈✿,可以先生成多种相近动作轨迹ღ◈✿。随后ღ◈✿,τ-WM仿真器预测这些轨迹对应的未来画面ღ◈✿,并进行评分——果汁顺利倒入杯中ღ◈✿,评分较高ღ◈✿;洒到桌面或撞倒杯子ღ◈✿,评分较低ღ◈✿。最终ღ◈✿,机器人执行分数最高的动作ღ◈✿。
对普通用户来说ღ◈✿,这意味着机器人不再只是“看见后反应”ღ◈✿,而是在“想过后行动”ღ◈✿。罗剑岚指出第4色最新地址ღ◈✿,这也是具身智能走向通用机器人的一个关键问题——机器人不能只会听懂人类命令澳门太阳集团官网下载ღ◈✿,还要能判断自己的动作会带来什么后果ღ◈✿。
不过ღ◈✿,目前机器人训练长期面临“任何单一数据源都不够”的现实困境ღ◈✿。真机数据有准确的动作标签第4色最新地址ღ◈✿,但往往局限在特定机器人本体ღ◈✿、任务数量和实验环境中ღ◈✿;UMI(通用操作接口)数据由人佩戴头部相机和夹爪ღ◈✿,在家庭ღ◈✿、商超等场景采集ღ◈✿,可以扩大任务和环境覆盖ღ◈✿,但与真机动作标签存在差异ღ◈✿;第一视角人类视频记录了大量人手操作和物体交互细节ღ◈✿,却缺少机器人关节动作ღ◈✿;开源机器人数据则来自不同平台和不同构型ღ◈✿,格式和规范也并不统一ღ◈✿。
τ-WM模型把这些多源异构数据纳入了同一训练框架ღ◈✿。据介绍澳门太阳集团官网下载ღ◈✿,该模型使用约3万小时多样化数据进行预训练ღ◈✿,包括真机数据ღ◈✿、UMI数据ღ◈✿、第一视角数据等ღ◈✿,并通过统一预训练动作空间ღ◈✿,让不同本体数据和带动作标签的数据尽可能共同发挥作用ღ◈✿。
这意味着ღ◈✿,模型不再只是从一种机器人ღ◈✿、一个场景ღ◈✿、一类任务中学习ღ◈✿,而是从多种“身体”ღ◈✿、多种环境ღ◈✿、多种操作中提炼更通用的物理经验第4色最新地址ღ◈✿。学习了大量“动作如何改变场景”的视频片段ღ◈✿,τ-WM不仅记住动作样子ღ◈✿,而且学习物体交互的规律ღ◈✿:被推的物体会移动ღ◈✿,被碰的物体可能倾倒澳门太阳集团官网下载ღ◈✿,被拿起的物体会改变位置ღ◈✿。对机器人来说ღ◈✿,这类经验正是从演示走向陌生场景的基础澳门太阳集团官网下载ღ◈✿。开源也让这项工作具备更强的公共价值ღ◈✿,有助于更多团队在同一基础上验证ღ◈✿、改进和拓展ღ◈✿。
“用大规模混合数据训练第4色最新地址ღ◈✿,让机器人获得更强的未来推演ღ◈✿、动作选择和跨任务泛化能力”ღ◈✿,罗剑岚认为ღ◈✿,τ-WM验证了一条具身基础模型的新路径ღ◈✿。
同时ღ◈✿,τ-WM已经显示出对环境变化更强的适应能力ღ◈✿。灯光ღ◈✿、背景ღ◈✿、物体纹理发生变化ღ◈✿,或物品类型ღ◈✿、位置发生变化时ღ◈✿,机器人仍能保持较高任务成功率ღ◈✿。对于家庭ღ◈✿、商超ღ◈✿、工厂等真实场景来说ღ◈✿,这类变化几乎每天都会发生ღ◈✿。
“这并不意味着通用服务机器人已经到来ღ◈✿,具身世界模型仍处在快速发展阶段ღ◈✿。”罗剑岚强调ღ◈✿,τ-WM是预训练基础模型ღ◈✿,特点是通用泛化能力ღ◈✿,可以支持多类任务ღ◈✿,但并不等于已经专精于所有真实场景ღ◈✿。距离稳定可靠的机器人ღ◈✿,还需要解决大量低频但影响成功率的长尾问题ღ◈✿。
这也使τ-WM与团队此前LWD(边部署边学习)研究形成互补ღ◈✿。LWD强调“边部署边学习”ღ◈✿,让机器人在真实物理世界交互中继续后训练ღ◈✿;τ-WM强调“行动前预演”第4色最新地址ღ◈✿,通过仿真器提前排除低质量动作ღ◈✿、降低探索成本澳门太阳集团官网下载ღ◈✿。如果说τ-WM让机器人先在脑中试错ღ◈✿,LWD则让机器人在真实执行后继续复盘ღ◈✿。太阳成集团tyc9728ღ◈✿,太阳成集团122cc官网太阳成集团ღ◈✿。澳门太阳集团ღ◈✿,太阳集团ღ◈✿,suncitygroup太阳成ღ◈✿,太阳成集团tyc234cc[主页]网址