Dyna Robotics发布Dyna-2:机器人操作模型预训练超百万小时人类视频
近日,Dyna Robotics发布了名为Dyna-2的新型世界动作模型。该模型通过超过一百万小时的第一人称视角人类视频进行预训练,相当于大约170年的连续清醒时间体验。与传统机器人学习依赖于手动标注的动作数据不同,Dyna-2尝试利用普通的人类视频来替代这些数据。研发团队构建了一个从1,000到1,000,000小时的数据阶梯,并测量了哪些部分可以扩展。研究结果包括人类数据的缩放规律、首次将该规律转移到未见过的机器人数据上,以及证据表明视频预测驱动了这种转移。Dyna-2采用了一种混合变压器架构,其中视频和动作分别被标记化并使用不同的DiT层堆栈处理,两者之间可以相互关注。模型在训练过程中采用了流匹配技术,并且视频损失和动作损失共享一个主干作为两个独立的边际速度场。目前Dyna-2作为一个由供应商操作的系统提供服务,在酒店、餐厅和洗衣店等场所部署,并适用于需要重复性和固定位置操作工作的中型市场服务商和多站点企业。
