自变量机器人今日发布HOST 框架Human-to-robot One-Shot Skill AcquisiTion人类到机器人单样本技能获取并开源能让机器人仅观察一段数十秒的人类视频就学会新技能同时保留已掌握的技能。HOST 采用了一种开创性的方法不去将人类动作翻译为机器人动作并试图模仿而是让机器人先想象执行动作后的结果再从结果拆分出需要执行的动作。这种全新方法的效果令人欣喜机器人从一段 29 秒人类视频中学习技能的成功率高达 62%超越零样本基线 45%。相比 Pi-0.5 微调方案HOST 所需数据量减少 50 倍学习技能速度提升 500 倍。模仿人类“观察学习”过程自动对齐视频任务进度HOST 的思路来自认知科学中的“观察学习”理论人类面对不熟悉的任务时不需要通过长期练习或者穷举来学习而是以先验能力在大脑中模拟动作的预期效果然后执行相应动作。自变量研究人员受此启发将 HOST 的学习方案从“训练时微调循环”变为“推理时技能获取”让机器人通过观察人类执行任务来学习新技能。机器人首先要解决的问题是如何对齐自己执行任务的进度和视频中的进度举例来说同样工作 10 秒视频中的人可能已经切完菜、开始炒菜了机器人还在切菜。如果只仅按时间对齐机器人就会丢失任务进度。对此HOST的做法是“按任务进度对齐”。HOST 会将视频每一帧和机器人操作每一步都转化为同一向量空间里的向量然后利用“动态时间规整”算法自动对齐“人类视频的第 X 帧和机器人操作的第 Y 步”。如此一来机器人执行到每一步时看到的永远都是和任务进度对齐的那一帧。凭借这种方法HOST 将对齐任务进度的时间误差降低了一个数量级能够做到机器人执行与视频示范的精准同步。机器人不再模仿人类动作而是从动作结果反推过程机器人学习人类经验的第二个难点在于机器人身体结构与人完全不同无法简单跟随视频“照着做”需要找到一种动作的翻译方式。机器人的构型千奇百怪如何找到一套通用解法HOST 规避了“对照身体结构”的问题分为三步解决首先机器人需要判断自己进行到任务的哪个部分。其次机器人需要将人类执行完动作的画面翻译成机器人自身视角和身体结构的画面。举例来说机器人看到人类拿起一杯水就要想象出机器人拿起水杯的画面。最后机器人从画面推断出需要执行的动作并执行这些动作。这个解法的优势在于它利用“看到人类动作结果-想象出机器人动作结果-拆解结果对应的机器人动作”的思路让机器人利用视觉推理看到结果画面再反推动作过程而不是机械地模仿人类动作从而绕开了“动作映射”的问题。模型训练两步走先预测机器人动作再迁移到人类教学HOST 的核心部分是一个带有视觉预测功能的级联策略模型。它采用双专家 MoT 架构如同两个分工明确的大脑“视觉大脑”视频专家专门处理视频画面、定位任务进度、预测未来图景“动作大脑”动作专家负责将预测图景转化为需要执行的动作并控制执行。在训练模型时自变量团队将训练过程拆分为“同体预训练”和“人机视频训练”两个阶段。在同体预训练阶段机器人通过学习机器人自身执行任务的视频学会预测完成任务后的状态并生成对应动作。在人机视频训练阶段机器人进一步学习人类演示视频将人类执行任务的过程转化为机器人视角下的任务结果再根据目标结果推理完成任务所需的动作实现从人类示范到机器人技能的迁移。如此分两步训练的优势在于人与机器人执行同一任务的匹配数据相对稀缺机器人执行任务的视频与轨迹则容易采集得多。先观看机器人视频打好“基本功”再迁移到人类视频学习能大幅提升数据训练模型的效率。学习新技能成功率高达 62%较主流方法提速 500 倍HOST 模型的权重在训练好后即冻结仅在推理过程中观看视频和复现技能。尽管全部学习素材只有一段视频它的学习效果仍令人感到欣喜仅观看一段平均 29 秒的人类视频HOST 复现技能的成功率高达 62%。相比之下Vid2Robot/AWDA 同样从一段视频中学习技能成功率仅有 19%。如果采用微调模型的方法给 Pi-0.5 示范 50 个机器人任务并花 4 小时微调训练成功率也仅有 38%。相比 Pi-0.5 微调方案HOST 仅需 1/50 的数据样本量和 1/500 的学习时间就能让成功率大幅提升 24%成为当前表现最好的机器人技能学习方案。不仅如此HOST 还能最大限度地保留已经学习的技能因为它仅根据视频来复现技能视频更像是“菜谱”可以放入书架随时调取。如此便实现了技能的持久化记忆和联想机制。相比之下Pi-0.5 微调方案学习新技能后过去技能的保留率仅有 17%。在泛化性方面HOST 测试了 50 个包含不同物体、工具和基本动作的任务均学习到新技能。在鲁棒性方面HOST 面对改变光照、替换物体、替换场景和移动物体等干扰成功率仍全部保持在 50% 以上。即使中途把物品挪走HOST 也能调整回来继续任务。这说明 HOST 不是在“死记硬背”动作序列而是真正理解任务、动态规划下一步动作。普通人也能教授新技能机器人迈向灵活学习新阶段简单来说HOST 将机器人学习技能的范式从“训练时微调循环”改变为“推理时技能获取”。它仅从一段数十秒的人类视频去学习技能成功率则远超主流模型经过后训练微调的效果。不仅如此HOST 还能随时调取技能解决了“灾难性遗忘”的问题。对此自变量机器人团队表示“在具身智能走出实验室、走进千家万户的进程中不应该只靠专业人员采集数据、反复训练来获得新技能。人与人之间通过示范传递技能是更加自然高效的学习方式。HOST 将技能获取从少数人的专业流程转变为任何人都能用一段视频完成教学。”目前HOST 的研究论文和代码已经全部开源。未来机器人在家庭劳动时有望摆脱专业化的数据采集和训练过程通过直观的人类演示就学会新技能。这将让智能机器人成为真正贴心可用的“家庭伙伴”让智能机器人服务人类的每一天。