[论文解读] Visual Imitation Made Easy
本文提出一种低成本、可扩展的视觉模仿学习接口,利用市售的伸缩抓取工具收集多样化的真实世界示范。通过结合运动结构(SfM)与手指检测网络,提取3D工具轨迹与夹爪状态,实现数据增强下的直接行为克隆,成功实现87.5%的推物任务成功率与62.5%的堆叠任务成功率,且针对未见过的物体——证明使用简单工具进行大规模、多样化数据采集可显著提升策略泛化能力。
Visual imitation learning provides a framework for learning complex manipulation behaviors by leveraging human demonstrations. However, current interfaces for imitation such as kinesthetic teaching or teleoperation prohibitively restrict our ability to efficiently collect large-scale data in the wild. Obtaining such diverse demonstration data is paramount for the generalization of learned skills to novel scenarios. In this work, we present an alternate interface for imitation that simplifies the data collection process while allowing for easy transfer to robots. We use commercially available reacher-grabber assistive tools both as a data collection device and as the robot's end-effector. To extract action information from these visual demonstrations, we use off-the-shelf Structure from Motion (SfM) techniques in addition to training a finger detection network. We experimentally evaluate on two challenging tasks: non-prehensile pushing and prehensile stacking, with 1000 diverse demonstrations for each task. For both tasks, we use standard behavior cloning to learn executable policies from the previously collected offline demonstrations. To improve learning performance, we employ a variety of data augmentations and provide an extensive analysis of its effects. Finally, we demonstrate the utility of our interface by evaluating on real robotic scenarios with previously unseen objects and achieve a 87% success rate on pushing and a 62% success rate on stacking. Robot videos are available at https://dhiraj100892.github.io/Visual-Imitation-Made-Easy.
研究动机与目标
- 为解决视觉模仿学习中大规模、多样化数据采集的瓶颈,通过替换如遥操作或身体引导等限制性接口。
- 利用低成本、广泛可用的辅助工具(如伸缩抓取器)实现高效的真实世界数据采集。
- 证明使用此类工具收集的视觉示范数据,可直接进行行为克隆并泛化至新物体与新环境。
- 评估数据增强与数据多样性对真实机器人场景中策略性能的影响。
提出的方法
- 使用市售的伸缩抓取工具作为数据采集接口及机器人的末端执行器,确保策略的直接可迁移性。
- 在家庭与办公室等多种真实环境中执行任务时,通过安装在伸缩抓取工具上的摄像头采集RGB视频示范。
- 利用现成的运动结构(SfM)技术从采集的视频序列中提取3D工具轨迹。
- 通过训练好的手指检测网络检测夹爪手指状态,从而从视觉示范中推断动作级信息。
- 利用提取的轨迹与动作数据,通过标准行为克隆方法训练策略,并结合数据增强以提升泛化能力。
- 将学习到的策略直接部署到具有相同末端执行器配置的机器人上,实现在未见物体上的零样本部署。
实验结果
研究问题
- RQ1能否将辅助工具(如伸缩抓取器)用作可扩展、低成本的接口,用于收集机器人学习所需的多样化视觉示范?
- RQ2来自真实世界示范的数据多样性与规模如何影响视觉模仿学习中的策略泛化?
- RQ3数据增强技术在非抓取推物与抓取堆叠任务中,对未见物体的策略性能提升程度如何?
- RQ4使用辅助工具收集的视觉示范进行行为克隆,能否在真实机器人部署中超越传统方法?
主要发现
- 所提出的DemoAT框架在未见物体的非抓取推物任务中达到87.5%的成功率,在抓取堆叠任务中达到62.5%的成功率,显著优于朴素行为克隆方法。
- 数据增强技术,特别是推物任务中的裁剪+抖动与堆叠任务中的旋转+抖动,分别使BC-MSE指标提升0.7%与0.9%。
- 仅使用50%训练数据并结合数据增强,其性能在推物与堆叠任务中均超过使用100%原始数据的朴素行为克隆。
- 在仅使用50%数据并结合增强技术训练的模型,在推物任务中首次成功抵达目标物体的阶段达到100%成功率,表明其具备从有限数据中强大泛化能力。
- 在多个场景中稀疏观测的多样化数据集,优于重复场景较多的非多样化数据集,测试误差降低1.4%(0.067 vs. 0.081)。
- 数据增强带来的性能提升在任务后期最为显著,堆叠任务在初始抓取阶段后成功率提升33.4%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。