Skip to main content
QUICK REVIEW

[论文解读] Time Reversal as Self-Supervision

Suraj Nair, Mohammad Babaeizadeh|arXiv (Cornell University)|Oct 2, 2018
Robot Manipulation and Learning参考文献 41被引用 13
一句话总结

该论文提出TRASS(时间反演作为自监督),一种自监督方法,通过训练时间反演模型(TRM)从目标状态反向预测轨迹,实现无需示范或特权信息的目标导向策略学习。结合视觉模型预测控制,该方法在仅使用RGB输入且无真实状态监督的情况下,实现在真实世界中拼接积木的75%成功率(已见积木对)和50%成功率(未见积木对)。

ABSTRACT

A longstanding challenge in robot learning for manipulation tasks has been the ability to generalize to varying initial conditions, diverse objects, and changing objectives. Learning based approaches have shown promise in producing robust policies, but require heavy supervision to efficiently learn precise control, especially from visual inputs. We propose a novel self-supervision technique that uses time-reversal to learn goals and provide a high level plan to reach them. In particular, we introduce the time-reversal model (TRM), a self-supervised model which explores outward from a set of goal states and learns to predict these trajectories in reverse. This provides a high level plan towards goals, allowing us to learn complex manipulation tasks with no demonstrations or exploration at test time. We test our method on the domain of assembly, specifically the mating of tetris-style block pairs. Using our method operating atop visual model predictive control, we are able to assemble tetris blocks on a physical robot using only uncalibrated RGB camera input, and generalize to unseen block pairs. sites.google.com/view/time-reversal

研究动机与目标

  • 解决在无示范或特权状态信息条件下学习鲁棒操作策略的挑战。
  • 实现在视觉操作任务中对未见物体和初始状态的泛化能力。
  • 开发一种自监督方法,利用任务易于反演的特性(例如,拔下笔帽)来推断高层次任务结构。
  • 仅使用未校准的RGB观测,实现复杂装配任务中的仿真到现实的迁移。

提出的方法

  • 通过扰动目标状态并记录前向动力学来收集轨迹,然后将轨迹反转以生成监督数据。
  • 训练时间反演模型(TRM)从当前状态预测反向轨迹,从而有效学习返回目标的路径。
  • 利用TRM从任意当前状态生成引导状态轨迹,即使目标未知也能实现。
  • 将TRM与视觉模型预测控制(MPC)结合,生成用于真实机器人执行的低层动作。
  • 在仿真中应用领域随机化,以实现无需相机校准的仿真到现实迁移。
  • 将高层规划(通过TRM实现)与低层控制解耦,实现模块化学习并提升规划效率。

实验结果

研究问题

  • RQ1时间反演任务轨迹能否为无示范或真实目标状态信息的操纵策略学习提供有效的自监督信号?
  • RQ2TRM在真实世界操作任务中对未见积木对的泛化能力如何?
  • RQ3在仿真中通过领域随机化训练的TRM能否成功实现复杂装配任务的仿真到现实迁移?
  • RQ4与稀疏奖励或完全监督基线相比,TRM是否在视觉控制任务中表现更优?
  • RQ5基于TRM的规划是否能减少视觉操作任务中对大量探索或特权状态信息的依赖?

主要发现

  • TRASS在真实世界的KUKA IIWA-7机器人上仅使用未校准的RGB输入且无任何示范,实现了对已见积木对75%的成功率,对未见积木对50%的成功率。
  • 在未见积木对上,该方法的成功率比稀疏奖励基线高出两倍以上,同时与完全监督基线性能相当。
  • 通过领域随机化实现了成功的仿真到现实迁移,真实世界性能甚至优于仿真,原因在于仿真中接触噪声更小。
  • 在825条真实机器人轨迹上微调视觉动力学模型并未提升性能,表明激进的领域随机化已提供足够的鲁棒性。
  • 训练期间移除相机随机化对真实世界成功率无显著影响,表明模型对视觉领域偏移具有强泛化能力。
  • 该方法成功使视觉MPC仅通过反向轨迹的自监督信号,解决了复杂的类似俄罗斯方块的积木拼接任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。