Skip to main content
QUICK REVIEW

[论文解读] Learning Cross-Domain Correspondence for Control with Dynamics Cycle-Consistency

Qiang Zhang, Tete Xiao|arXiv (Cornell University)|Dec 17, 2020
Reinforcement Learning in Robotics参考文献 41被引用 22
一句话总结

本文提出了一种动态循环一致性框架,用于在视觉与状态空间中未配对、未对齐的数据之间学习跨域对应关系,从而在模态、物理参数和形态不同的领域之间实现零样本策略迁移。通过在不同领域间强制保持时间动态的一致性,该方法在无需微调的情况下实现了精确的状态估计与策略迁移,其性能优于Cycle-GAN等基线方法,在真实机器人和仿真任务中表现更优。

ABSTRACT

At the heart of many robotics problems is the challenge of learning correspondences across domains. For instance, imitation learning requires obtaining correspondence between humans and robots; sim-to-real requires correspondence between physics simulators and the real world; transfer learning requires correspondences between different robotics environments. This paper aims to learn correspondence across domains differing in representation (vision vs. internal state), physics parameters (mass and friction), and morphology (number of limbs). Importantly, correspondences are learned using unpaired and randomly collected data from the two domains. We propose \ extit{dynamics cycles} that align dynamic robot behavior across two domains using a cycle-consistency constraint. Once this correspondence is found, we can directly transfer the policy trained on one domain to the other, without needing any additional fine-tuning on the second domain. We perform experiments across a variety of problem domains, both in simulation and on real robot. Our framework is able to align uncalibrated monocular video of a real robot arm to dynamic state-action trajectories of a simulated arm without paired data. Video demonstrations of our results are available at: https://sjtuzq.github.io/cycle_dynamics.html .

研究动机与目标

  • 为解决在模态(如视觉与状态)、物理参数(质量、摩擦)和形态(如肢体数量)不同的领域之间学习对应关系的挑战。
  • 在无需配对数据或在目标领域进行微调的情况下,实现领域之间的零样本策略迁移。
  • 通过引入跨领域的动态一致性,克服先前依赖配对轨迹或基于不变性表示方法的局限性。
  • 使用来自两个领域的未配对、随机收集的数据,学习联合观测与动作对应关系。

提出的方法

  • 该方法使用一个四重动态链,连接两个领域之间的观测与动作:真实机器人图像与仿真状态轨迹。
  • 引入一个领域转换器 $ G: \mathbf{x}_t \mapsto \mathbf{y}_t $,将真实图像映射到仿真状态,同时在仿真领域中使用前向动态模型 $ F: \mathbf{y}_t \times \mathbf{u}_t \mapsto \mathbf{y}_{t+1} $。
  • 核心约束为动态循环一致性:在两个领域中动作一致的前提下,仿真领域中预测的下一状态必须与真实机器人下一观测的图像到状态转换结果一致。
  • 该框架联合优化转换器与动态模型,使用来自两个领域的未配对三元组(观测、动作、下一观测)进行训练。
  • 采用一种新颖的动作重复初始化策略,以在形态不同的智能体之间迁移策略时提升训练稳定性。
  • 该方法无需访问真实机器人内部状态,仅需未经校准的RGB视频输入即可运行。

实验结果

研究问题

  • RQ1动态循环一致性是否能够实现真实机器人与仿真数据之间未配对、未校准数据的精确跨域对应学习?
  • RQ2当模态与物理参数不同时,该方法在无需微调的情况下,将仿真中训练的策略迁移到真实机器人上的表现如何,尤其在复杂控制任务中?
  • RQ3在复杂的真实世界控制任务中,将动态信息整合进对应学习是否优于纯视觉翻译方法(如Cycle-GAN)?
  • RQ4该框架在不同形态(如肢体数量不同的机器人)之间具有多大程度的泛化能力?
  • RQ5该方法是否能够仅从原始RGB视频中学习联合状态估计,而无需访问真实机器人内部状态?

主要发现

  • 在真实机器人实验中,该方法在随机运动下的末端执行器位置估计L1误差为0.025,在平滑运动下为0.033,显著优于Cycle-GAN的0.18和0.21。
  • 即使在使用更高维的关节位姿观测(7个关节)时,该方法在随机运动下的L1误差仍保持在0.031,表明其对复杂度增加具有鲁棒性。
  • 该方法成功将仿真中训练的策略无微调地迁移到真实xArm机器人上,而依赖Cycle-GAN或动作重复初始化的基线方法则完全失败。
  • 可视化结果表明,预测的仿真状态与真实机器人运动高度一致,验证了学习到的对应关系的有效性。
  • 动态循环一致性目标被证明至关重要——忽略动态信息的方法(如Cycle-GAN)尽管使用了未配对数据,仍无法学习到有意义的对应关系。
  • 该框架在多种不同领域间表现出良好泛化能力,包括模态转换(视觉与状态)、物理差异(摩擦、质量)以及形态变化(肢体数量)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。