Skip to main content
QUICK REVIEW

[論文レビュー] Learning Cross-Domain Correspondence for Control with Dynamics Cycle-Consistency

Qiang Zhang, Tete Xiao|arXiv (Cornell University)|Dec 17, 2020
Reinforcement Learning in Robotics参考文献 41被引用数 22
ひとこと要約

本稿では、視覚と状態空間の間でペア化されておらず、アライメントのとれていないデータ間のクロスドメイン対応関係を学習するためのダイナミクスサイクル整合性フレームワークを提案する。異なるモodalities(例:視覚対状態)、物理パrameter(質量、摩擦係数)、形状(例:脚の数)を持つドメイン間で、微調整なしにゼロショットポリシー転送を可能にする。ドメイン間で時間的ダイナミクスの整合性を保つことで、正確な状態推定とポリシー転送を達成し、Cycle-GANなどのベースラインを上回る性能を発揮した。

ABSTRACT

At the heart of many robotics problems is the challenge of learning correspondences across domains. For instance, imitation learning requires obtaining correspondence between humans and robots; sim-to-real requires correspondence between physics simulators and the real world; transfer learning requires correspondences between different robotics environments. This paper aims to learn correspondence across domains differing in representation (vision vs. internal state), physics parameters (mass and friction), and morphology (number of limbs). Importantly, correspondences are learned using unpaired and randomly collected data from the two domains. We propose \ extit{dynamics cycles} that align dynamic robot behavior across two domains using a cycle-consistency constraint. Once this correspondence is found, we can directly transfer the policy trained on one domain to the other, without needing any additional fine-tuning on the second domain. We perform experiments across a variety of problem domains, both in simulation and on real robot. Our framework is able to align uncalibrated monocular video of a real robot arm to dynamic state-action trajectories of a simulated arm without paired data. Video demonstrations of our results are available at: https://sjtuzq.github.io/cycle_dynamics.html .

研究の動機と目的

  • 異なるモダリティ(例:視覚対状態)、物理パrameter(質量、摩擦係数)、形状(例:脚の数)を持つドメイン間での対応関係を学習する課題に対処すること。
  • ペア化されたデータやターゲットドメインでの微調整を必要とせずに、ドメイン間でゼロショットポリシー転送を可能にすること。
  • 過去の手法がペア化された軌道や不変性に基づく表現に依存するのを克服し、ドメイン間でダイナミクスの整合性を組み込むこと。
  • 両ドメインからランダムに収集されたペア化されていないデータを用いて、観測と行動の同時対応関係を学習すること。

提案手法

  • 本手法は、実ロボットの画像とシミュレーテッド状態軌道の間で観測と行動を結ぶ4サイクルのダイナミクスチェーンを用いる。
  • 実画像をシミュレーテッド状態にマッピングするドメイントランスレーター $ G: \mathbf{x}_t \mapsto \mathbf{y}_t $ と、シミュレーテッドドメインにおける前向きダイナミクスモデル $ F: \mathbf{y}_t \times \mathbf{u}_t \mapsto \mathbf{y}_{t+1} $ を導入する。
  • コアとなる制約はダイナミクスサイクル整合性である:ドメイン間で一貫した行動が与えられた場合、シミュレーテッドドメインにおける予測された次の状態は、実ロボットの次の観測の画像から状態への変換と一致しなければならない。
  • 本フレームワークは、両ドメインから得られるペア化されていない (観測, 行動, 次の観測) 3タプルを用いて、トランスレーターとダイナミクスモデルを同時に最適化する。
  • 形態が異なるエージェント間でのポリシー転送における訓練安定性を向上させるために、新しい行動繰り返し初期化戦略を採用する。
  • 本手法は実ロボットの内部状態へのアクセスを必要とせず、キャリブレーションされていないRGB動画入力を用いることができる。

実験結果

リサーチクエスチョン

  • RQ1ダイナミクスサイクル整合性は、実ロボットとシミュレーションからのペア化されていない、キャリブレーションされていないデータ間で、正確なクロスドメイン対応関係の学習を可能にするか?
  • RQ2モダリティや物理パラメータが異なる状況下でも、微調整なしにシミュレーションで学習したポリシーを実ロボットに転送できるか、その性能はどの程度か?
  • RQ3対応関係学習にダイナミクスを組み込むことで、Cycle-GANのような純粋な視覚翻訳手法に比べて、複雑な現実世界の制御タスクで優れた性能を発揮するか?
  • RQ4本フレームワークは、脚の数が異なるなど、さまざまな形状に一般化できるか?
  • RQ5実ロボットの内部状態へのアクセスなしに、RAW RGB動画から連携された状態推定を学習できるか?

主な発見

  • 実ロボット実験では、ランダムな動きにおいてエンドエフェクタ位置推定のL1誤差が0.025に達し、滑らかな動きでは0.033にとどまった。これはCycle-GANがそれぞれ0.18と0.21を記録したのに対し、顕著に優れている。
  • 7関節の高次元の関節姿勢観測を用いても、ランダムな動きにおいてL1誤差が0.031にとどまり、複雑性の増加に対しても頑健であることが示された。
  • 本手法は、シミュレーションで学習したポリシーを、微調整なしに実xArmロボットに成功裏に転送した。一方、Cycle-GANや行動繰り返し初期化戦略に依存するベースラインは、完全に失敗した。
  • 可視化結果から、予測されたシミュレーテッド状態が実ロボットの運動とよく一致していることが確認され、学習された対応関係の妥当性が裏付けられた。
  • ダイナミクスサイクル整合性の目的関数は不可欠であった。Cycle-GANのようにダイナミクスを無視した手法は、ペア化されていないデータを用いても、意味のある対応関係を学習できなかった。
  • 本フレームワークは、モダリティの変化(視覚対状態)、物理的差異(摩擦係数、質量)、形状の変化(脚の数)といった多様なドメインに一般化可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。