Skip to main content
QUICK REVIEW

[論文レビュー] RetinaGAN: An Object-aware Approach to Sim-to-Real Transfer

Daniel E. Ho, Kanishka Rao|arXiv (Cornell University)|Nov 6, 2020
Robot Manipulation and Learning参考文献 35被引用数 7
ひとこと要約

RetinaGAN は、物体検出の整合性を保ちながら、シミュレートされた画像を現実世界の視覚に適応させる GAN ベースのシミュレーションから現実への転送手法であり、ロボティクスにおける効果的なポリシー転送を可能にする。先行手法に比べて grasping 成功率が 12% 高く、わずか 5–10% の実データでも高い性能を維持し、ピッシュやドア開閉といった多様なタスクにおいて強力な一般化性能を示す。

ABSTRACT

The success of deep reinforcement learning (RL) and imitation learning (IL) in vision-based robotic manipulation typically hinges on the expense of large scale data collection. With simulation, data to train a policy can be collected efficiently at scale, but the visual gap between sim and real makes deployment in the real world difficult. We introduce RetinaGAN, a generative adversarial network (GAN) approach to adapt simulated images to realistic ones with object-detection consistency. RetinaGAN is trained in an unsupervised manner without task loss dependencies, and preserves general object structure and texture in adapted images. We evaluate our method on three real world tasks: grasping, pushing, and door opening. RetinaGAN improves upon the performance of prior sim-to-real methods for RL-based object instance grasping and continues to be effective even in the limited data regime. When applied to a pushing task in a similar visual domain, RetinaGAN demonstrates transfer with no additional real data requirements. We also show our method bridges the visual gap for a novel door opening task using imitation learning in a new visual domain. Visit the project website at https://retinagan.github.io/

研究の動機と目的

  • 画像ドメイン適応中にタスクに不可欠な物体の意味を保持することで、シミュレーションから現実への強化学習および模倣学習における視覚的現実ギャップを解消すること。
  • ロボット操作に必要な視覚的特徴を歪めたり削除したりする可能性がある標準 GAN の限界を克服すること。
  • 広範な現実世界データ収集を必要とせずに、シミュレーションから現実世界の環境への効果的なポリシー転送を可能にすること。
  • 検出器の一貫性損失を通じて、物体レベルの構造とテクスチャが保持されるように適応を実現し、多様な視覚ドメインにわたって頑健であることを保証すること。
  • 最小限の微調整や実データを用いて、1 つの RetinaGAN モデルを複数のタスクや視覚ドメインにわたって再利用可能にする能力を実証すること。

提案手法

  • 物体検出の一貫性を維持しながら、シミュレート画像を現実的画像に変換するための CycleGAN を訓練する。
  • 元のシミュレート画像と GAN によって変換された画像の間で、物体検出予測が不変であることを強制する認識一貫性損失 ($\mathcal{L}_{\text{prcp}}$) を導入する。
  • 実データおよびシミュレートデータの両方に対して事前学習済みの物体検出器 (EfficientDet) を用い、監視のための検出出力を生成する。
  • タスク固有の損失に依存せずに、ペaired でない実画像とシミュレート画像のペアのみを用いて、GAN を教師なしで訓練する。
  • GAN 訓練の安定化のため、スペクトル正規化と Adam 最適化を適用し、ハイパーパrameter は狭い範囲でのみ調整する。
  • すべてのタスクやドメインで同じ事前学習済み検出器を再利用し、再訓練なしに一貫した意味的監視を保証する。

実験結果

リサーチクエスチョン

  • RQ1物体に注意を向けたドメイン適応は、視覚ベースのロボット操作タスクにおけるシミュレーションから現実への転送性能を向上させ得るか?
  • RQ2標準 GAN と比較して、RetinaGAN は画像変換中に物体レベルの構造とテクスチャをどの程度保持しているか?
  • RQ3わずか 5–10% の実データしか利用できない低データ環境下で、RetinaGAN はどの程度効果的か?
  • RQ4grasping タスクで学習した RetinaGAN モデルを、追加の実データなしに別のタスク(例:ピッシュ)に再利用できるか?
  • RQ5RetinaGAN は、会議室のような新しい視覚ドメイン(例:ドア開閉)に、最小限のデータで一般化可能か?

主な発見

  • 完全な実データを用いた場合、RetinaGAN は先行するシミュレーションから現実への手法に比べ、現実世界の grasping 成功率を 12% 向上させた。
  • わずか 5–10% の実データしか利用しない低データ環境下でも、RetinaGAN は性能低下がたった 14% に抑えられ、強力な一般化性能を示した。
  • grasping データで学習した RetinaGAN モデルは、追加の実データやファインチューニングなしに、3D 物体ピッシュタスクで 90% の成功率を達成した。
  • 異なる視覚ドメインにおける新しいドア開閉タスクでは、Ensemble-RetinaGAN の変種を用いて模倣学習を実行した結果、97% の成功率を達成した。
  • 変換の前後で一貫した物体検出予測が維持されており、意味的構造とテクスチャが適切に保持されていることが確認された。
  • 同じ事前学習済み物体検出器がすべてのタスクやドメインで有効に機能したため、本手法の一般化能力と転送可能性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。