Skip to main content
QUICK REVIEW

[論文レビュー] How to Close Sim-Real Gap? Transfer with Segmentation!

Mengyuan Yan, Qingyun Sun|arXiv (Cornell University)|May 14, 2020
Robot Manipulation and Learning参考文献 22被引用数 6
ひとこと要約

本論文は、Povrayレンダリングと実際の背景合成を用いて現実的で多様なトレーニング画像を生成し、DAGGERを用いて障害回復を改善することで、ロボット操作におけるシミュレーションから現実への一般化ギャップを埋めるモジュラーでセグメンテーション監視付きのアプローチを提案する。この手法は、88%の成功率を達成し、合成アノテーションを活用する明示的なセグメンテーション監視のおかげで、より効果的なポリシー学習が可能になるため、非監視バージョンを上回る性能を発揮する。

ABSTRACT

One fundamental difficulty in robotic learning is the sim-real gap problem. In this work, we propose to use segmentation as the interface between perception and control, as a domain-invariant state representation. We identify two sources of sim-real gap, one is dynamics sim-real gap, the other is visual sim-real gap. To close dynamics sim-real gap, we propose to use closed-loop control. For complex task with segmentation mask input, we further propose to learn a closed-loop model-free control policy with deep neural network using imitation learning. To close visual sim-real gap, we propose to learn a perception model in real environment using simulated target plus real background image, without using any real world supervision. We demonstrate this methodology in eye-in-hand grasping task. We train a closed-loop control policy model that taking the segmentation as input using simulation. We show that this control policy is able to transfer from simulation to real environment. The closed-loop control policy is not only robust with respect to discrepancies between the dynamic model of the simulated and real robot, but also is able to generalize to unseen scenarios where the target is moving and even learns to recover from failures. We train the perception segmentation model using training data generated by composing real background images with simulated images of the target. Combining the control policy learned from simulation with the perception model, we achieve an impressive $\bf{88\%}$ success rate in grasping a tiny sphere with a real robot.

研究の動機と目的

  • シミュレーションにおける視覚的リアリズムとアノテーションの正確性を向上させることで、ロボットの模倣学習におけるシミュレーションから現実へのドメインギャップを解消すること。
  • DAGGERを用いた反復的エキスパートフィードバックにより、エージェントが障害回復を学習できるようにすることで、ポリシーのロバスト性を向上させること。
  • 明示的なセグメンテーション監視をモジュラーなネットワークアーキテクチャに組み込むことで、非監視特徴学習と比較して現実世界環境への一般化が向上することを示すこと。
  • 現実的で合成された画像の組み合わせと適応的トレーニングスケジューリングを統合することで、効率的なエンドツーエンドトレーニングを可能にすること。

提案手法

  • 正確な照明と影のモデリングを伴うPovrayでのシーンレンダリングにより、現実的でリアルなトレーニング画像を生成し、グリッパーのプレート近似を用いて現実的な球の影を再現する。
  • アルファブレンドを用いてPovrayでレンダリングした画像と実際のロボット作業領域の背景画像を合成することで、視覚的多様性とリアリズムを向上させる。
  • トレーニング中にHSB空間でのランダム化を実施し、現実世界の照明や色の変動を反映させる。
  • GazeboとPovrayからの合成マスクを用いて、ピxls単位のセグメンテーション監視により、物体の正確な局所化を可能にするビジョンモジュールをトレーニングする。
  • ビジョンモジュール(セグメンテーション)とコントローラーモジュール(アクション予測)の2モジュール構成を採用し、DAGGERを用いて共同でトレーニングすることで、障害回復の改善を図る。
  • レンダリング中に物理シミュレーションを一時停止し、DAGGERイテレーションごとにトレーニングエポック数を調整し、総トレーニング時間を134日から7日へ短縮することで、エンドツーエンドトレーニングを最適化する。

実験結果

リサーチクエスチョン

  • RQ1現実的でリアルな画像合成に加え、セグメンテーション監視を組み合わせることで、ロボットの grasping におけるシミュレーションから現実への転移性が向上するか?
  • RQ2ビジョンモジュールにおいて、非監視特徴学習と比較して、明示的なセグメンテーション監視が一般化性能を向上させるか?
  • RQ3DAGGERベースの微調整により、エキスパートのデモンストレーションにない障害の回復をポリシーが効果的に学習できるか?
  • RQ4エンドツーエンドトレーニングで合成されたリアルな画像を使用する場合と、モジュールを別々にトレーニングする場合とを比較した場合、現実世界でのパフォーマンスにどのような差が生じるか?
  • RQ5アーキテクチャの選択(例えば、特徴マップのサイズや監視タイプ)が、現実世界での grasping の成功率に与える影響は何か?

主な発見

  • 提示された手法は、ごみが存在しない状況で現実世界の grasping タスクにおいて88%の成功率を達成し、非監視バージョンを顕著に上回った。
  • ごみが存在する状況では、エンドツーエンドトレーニングされたネットワークが5回中4回の試行で球を正常に grasping した。これは、現実世界の干渉要因に対しても耐性があることを示している。
  • セグメンテーション監視を施したネットワークは、両方の非監視バージョンよりも顕著に低いトレーニング損失を達成しており、最適化と収束性の向上を示している。
  • 非監視特徴マップバージョンは、球に非常に近づいたにもかかわらず grasping を失敗しており、構造的な監視の重要性を強調している。
  • 適応的スケジューリングとレンダリング最適化により、1台のTitan X GPUでエンドツーエンドトレーニング時間を134日から7日へ短縮した。
  • ピxls単位の監視のおかげでビジョンモジュールはたった9時間でトレーニングが完了し、1枚の画像が10,000個の相関サンプルとして効果的に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。