Skip to main content
QUICK REVIEW

[論文レビュー] Transfer learning from synthetic to real images using variational autoencoders for robotic applications

Tadanobu Inoue, Subhajit Chaudhury|arXiv (Cornell University)|Sep 20, 2017
Generative Adversarial Networks and Image Synthesis参考文献 4被引用数 14
ひとこと要約

本論文では、ロボットビジョンタスクにおける合成シミュレーション画像と現実世界の画像の間のリアリティギャップを埋めるために、2つの変分オートエンコーダー(VAEs)を用いた転移学習手法を提案する。実画像から擬似合成画像を生成し、大規模な合成データを活用することで、物体位置検出を1 cm未塔の誤差で達成し、事前学習されたロボットポリシーを再訓練なしに物理的ロボットに直接転送可能にした。この手法は、実データのみを用いたベースライン手法よりも精度が6〜7倍優れている。

ABSTRACT

Robotic learning in simulation environments provides a faster, more scalable, and safer training methodology than learning directly with physical robots. Also, synthesizing images in a simulation environment for collecting large-scale image data is easy, whereas capturing camera images in the real world is time consuming and expensive. However, learning from only synthetic images may not achieve the desired performance in real environments due to the gap between synthetic and real images. We thus propose a method that transfers learned capability of detecting object position from a simulation environment to the real world. Our method enables us to use only a very limited dataset of real images while leveraging a large dataset of synthetic images using multiple variational autoencoders. It detects object positions 6 to 7 times more precisely than the baseline of directly learning from the dataset of the real images. Object position estimation under varying environmental conditions forms one of the underlying requirement for standard robotic manipulation tasks. We show that the proposed method performs robustly in different lighting conditions or with other distractor objects present for this requirement. Using this detected object position, we transfer pick-and-place or reaching tasks learned in a simulation environment to an actual physical robot without re-training.

研究の動機と目的

  • 合成シミュレーション画像と現実世界の画像の間のリアリティギャップを解消すること。
  • わずかな実画像データのみを用いて、現実環境における高精度なオブジェクト位置検出を実現すること。
  • 再訓練なしに、シミュレーションで学習されたロボットポリシーを物理的ロボットに直接転送できること。
  • 現実世界の展開において、照明の変化や不要な物体(ドリフトオブジェクト)に対して耐性を持つこと。
  • 教師あり学習および強化学習を含む、異なる学習パラダイムへの汎用性を示すこと。

提案手法

  • 本手法は、実画像を共有の潜在空間にエンコードするVAEと、その空間から擬似合成画像をデコードするVAEの2つを用いる。
  • 条件付き分布 $ p(\mathbf{x}_S|\mathbf{x}_R) $ を用いて、予測された位置と真値の間の再構成誤差を最小化し、$ \mathbb{E}_{p(\mathbf{x}_S|\mathbf{x}_R)}[||f(\mathbf{x}_R) - f(\mathbf{x}_S)||^2] $ を最適化する。
  • 「見るための学習」(オブジェクト検出)と「行動するための学習」(ポリシー学習)を分離するマルチステージの学習パイプラインを採用し、両者ともシミュレーションで学習する。
  • VAE-MLPパイプラインは、Kinectセンサーからの生のRGB-D画像を処理し、リアルタイムで3次元オブジェクト位置を推定する。
  • 本手法は、教師あり学習(LSTMを用いたピックアンドプレース)および強化学習(DDPGを用いた到達タスク)の両フレームワークと統合可能である。
  • 本手法は照明の変化や不要な物体に対して不変であり、現実世界の条件でも耐性を持つ。

実験結果

リサーチクエスチョン

  • RQ1大規模な合成データと組み合わせたわずかな実画像データを効果的に活用することで、オブジェクト検出の精度を向上させることができるか?
  • RQ2VAEベースのドメイン適応手法が、シミュレーションと現実世界の画像の間のリアリティギャップをどの程度縮小できるか?
  • RQ3本手法の検出部のみを用いて、微調整なしにシミュレーションで学習されたロボットポリシーを物理的ロボットに成功裏に転送できるか?
  • RQ4本手法は、照明の変化やごみの多いシーンなどの環境変化に対してどの程度耐性を持つのか?
  • RQ5本手法は、教師あり学習および強化学習を含む、異なる学習パラダイムに一般化可能か?

主な発見

  • 提案手法は、現実世界環境においてオブジェクト位置を1 cm未塔の近似誤差で検出できた。
  • オブジェクト検出性能は、実画像データのみでCNNやMLPを直接学習するベースライン手法よりも6〜7倍も高い精度を達成した。
  • ピックアンドプレースタスクでは、シミュレーションで学習したポリシーを物理的ロボットに転送した結果、10回の試行すべてで100%の成功率を達成した。
  • DDPGポリシーを完全にシミュレーションで学習した後、実世界で到達タスクを実行に成功したが、実データでの微調整は一切行わなかった。
  • 本手法は、照明条件の変化や不要な物体の存在下でも、依然として耐性を持つ。
  • 本手法は、教師あり学習および強化学習の両方のポリシーを、微調整なしにシミュレーションから物理的ロボットに直接転送可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。