Skip to main content
QUICK REVIEW

[論文レビュー] Generalization through Simulation: Integrating Simulated and Real Data into Deep Reinforcement Learning for Vision-Based Autonomous Flight

Katie Kang, Suneel Belkhale|arXiv (Cornell University)|Feb 11, 2019
Reinforcement Learning in Robotics参考文献 37被引用数 11
ひとこと要約

本論文は、視覚的認識にシミュレーションデータを、動的制御に現実世界データを組み合わせるハイブリッドな深層強化学習手法を提案する。シミュレーションでタスク固有の視覚的ポリシーを事前学習し、現実世界データをわずか1時間でアクションに依存する報酬予測器をファインチューニングすることで、複雑な照明条件や幾何構造を有する新しい環境に対しても強力な一般化を実現し、飛行距離が従来手法の4倍にのぼり、困難な通路でも一貫した成功を達成した。

ABSTRACT

Deep reinforcement learning provides a promising approach for vision-based control of real-world robots. However, the generalization of such models depends critically on the quantity and variety of data available for training. This data can be difficult to obtain for some types of robotic systems, such as fragile, small-scale quadrotors. Simulated rendering and physics can provide for much larger datasets, but such data is inherently of lower quality: many of the phenomena that make the real-world autonomous flight problem challenging, such as complex physics and air currents, are modeled poorly or not at all, and the systematic differences between simulation and the real world are typically impossible to eliminate. In this work, we investigate how data from both simulation and the real world can be combined in a hybrid deep reinforcement learning algorithm. Our method uses real-world data to learn about the dynamics of the system, and simulated data to learn a generalizable perception system that can enable the robot to avoid collisions using only a monocular camera. We demonstrate our approach on a real-world nano aerial vehicle collision avoidance task, showing that with only an hour of real-world data, the quadrotor can avoid collisions in new environments with various lighting conditions and geometry. Code, instructions for building the aerial vehicles, and videos of the experiments can be found at github.com/gkahn13/GtS

研究の動機と目的

  • 限られた現実世界データにおけるナノエアリアルビークルの視覚ベース制御ポリシーの一般化を課題とする。
  • 特に動的特性と視覚的リアリズムの面で、シミュレーションと現実のドメインギャップを克服する。
  • 視覚的認識学習(シミュレーションで)と制御ポリシー学習(現実で)を分離することで、現実世界への展開におけるサンプル効率とロバスト性を向上させる。
  • 強化学習によるタスク固有の視覚表現が、自己教師ありまたは教師ありの事前学習よりも、より良い転移性能を示すかどうかを調査する。

提案手法

  • 本手法は認識と制御を分離する:視覚的特徴はナビゲーションと衝突回避のための強化学習を用いてシミュレーションで事前学習される。
  • 認識ネットワークは、シミュレーションで学習されたポリシーからの特徴で初期化され、新しい環境への一般化を可能にする。
  • 制御ポリシーは、わずか1時間の飛行データからなる現実世界データセットを用いて学習され、サンプル効率を向上させるためにアクションに依存する報酬予測器が使用される。
  • 報酬予測器は現実世界の経験に基づいて学習され、シミュレーションで得たポリシーを現実の動的特性に適応させ、深刻な過適合を回避する。
  • モノクローラルカメラを用いてエンドツーエンドの視覚ベース制御を実現し、明示的な状態推定は行わない。
  • 転移学習ループに現実世界とシミュレーションの経験を統合することで、能動的データ収集を可能にする。

実験結果

リサーチクエスチョン

  • RQ1主にシミュレーションデータで学習された視覚ベース制御ポリシーは、多様な照明条件や幾何構造を持つ現実世界環境に効果的に一般化できるか?
  • RQ2視覚的特徴学習法の選択(例:強化学習対自己教師あり対教師あり事前学習)が、現実世界飛行への転移性能に与える影響は何か?
  • RQ3わずか1時間程度の現実世界データ(例:1時間)を用いて、シミュレーションで事前学習されたポリシーをファインチューニングすることで、効果的に性能を向上させられ、深刻な過適合を回避できるか?
  • RQ4認識(シミュレーション)と制御(現実)を分離することで、ポリシー全体を同時にファインチューニングする手法よりも、より優れた一般化性能が得られるか?
  • RQ5アクションに依存する報酬予測器の使用は、現実世界でのファインチューニングにおけるサンプル効率と安定性をどのように向上させるか?

主な発見

  • 提案手法は、直線通路では80%の成功率、傾きのあるカメラ条件では60%、ジグザグ通路では80%の成功率を達成した。これは、これらのタスクで完全に失敗する従来手法と比べて顕著に優れていた。
  • わずか1時間の現実世界データを用いても、ベースライン手法よりも飛行距離が4倍にのぼり、優れたサンプル効率を示した。
  • 『シミュレーションのみ』および『シミュレーションでファインチューニング』されたベースライン手法は、一般化性能が低く、一貫性のない性能を示したが、本手法はそれらを上回った。
  • シミュレーションで強化学習により学習されたタスク固有の視覚的表現は、自己教師あり(VAE)や教師あり(ImageNet事前学習)の代替手法よりも著しく優れた転移性能を示した。
  • 失敗事例は多くの場合妥当なものであった(例:ガラスドアに衝突)。これは、モデルが意味のある不変性を学習しており、追加の現実世界データでさらに改善可能であることを示唆している。
  • アクションに依存する報酬予測器は、安定的かつ効率的な現実世界でのファインチューニングに不可欠であり、シミュレーションから現実への知識転送を効果的に可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。