Skip to main content
QUICK REVIEW

[論文レビュー] VR-Goggles for Robots: Real-to-sim Domain Adaptation for Visual Control

Jingwei Zhang, Lei Tai|arXiv (Cornell University)|Feb 1, 2018
Advanced Vision and Imaging参考文献 32被引用数 16
ひとこと要約

本稿では、実世界のカメラ映像をデプロイ時に合成シミュレーション風のスタイルに変換する、VR-Gogglesというリアルからシミュレーションへのドメイン適応手法を提案する。この手法により、再訓練を必要とせず、事前に訓練済みの深層強化学習(DRL)ポリシーを現実環境に一般化可能となる。時間的整合性を保つために、変換された画像系列に適合するシフト損失を導入することで、屋内ナビゲーションおよび屋外自動走行タスクの両方で高い成功確率を達成し、ベースラインのシミュレーションからリアルへのアプローチを上回る性能を示した。

ABSTRACT

In this paper, we deal with the reality gap from a novel perspective, targeting transferring Deep Reinforcement Learning (DRL) policies learned in simulated environments to the real-world domain for visual control tasks. Instead of adopting the common solutions to the problem by increasing the visual fidelity of synthetic images output from simulators during the training phase, we seek to tackle the problem by translating the real-world image streams back to the synthetic domain during the deployment phase, to make the robot feel at home. We propose this as a lightweight, flexible, and efficient solution for visual control, as 1) no extra transfer steps are required during the expensive training of DRL agents in simulation; 2) the trained DRL agents will not be constrained to being deployable in only one specific real-world environment; 3) the policy training and the transfer operations are decoupled, and can be conducted in parallel. Besides this, we propose a simple yet effective shift loss that is agnostic to the downstream task, to constrain the consistency between subsequent frames which is important for consistent policy outputs. We validate the shift loss for artistic style transfer for videos and domain adaptation, and validate our visual control approach in indoor and outdoor robotics experiments.

研究の動機と目的

  • 訓練段階ではなくデプロイ段階で、実世界のセンサ入力を合成ドメインに変換することで、視覚的制御におけるリアリティギャップを解消すること。
  • ポリシーの訓練とドメイン適応を分離することで、多様な現実世界環境において並列的かつ効率的なデプロイを可能にすること。
  • 下流タスクに依存しない新しいシフト損失を導入し、制御タスク向けに変換された画像系列の整合性を向上させること。
  • 屋内および屋外のロボティクスシナリオにおいて本手法を検証し、ポリシーの再訓練なしに頑健な一般化性能を示すこと。
  • DRLポリシーをシミュレーションから現実世界にデプロイするための軽量で柔軟かつ効率的なソリューションを提供すること。

提案手法

  • 本手法は、実世界のRGB画像をDRLポリシー訓練時に使用された合成ドメインにマッピングするリアルからシミュレーションへの画像変換ネットワークを採用する。
  • 連続する変換フレーム間の整合性を強制するため、新しいシフト損失を導入し、オプティカルフローまたは逐次的監督を必要とせずに時間的整合性を向上させる。
  • シフト損失はエンドツーエンドで学習され、下流の制御タスクに依存しないため、異なる環境に広く適用可能である。
  • ドメイン適応は推論時でのみ実行され、シミュレーション内での高コストなDRL訓練プロセスとは分離されている。
  • サイクル一致性に加え、シフト損失を用いたCycleGANスタイルのアーキテクチャを採用し、各環境で2000枚の実画像を用いて学習することで、新しい現実世界のシーンに適応可能である。
  • 本手法は、オフィス内のタートルボット3を用いた屋内ナビゲーションおよび、ナイトタイムの街中を走行するブルドッグを用いた屋外自動走行の両方で適用され、シミュレーションにはCarla、現実世界のテストには実データセットが使用された。

実験結果

リサーチクエスチョン

  • RQ1デプロイ時にリアルからシミュレーションへの画像変換を実施することで、シミュレーションで訓練されたDRLポリシーが現実世界の視覚的制御タスクに効果的に一般化可能になるか?
  • RQ2提案されたシフト損失は、標準的なサイクル一貫性GANと比較して、変換された画像系列の整合性をどのように向上させるか?
  • RQ3制御ポリシーの再訓練やファインチューニングなしに、視覚的に異なる多数の現実世界環境に本手法をデプロイ可能か?
  • RQ4ポリシーの訓練とドメイン適応を分離することで、現実世界のデプロイにおいて顕著な効率性の向上が達成されるか?
  • RQ5困難な視覚ドメインにおいて、既存のシミュレーションからリアルへのアプローチと比較して、本手法の成功率と頑健性はどのように優れているか?

主な発見

  • 屋内オフィス内ナビゲーションでは、VR-Gogglesは100%の成功率を達成し、CycleGAN(60%)およびNo-Goggles(0%)を大きく上回り、優れたドメイン適応品質を示した。
  • 制御ポリシーはNVIDIA TX2上で13 Hzでリアルタイムで実行可能であり、本手法の低計算コストであることを確認した。
  • 屋外自動走行では、VR-Gogglesはナイトタイムの道路を安全に走行可能であったが、No-Gogglesは昼間のシミュレーションと夜間の現実世界との大きなドメインシフトのため、完全に失敗した。
  • シフト損失は、オプティカルフローも逐次データも不要なまま、変換画像系列の時間的整合性を効果的に向上させ、フレイクターやポリシーの不安定性を低減した。
  • 2000枚の実画像(各ドメインあたり)のみで、ポリシーの再訓練なしに新しい環境にデプロイ可能であり、本手法の柔軟性とスケーラビリティを実証した。
  • 動画デモにより、VR-Gogglesが新しい環境(例:新しい家具の種類)に、事前訓練済みポリシーを変更せずに迅速に適応可能であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。