Skip to main content
QUICK REVIEW

[論文レビュー] Virtual-to-Real: Learning to Control in Visual Semantic Segmentation

Zhang-Wei Hong, Yumin Chen|arXiv (Cornell University)|Feb 1, 2018
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本論文は、視覚的認識と制御方策の学習を分離するモジュラーなアーキテクチャを提案し、現実世界とのギャップを埋めるために意味的画像セグメンテーションをメタ表現として用いる。認識と強化学習方策を別々に学習し、セグメンテーション表現を実世界のロボットタスクに転送することで、ドメインランダマイゼーションやファインチューニングを必要とせず、ゼロショット転送性に優れ、障害物回避とターゲット追従の両面で高速な学習と優れた性能を達成する。

ABSTRACT

Collecting training data from the physical world is usually time-consuming and even dangerous for fragile robots, and thus, recent advances in robot learning advocate the use of simulators as the training platform. Unfortunately, the reality gap between synthetic and real visual data prohibits direct migration of the models trained in virtual worlds to the real world. This paper proposes a modular architecture for tackling the virtual-to-real problem. The proposed architecture separates the learning model into a perception module and a control policy module, and uses semantic image segmentation as the meta representation for relating these two modules. The perception module translates the perceived RGB image to semantic image segmentation. The control policy module is implemented as a deep reinforcement learning agent, which performs actions based on the translated image segmentation. Our architecture is evaluated in an obstacle avoidance task and a target following task. Experimental results show that our architecture significantly outperforms all of the baseline methods in both virtual and real environments, and demonstrates a faster learning curve than them. We also present a detailed analysis for a variety of variant configurations, and validate the transferability of our modular architecture.

研究の動機と目的

  • 視覚ベースのロボット制御における現実世界とのギャップを解消すること。シミュレータで学習した方策が現実世界の環境に一般化できない問題に取り組む。
  • 高価な現実世界データ収集や物理的ロボットにおける危険な試行錯誤学習への依存を低減すること。
  • ドメインランダマイゼーションやファインチューニングを必要とせず、仮想環境から現実環境への効率的かつゼロショットでの方策転送を可能にすること。
  • 多様で未知の環境や動的ターゲット切り替えに対しても、頑健で柔軟な性能を示すこと。

提案手法

  • アーキテクチャは、RGB画像を意味的セグメンテーションマップに変換する認識モジュールと、これらのセグメンテーションを入力として用いる深層強化学習による制御方策モジュールに分離される。
  • 認識モジュールは、公開データセット(例:ADE20K)や合成データ上で事前学習され、方策モジュールとは独立して動作する。
  • 制御方策モジュールは、原始ピクセルではなく、意味的セグメンテーション入力を用いるA3Cベースの深層強化学習エージェントを採用する。
  • ドメインランダマイゼーションを回避し、実世界データを学習に使用しない。代わりに、意味的メタ表現を介してドメイン間で一般化を実現する。
  • フレームスタッキングを用いて時間的相関を保持し、ナビゲーション中のポリシーの安定性とターゲット追従性能を向上させる。
  • 本手法は2つのタスクで評価される:混雑した廊下での障害物回避、および動的ターゲット切り替えを伴うターゲット追従。

実験結果

リサーチクエスチョン

  • RQ1意味的セグメンテーションをメタ表現として用いるモジュラーなアーキテクチャが、シミュレーションから現実世界への視覚ベースの制御方策の有効なゼロショット転送を可能にするか。
  • RQ2ドメインランダマイゼーションやエンドツーエンド学習のベースラインと比較して、本手法は学習速度および現実世界での性能においてどのように優れているか。
  • RQ3本手法は、未観測の環境や物体形状、動的ターゲット切り替えに対し、どの程度一般化できるか。
  • RQ4セグメンテーション品質の変動やラベルの複雑さ(例:非削減クラスラベル)に対して、本手法はどの程度頑健か。

主な発見

  • 本手法は、実世界のターゲット追従タスクで90%の成功率を達成し、シミュレーションでの平均報酬が0.925に達し、ベースライン手法を顕著に上回った。
  • 障害物回避タスクでは、ラベルを削減した状況で実世界での衝突率を0.7にまで低下させたが、ベースラインモデルはより高い衝突率を示した。
  • 非削減クラスラベル(27クラス)を用いても、本モデルはラベルを削減したモデル(衝突率0.9)よりも低い衝突率(0.7)を達成し、文脈理解の向上を示した。
  • 本手法は、微調整なしに未観測の屋内・屋外環境に対しても一般化を示し、実世界への展開に適した性能を発揮した。
  • フレームスタッキングにより時間的相関を保持したため、鋭いカーブでもターゲットを追跡し続けた。一方、ベースラインエージェントはターゲットを追失い、回避行動を示した。
  • 本アーキテクチャは、動的ターゲット切り替え(例:人から椅子に切り替え)を可能にし、実世界評価で80%の成功率、シミュレーションで90%の成功率を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。