Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Reinforcement Learning of Transferable Meta-Skills for Embodied Navigation

Juncheng Li, Xin Wang|arXiv (Cornell University)|Nov 18, 2019
Multimodal Machine Learning Applications参考文献 46被引用数 6
ひとこと要約

本論文は、ラベルなしの3次元環境から、障害物を回避する、まっすぐ進むなどの転送可能なメタスキルを、何らの教師信号なしに学習する、新しい非教師強化学習フレームワークULTRAを提案する。タスク生成者とメタラーナーの間でカリキュラムベースの敵対的訓練を実施することで、学習済みのマスターポリシーを用いて新しい視覚ナビゲーションタスクへの迅速な適応が可能となり、ベースライン比でSPLで53.34%の相対的向上を達成した。

ABSTRACT

Visual navigation is a task of training an embodied agent by intelligently navigating to a target object (e.g., television) using only visual observations. A key challenge for current deep reinforcement learning models lies in the requirements for a large amount of training data. It is exceedingly expensive to construct sufficient 3D synthetic environments annotated with the target object information. In this paper, we focus on visual navigation in the low-resource setting, where we have only a few training environments annotated with object information. We propose a novel unsupervised reinforcement learning approach to learn transferable meta-skills (e.g., bypass obstacles, go straight) from unannotated environments without any supervisory signals. The agent can then fast adapt to visual navigation through learning a high-level master policy to combine these meta-skills, when the visual-navigation-specified reward is provided. Evaluation in the AI2-THOR environments shows that our method significantly outperforms the baseline by 53.34% relatively on SPL, and further qualitative analysis demonstrates that our method learns transferable motor primitives for visual navigation.

研究の動機と目的

  • 3次元視覚ナビゲーション環境におけるエンぶレッドエージェントのトレーニングにおけるデータ非効率性と高いラベルコストを解決すること。
  • 再利用可能なメタスキルを学習することで、最小限のラベルデータで新しいナビゲーションタスクへの迅速な適応を可能にすること。
  • メタトレーニング中に手動で設計されたまたはラベル付けされたタスクが不要になるようにすること。
  • スケーラブルな非教師フレームワークを構築し、自動的に難易度が上昇するタスクのカリキュラムを生成すること。
  • 学習済みポリシーの転送性と一般化性能を向上させること。

提案手法

  • タスク生成者がラベルなし環境から段階的に複雑なナビゲーションタスクを自動生成するカリキュラムベースの敵対的訓練プロセスを導入する。
  • メタラーナーは、最適化にReptileを用いて、勾配ベースのメタラーニングにより転送可能な部分ポリシー(メタスキル)を学習する。
  • 階層的ポリシー構造により、マスターポリシー(タスク固有)と共有部分ポリシー(タスクに依存しない)を分離し、メタ過学習を低減する。
  • 部分ポリシーは、監視なしに多様なシーンで特定の行動(例:まっすぐ進む、左/右に曲がる、障害物を回避する)を実行するように訓練される。
  • メタテスト段階では、新しいマスターポリシーのみを訓練し、タスク固有の報酬を用いて事前に学習済みの部分ポリシーを組み合わせる。
  • フレームワークは、非教師的探索と内的好奇心を活用して、タスク生成とポリシー学習をガイドする。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしの3次元環境から、何らの教師信号なしに転送可能なメタスキルを学習できるか?
  • RQ2難易度が段階的に上昇するタスクのカリキュラムを自動的に生成することで、メタラーナーの性能を向上させられるか?
  • RQ3共有部分ポリシーを有する階層的ポリシー構造は、リソースが限られた状況での一般化性能を向上させ、過学習を低減するか?
  • RQ4少サンプル視覚ナビゲーションにおいて、ULTRAの性能は教師ありおよび事前学習ベースラインを上回るか?
  • RQ5学習済みの部分ポリシーは、異なる環境間で行動的に一貫性があり、解釈可能か?

主な発見

  • ULTRAは、最も強力なベースライン比でSPLで53.34%の相対的向上を達成し、リソースが限られた視覚ナビゲーションにおいて顕著な性能向上を示した。
  • アブレーションスタディの結果、階層的ポリシー構造を削除するとSPLが0.93ポイント低下し、成功率が3.47ポイント低下した。これは、一般化に向けたその重要性を確認するものである。
  • 部分ポリシーの数をアブレーションした結果、7つの部分ポリシーで性能がピークに達し、それ以上になると混乱により性能が低下した。
  • 定性的な分析により、各部分ポリシーが多様なシーンで一貫性があり、解釈可能な行動を示していることが確認された(例:部分ポリシー1は常に障害物を回避し、部分ポリシー2は常に右に曲がる)。
  • カリキュラムベースの敵対的訓練は、ランダムなタスクサンプリングを上回り、構造的なタスク進行の有効性を裏付けた。
  • 画像駆動ナビゲーションで微調整する事前学習ベースラインを上回ったことから、このような事前学習は意味的視覚ナビゲーションにはうまく転送されないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。