Skip to main content
QUICK REVIEW

[論文レビュー] An A* Curriculum Approach to Reinforcement Learning for RGBD Indoor Robot Navigation

Kaushik Balakrishnan, Punarjay Chakravarty|arXiv (Cornell University)|Jan 5, 2021
Reinforcement Learning in Robotics参考文献 23被引用数 6
ひとこと要約

本論文では、RGBDベースの屋内ロボットナビゲーションのためのカリキュラムベースの強化学習手法を提案する。視認と制御を分離することで、事前学習されたツインVAEがRGBおよび深度入力を潜在埋め込みに圧縮する。一方、A*パスプランニングにより、中間のウェイポイントを生成するか、ゴールを徐々に遠くに移動させることで、ナビゲーションの難易度を段階的に向上させる。この手法により、学習が加速され、最終的な性能が向上し、エンドツーエンドDRLベースラインと比較して高い成功確率とSPLスコアを達成する。

ABSTRACT

Training robots to navigate diverse environments is a challenging problem as it involves the confluence of several different perception tasks such as mapping and localization, followed by optimal path-planning and control. Recently released photo-realistic simulators such as Habitat allow for the training of networks that output control actions directly from perception: agents use Deep Reinforcement Learning (DRL) to regress directly from the camera image to a control output in an end-to-end fashion. This is data-inefficient and can take several days to train on a GPU. Our paper tries to overcome this problem by separating the training of the perception and control neural nets and increasing the path complexity gradually using a curriculum approach. Specifically, a pre-trained twin Variational AutoEncoder (VAE) is used to compress RGBD (RGB & depth) sensing from an environment into a latent embedding, which is then used to train a DRL-based control policy. A*, a traditional path-planner is used as a guide for the policy and the distance between start and target locations is incrementally increased along the A* route, as training progresses. We demonstrate the efficacy of the proposed approach, both in terms of increased performance and decreased training times for the PointNav task in the Habitat simulation environment. This strategy of improving the training of direct-perception based DRL navigation policies is expected to hasten the deployment of robots of particular interest to industry such as co-bots on the factory floor and last-mile delivery robots.

研究の動機と目的

  • エンドツーエンドの深層強化学習(DRL)によるRGBDベースのロボットナビゲーションにおけるデータ非効率性と長時間の学習を解消すること。
  • 視認(表現学習)と制御(ナビゲーションポリシー)を分離することで、学習効率と最終的なポリシー性能を向上させること。
  • A*を用いてウェイポイントや遠くのゴールを生成することで、段階的に複雑さが増すカリキュラムを構築し、DRL学習を加速すること。
  • Gibsonデータセットのような新しい環境へ、視認およびポリシー表現の転移学習を可能にすること。
  • 1つの事前学習済みVAE埋め込みが複数のナビゲーションポリシーをサポートできるスケーラブルなフレームワークを提供すること。

提案手法

  • RGBおよび深度画像上で事前学習されたツイン変分オートエンコーダ(VAE)を用いて、環境のコン pact な潜在表現を学習する。
  • 学習されたVAE埋め込みをDRLポリシー・ネットワークの入力として使用し、埋め込み状態とターゲット方向/ヘディングに基づいて制御アクションを回帰する。
  • A*パスプランニングを用いて、中間のウェイポイントを生成するか、スタート地点から徐々に遠くに移動するゴールを生成することで、段階的に難易度が上昇するカリキュラムを構築する。
  • 2つのカリキュラム戦略を評価する:SWP-N(減少するNの離散的ウェイポイント)とFWP(継続的に移動するゴール)。
  • DRLポリシーは、Habitat環境を用いたシミュレーションで学習され、パス長の増加に基づいてカリキュラムの進行が行われる。
  • 転移学習は、新しいシーン(例:GibsonのPleasant)に対して、同じ埋め込みとポリシー重みを初期値として使用して、事前学習済みVAEおよびポリシーのファインチューニングにより実施される。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みVAEベースの視認埋め込みは、DRLベースのナビゲーションポリシーのサンプル効率および最終的性能を向上させるか?
  • RQ2A*を用いて段階的に複雑さが増すパスのカリキュラムを生成することで、DRL学習の加速とポリシーの一般化性能の向上が達成されるか?
  • RQ3離散的ウェイポイント(SWP-N)と継続的に移動するゴール(FWP)の異なるカリキュラム戦略は、最終的なポリシー性能およびパスの滑らかさにどのように影響するか?
  • RQ4事前学習済みの視認およびポリシー表現が、新しい未確認の環境へどの程度転移可能か?
  • RQ5カリキュラム学習は、実世界のデプロイメント環境においてよりロバストで滑らかなナビゲーション行動をもたらすか?

主な発見

  • 提案されたカリキュラム手法は、エンドツーエンドDRLベースラインと比較して、学習時間を顕著に短縮し、最終的な性能を向上させる。
  • SWP-10エージェントは、Pleasantシーンでの転移学習後、平均成功確率0.95および平均SPL0.87を達成し、優れた一般化性能を示した。
  • FWPエージェントは壁の近くでコasting行動を示し、より鋭いターンを示したが、SWPエージェントは多くのテストエピソードで滑らかで望ましいパスを生成した。
  • 開始位置およびターゲット位置の違いに応じて性能にばらつきが見られたことから、カリキュラム設計が最終的なポリシー行動に強く影響することが示された。
  • まれに、例としてエピソード-hでは、類似した設定でもFWPエージェントがターゲットに到達できなかったが、これは環境レイアウトへの感受性を示唆している。
  • 本手法により、効率的な転移学習が可能である:1つの事前学習済みVAE埋め込みを複数のタスクや環境で再利用でき、再学習の必要性が削減される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。