Skip to main content
QUICK REVIEW

[論文レビュー] Zero-shot Imitation Learning from Demonstrations for Legged Robot Visual Navigation

Xinlei Pan, Tingnan Zhang|arXiv (Cornell University)|Sep 27, 2019
Human Pose and Action Recognition参考文献 42被引用数 5
ひとこと要約

本論文は、第三人称視点のヒューマンデモを用いて脚付きロボットのビジョナリュエーションポリシーを訓練するゼロショット模倣学習フレームワークを提案する。視点のズレを解消するために特徴の分離ネットワーク(FDN)を用い、GUI や逆運動学モデルによるアクションラベリングを可能にした。視点の違いがある中でも、ナビゲーション成功確率がオラクルに近い性能を達成しており、シミュレーションおよび実世界環境において優れた一般化性能を示した。

ABSTRACT

Imitation learning is a popular approach for training visual navigation policies. However, collecting expert demonstrations for legged robots is challenging as these robots can be hard to control, move slowly, and cannot operate continuously for a long time. Here, we propose a zero-shot imitation learning approach for training a visual navigation policy on legged robots from human (third-person perspective) demonstrations, enabling high-quality navigation and cost-effective data collection. However, imitation learning from third-person demonstrations raises unique challenges. First, these demonstrations are captured from different camera perspectives, which we address via a feature disentanglement network (FDN) that extracts perspective-invariant state features. Second, as transition dynamics vary across systems, we label missing actions by either building an inverse model of the robot's dynamics in the feature space and applying it to the human demonstrations or developing a Graphic User Interface(GUI) to label human demonstrations. To train a navigation policy we use a model-based imitation learning approach with FDN and labeled human demonstrations. We show that our framework can learn an effective policy for a legged robot, Laikago, from human demonstrations in both simulated and real-world environments. Our approach is zero-shot as the robot never navigates the same paths during training as those at testing time. We justify our framework by performing a comparative study.

研究の動機と目的

  • ハードウェア制限や連続作業の難しさにより、脚付きロボットのための大規模ナビゲーションデータ収集の課題に対処する。
  • ヒューマンデモレータと脚付きロボットの間の視点差によるドメインシフトを、ビジョナリュエーションタスクで克服する。
  • テストトラジェクトリをトレーニング時に含めないことで、ヒューマンデモに基づいてナビゲーションポリシーを学習し、ゼロショット一般化を実現する。
  • GUI や学習済みの逆運動学モデルを用いて、ヒューマンデモをロボット互換アクションにスケーラブルにラベリングする手法を開発する。
  • シミュレーションおよび実世界環境において、ゴール駆動型ビジョナリュエーションの有効性を実証する。

提案手法

  • サイクル整合性損失を用いて、視点不変状態特徴と視点依存特徴を分離する特徴分離ネットワーク(FDN)を採用する。
  • FDNが入力画像を分離特徴から再構成できるように学習させ、抽出された特徴が視点変化に対してロバストであることを保証する。
  • カスタムGUIまたはラベル付き画像ペアをロボットアクションにマップする学習済み逆運動学モデルを用いて、ヒューマンデモのアクションをラベリングする。
  • モデルベースの模倣学習アプローチを用い、分離された潜在特徴空間でナビゲーションポリシーを学習させ、未観測のゴールに対してもゼロショット一般化を実現する。
  • Laikago脚付きロボットを用い、シミュレーション(NavWorld、OfficeWorld)および実世界環境に本フレームワークを適用し、ゴール画像を入力として使用する。
  • 視点変化に伴う画像再構成品質を、生成画像と真値を比較することでFDNの性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1第三人称視点のヒューマンデモから、脚付きロボットナビゲーションに適した視点不変特徴を効果的に抽出できるか?
  • RQ2ロボットがトレーニング時に同じ経路を走破していない状況下で、本フレームワークが未観測のテストタスクにどの程度一般化できるか?
  • RQ3ヒューマンデモレータとロボットの間の視点差がナビゲーション性能に与える影響は何か?また、その影響は効果的に軽減可能か?
  • RQ4GUIベースのラベリングと学習済み逆運動学モデルの2つのアクションラベリング戦略は、スケーラビリティと正確性の観点でどのように比較できるか?
  • RQ5ドメインシフトや限られたデータがある中でも、本フレームワークがどの程度オラクルに近いナビゲーション成功確率を達成できるか?

主な発見

  • 提案フレームワークは、視点差が著しい状況下でも、NavWorldおよびOfficeWorldの両環境でオラクル模倣学習(UPN)に近いナビゲーション成功確率を達成した。
  • 視点差が存在する状況では、ベースラインのUPN-PerspChange手法は一般化に失敗するが、本手法は高い性能を維持しており、FDNがドメインシフトを効果的に処理できることを示した。
  • FDNは視点変化下でも画像を適切に再構成できており、視点不変特徴の分離能力が裏付けられた。
  • 比較研究により、視点差がある状況下で本手法がUPN-PerspChangeを上回ることを確認し、視点が異なると直接ポリシー転送は失敗することを示した。
  • OfficeWorldの成功確率がNavWorldより高いのは、アクションスペースが単純(90°回転対比30°回転)であるためであり、タスクの複雑さが一般化性能に影響することを確認した。
  • 手動GUIベースのアクションラベリングは、実世界への展開においてボトルネックである。一方、シミュレーションでは逆運動学モデルが有望であるが、実ロボットでは画像のぼやけや離散的アクションの不一致により失敗した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。