Skip to main content
QUICK REVIEW

[論文レビュー] Learning World Transition Model for Socially Aware Robot Navigation

Yuxiang Cui, Haodong Zhang|arXiv (Cornell University)|Nov 8, 2020
Evacuation and Crowd Dynamics参考文献 21被引用数 5
ひとこと要約

本論文では、2次元レーザースキャンから将来の観測と報酬を予測する深層ワールド遷移モデルを用いて、社会的配慮のあるロボットナビゲーションのためのモデルベース強化学習フレームワークを提案する。自己移動を分離してスタックされた局所障害物マップを生成することで、サンプル効率が向上し、最小限の実世界相互作用データでのトレーニングが可能となり、シミュレーションおよび実世界の両環境で高い成功確率を達成。逆に、模倣学習やモデルフリー強化学習のベースラインを上回る性能を発揮する。

ABSTRACT

Moving in dynamic pedestrian environments is one of the important requirements for autonomous mobile robots. We present a model-based reinforcement learning approach for robots to navigate through crowded environments. The navigation policy is trained with both real interaction data from multi-agent simulation and virtual data from a deep transition model that predicts the evolution of surrounding dynamics of mobile robots. The model takes laser scan sequence and robot's own state as input and outputs steering control. The laser sequence is further transformed into stacked local obstacle maps disentangled from robot's ego motion to separate the static and dynamic obstacles, simplifying the model training. We observe that our method can be trained with significantly less real interaction data in simulator but achieve similar level of success rate in social navigation task compared with other methods. Experiments were conducted in multiple social scenarios both in simulation and on real robots, the learned policy can guide the robots to the final targets successfully while avoiding pedestrians in a socially compliant manner. Code is available at https://github.com/YuxiangCui/model-based-social-navigation

研究の動機と目的

  • サンキュー効率の低い社会的配慮のあるロボットナビゲーション方策のトレーニングという課題に対処すること。
  • 変化する周囲環境をモデル化することで、動的歩行者環境における一般化性と安全性を向上させること。
  • 合成データ生成を通じて、広範な実世界相互作用データへの依存を低減すること。
  • 自己教師ありワールドモデルを用いて、ポリシーを実ロボットに直接転送可能にすること。
  • 分離された局所障害物マップを用いて静的・動的障害物を区別することで意思決定を向上させること。

提案手法

  • 自己教師ありの方法で深層ワールド遷移モデルを学習し、現在のレーザースキャンとロボット状態から将来のレーザー観測と関連報酬を予測する。
  • 自己移動を分離することで、レーザースキャンの系列がスタックされた局所障害物マップに変換され、静的・動的障害物が分離される。
  • ポリシーネットワークは、実世界の相互作用データと、ワールドモデルによって生成された豊富な仮想データの組み合わせを用いてトレーニングされ、サンプル効率が向上する。
  • 分散型でポリシーを共有するマルチエージェントシミュレーション環境がポリシーのトレーニングに用いられ、現実的な社会的相互作用ダイナミクスが実現される。
  • 障害物マップ表現により、静的と動的障害物の空間的区別が明確になり、ポリシー学習が簡素化される。
  • フレームワークはモデルベース強化学習を採用しており、ワールドモデルを用いて相互作用をシミュレートし、ポリシー最適化を加速する。

実験結果

リサーチクエスチョン

  • RQ1自己教師ありワールド遷移モデルは、社会的配慮のあるナビゲーション方策のトレーニングにおけるサンプル効率を顕著に改善できるか?
  • RQ2レーザースキャンにおける自己移動の分離は、ポリシー性能とトレーニング安定性にどのように影響するか?
  • RQ3モデルベースアプローチは、実世界相互作用データを少なくした場合でも、モデルフリーまたは模倣学習のベースラインと同等またはそれ以上の性能を達成できるか?
  • RQ4シミュレーションでトレーニングされたポリシーが、実世界のロボットデプロイメントに成功裏に転送できる範囲はどの程度か?
  • RQ5学習済みワールドモデルから得られる仮想データの使用は、収束速度と最終的性能にどのように影響するか?

主な発見

  • 提案手法は、FDMCA や MNDS と比較して、はるかに少ない実世界相互作用データでも、平均報酬が高く、収束が速い。
  • 仮想データ生成を伴うモデルベースアプローチにより、広範な実世界相互作用の必要性が低減され、効率的なポリシー学習が可能になる。
  • シミュレーションでは、通過と向かうシナリオでそれぞれ92%および90%の成功率を達成し、ベースラインを上回る。
  • 実ロボットでは、通過、通過、向かうシナリオを安全かつ社会的配慮のある距離を保ちながら効果的にナビゲートする。
  • 実世界評価では、自己スコア(安全距離準拠)が94.3%、社会的スコア(快適距離準拠)が89.1%に達する。
  • アブレーションスタディにより、予測ワールドモデルと障害物マップ表現が性能に不可欠であることが確認され、それらを削除すると収束が遅く、成功率も低下する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。