Skip to main content
QUICK REVIEW

[論文レビュー] Role Playing Learning for Socially Concomitant Mobile Robot Navigation

Mingming Li, Rui Jiang|arXiv (Cornell University)|May 29, 2017
Reinforcement Learning in Robotics参考文献 46被引用数 3
ひとこと要約

本論文は、動的環境において人間の同伴者と共に社会的に適合するナビゲーションを可能にする強化学習フレームワークであるロールプレイ学習(RPL)を提案する。実際の歩行者軌跡を用いて対話をシミュレートし、PO-TRPOを用いてニューラルネットワーク方策を最適化することで、ロボットは同伴者に近接しながらも協働的に障害物を避けるよう学習し、実世界のテストで平均同伴距離1.05m、最小歩行者距離0.49mを達成し、人間と同様のナビゲーション行動を実現した。

ABSTRACT

In this paper, we present the Role Playing Learning (RPL) scheme for a mobile robot to navigate socially with its human companion in populated environments. Neural networks (NN) are constructed to parameterize a stochastic policy that directly maps sensory data collected by the robot to its velocity outputs, while respecting a set of social norms. An efficient simulative learning environment is built with maps and pedestrians trajectories collected from a number of real-world crowd data sets. In each learning iteration, a robot equipped with the NN policy is created virtually in the learning environment to play itself as a companied pedestrian and navigate towards a goal in a socially concomitant manner. Thus, we call this process Role Playing Learning, which is formulated under a reinforcement learning (RL) framework. The NN policy is optimized end-to-end using Trust Region Policy Optimization (TRPO), with consideration of the imperfectness of robot's sensor measurements. Simulative and experimental results are provided to demonstrate the efficacy and superiority of our method.

研究の動機と目的

  • ロボットが他の人と衝突を避ける一方で、同伴者と共にナビゲートする社会的適合ナビゲーション(SCN)の課題に対処すること。
  • 歩行者を静的障害物として扱う従来の手法や、共有意思決定モデルを仮定する手法の限界を克服すること。
  • グローバルマップや既知の目的地、ドメイン特化した特徴量を必要としない、一般化可能でセンサーに強いナビゲーション方策を開発すること。
  • 実世界の歩行者軌跡を再現するシミュレーティブ環境を活用し、効率的で安全な方策学習を可能にすること。
  • ロボットが同伴者との自然で快適な距離(平均1.05m)を維持しながら、他の歩行者からの安全距離(最小0.49m)を保つこと。

提案手法

  • センサのノイズや観測の不完全性を考慮するため、SCNを部分的に観測可能なマルコフ意思決定過程(POMDP)として定式化する。
  • 実世界の群衆軌跡データセットを用いて、歩行者の行動や通路のダイナミクスを再現するシミュレーティブ学習環境を構築する。
  • 観測の不確実性を扱い、オンポリシー学習を可能にする部分的観測信頼領域方策最適化(PO-TRPO)を用いて、ニューラルネットワーク方策を訓練する。
  • ロールプレイ学習(RPL)を実装し、各訓練イテレーションでロボットが自分自身を同伴者として仮想的に「演じる」ことで、ランダムに選択された歩行者と共同ナビゲーションをシミュレートする。
  • 目的地への近接度、衝突回避、同伴者との距離を評価指標とするスパarsな報酬に基づいて、方策をエンドツーエンドで最適化する。
  • センサのノイズや視野制限の制約を観測空間に直接組み込み、実ロボットの制限を反映する。

実験結果

リサーチクエスチョン

  • RQ1同伴者の目的地を事前に知らない状態でも、ロボットは混雑した動的環境で人間の同伴者と共に協働的にナビゲートする能力を学習できるか?
  • RQ2他の歩行者との衝突を避けながら、社会的に許容できる距離(平均1.05m)を維持するにはどうすればよいか?
  • RQ3実際の歩行者軌跡を用いたシミュレーティブ環境で学習した方策が、未観測の現実世界シナリオにどの程度一般化できるか?
  • RQ4共有意思決定モデルを仮定しない状況でも、ロボットは人間と同様に協働的衝突回避行動を実現できるか?
  • RQ5センサのノイズや部分的観測性は、社会的適合ナビゲーション方策のロバスト性と性能にどのように影響するか?

主な発見

  • 共同衝突回避の過程で、対向歩行者との最小平均距離が0.49mにまで短縮され、安全かつ効果的な障害物ナビゲーションが実証された。
  • 同伴者との平均距離が1.05mに達し、人間の制御ベースライン(1.0m)とよく一致しており、良好な同伴行動と自然な歩行の同期が実現された。
  • ロボットは、壁に向かって進んで他者に通路を空けるなど、能動的に空間を譲ることで「凍結ロボット問題」を回避した。
  • 方策は現実世界のシナリオへの一般化がうまくいった。社会的ナビゲーションおよびSCNタスクにおいて、人間が運転する場合と同等の性能を示した。
  • RPLフレームワークにより、グローバルマップや既知の目的地、手動で設計された特徴量を一切必要とせず、エンドツーエンドの学習が可能になり、一般化性が向上した。
  • PO-TRPOは部分的観測下でも方策を効果的に最適化し、センサのノイズや視野制限の制約に対してロバストであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。