Skip to main content
QUICK REVIEW

[論文レビュー] Foresight Social-aware Reinforcement Learning for Robot Navigation

Yanying Zhou, Shijie Li|arXiv (Cornell University)|May 27, 2021
Evacuation and Crowd Dynamics参考文献 26被引用数 4
ひとこと要約

本稿では、複雑で混雑した環境における非ホロノミックロボットナビゲーションのための深層強化学習フレームワークR-SARLを提案する。報酬関数を拡張し、静的および動的障害物との安全でない前方予測相互作用に対してペナルティを課すことで、過度な迂回やタイムアウトを低減し、多様なシミュレーションシナリオにおいて安全性、成功確率、効率性の面で最先端の性能を達成した。

ABSTRACT

When robots handle navigation tasks while avoiding collisions, they perform in crowded and complex environments not as good as in stable and homogeneous environments. This often results in a low success rate and poor efficiency. Therefore, we propose a novel Foresight Social-aware Reinforcement Learning (FSRL) framework for mobile robots to achieve collision-free navigation. Compared to previous learning-based methods, our approach is foresighted. It not only considers the current human-robot interaction to avoid an immediate collision, but also estimates upcoming social interactions to still keep distance in the future. Furthermore, an efficiency constraint is introduced in our approach that significantly reduces navigation time. Comparative experiments are performed to verify the effectiveness and efficiency of our proposed method under more realistic and challenging simulated environments.

研究の動機と目的

  • 過度に慎重な回避行動や凍結行動を示すため、混雑で複雑な群衆において失敗する既存の社会的配慮ナビゲーション手法の限界を解消すること。
  • 実世界の応用で一般的であるが、社会的強化学習においては未だ十分に検討されていない非ホロノミックなユニサイクル型ロボットのナビゲーション性能を向上させること。
  • 静的障害物(例:停止している人)および動的障害物(例:動いている人)との安全でない前方相互作用に対して、事前にペナルティを課すことで、ロボットの凍結問題を防止すること。
  • 静的障害物と動的障害物の将来の軌道に与える影響を別々にモデル化することで、安全性と効率性のバランスを取ること。
  • 混雑した人間の群衆において、社会的に妥当で、効率的かつ衝突のないナビゲーションを促進する報酬関数を開発すること。

提案手法

  • 前方予測に基づく社会的配慮を報酬関数に統合した深層強化学習フレームワークR-SARLを提案する。
  • 定められた距離内での安全でない前方相互作用に対する新しいペナルティ機構を導入し、衝突が発生する前に将来の衝突を推定する。
  • 報酬関数内で、静的障害物(例:停止している人)との安全でない相互作用と、動的障害物(例:動いている人)との安全でない相互作用の影響を別々にモデル化する。
  • 衝突ペナルティ、タイムアウトペナルティ、ナビゲーション効率指標を組み合わせた報酬関数を設計し、ポリシー学習をガイドする。
  • 非ホロノミック制約下で最適な制御ポリシーを学習するために、深層Qネットワーク(DQN)を用いて価値関数を近似する。
  • 異なる群衆密度と障害物配置を持つシミュレーション環境で、エンドツーエンドにポリシーを学習させ、複雑なシナリオに一般化できるようにする。

実験結果

リサーチクエスチョン

  • RQ1どのようにして深層強化学習エージェントを、混雑した群衆において静的および動的障害物を回避するように訓練できるか? これにより、凍結や過度な迂回を防げるか?
  • RQ2先見性に基づく報酬設計は、複雑で動的な環境においてナビゲーション成功確率を向上させ、タイムアウトを低減する程度はどの程度か?
  • RQ3静的障害物と動的障害物の相互作用を別々にモデル化することで、より効率的かつ社会的に適合するナビゲーション経路が得られるか?
  • RQ4安全性、成功確率、ナビゲーション効率の観点から、提案されたR-SARLフレームワークは最先端の手法と比較してどの程度優れているか?
  • RQ5報酬関数に前方相互作用推定を統合することで、保守的回避行動が増加することなく、衝突率は上昇させないか?

主な発見

  • 最も複雑な環境(Env. 3)において、R-SARLはSARLに比べ10%の高い成功確率を達成した。シンプルな設定では4%の差にとどまるため、混雑した群衆におけるロバストネスの向上が示された。
  • Env. 1では衝突率が0.12から0.09に、Env. 3では0.15から0.12に低下し、0.05および0.03の改善を示した。これは、効率性を損なわせることなく、より優れた衝突回避性能を示している。
  • Env. 1ではタイムアウト率が0.08から0.06に、Env. 3では0.23から0.16に低下し、0.02および0.07の改善を示した。極端なシナリオにおける耐性の向上が確認された。
  • 平均ナビゲーション時間はSARL(Env. 1で8.94)と同等の9.42であったが、R-SARLはより困難なケースを処理しているため、SARLが有する「凍結」行動による有効なタイムアウトの増加を回避していることが示された。
  • SARLと比較して、不快距離以下の接近状態の頻度が12.5%低下し、過度な迂回が減少していることが示された。
  • アブレーションスタディの結果、前方相互作用ペナルティとタイムアウトペナルティを併用したR-SARLが最良のパフォーマンスを示し、一方の成分のみを用いる手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。