Skip to main content
QUICK REVIEW

[論文レビュー] Model-based Reinforcement Learning for Decentralized Multiagent Rendezvous

Rose E. Wang, J. Chase Kew|arXiv (Cornell University)|Mar 15, 2020
Reinforcement Learning in Robotics被引用数 9
ひとこと要約

本稿では、通信なしで協調するのを可能にする自己教師付き運動予測を用いた、分散型マルチエージェント集合のためのモデルベース強化学習手法である階層的予測計画(HPP)を提案する。HPPは学習済み運動モデルを用いて計画を動的に整合させ、反復的サブゴール計画を実行することで、複雑で未知のシミュレート環境および現実世界環境においてベースラインを上回る性能を発揮する。

ABSTRACT

Collaboration requires agents to align their goals on the fly. Underlying the human ability to align goals with other agents is their ability to predict the intentions of others and actively update their own plans. We propose hierarchical predictive planning (HPP), a model-based reinforcement learning method for decentralized multiagent rendezvous. Starting with pretrained, single-agent point to point navigation policies and using noisy, high-dimensional sensor inputs like lidar, we first learn via self-supervision motion predictions of all agents on the team. Next, HPP uses the prediction models to propose and evaluate navigation subgoals for completing the rendezvous task without explicit communication among agents. We evaluate HPP in a suite of unseen environments, with increasing complexity and numbers of obstacles. We show that HPP outperforms alternative reinforcement learning, path planning, and heuristic-based baselines on challenging, unseen environments. Experiments in the real world demonstrate successful transfer of the prediction models from sim to real world without any additional fine-tuning. Altogether, HPP removes the need for a centralized operator in multiagent systems by combining model-based RL and inference methods, enabling agents to dynamically align plans.

研究の動機と目的

  • エージェント間の明示的通信や集中型制御なしに、目標を一致させる必要がある分散型マルチエージェント集合の課題に対処すること。
  • LiDARなどの高次元でノイジーなセンサ入力や不完全なナビゲーション方針を伴う現実世界環境でも、エージェントが協調できるようにすること。
  • 微調整なしに未確認の環境に一般化し、シミュレーションから現実世界への展開を可能にするシステムを開発すること。
  • 他のエージェントの運動をモデル化・予測することで、エージェントが逆方向の集合点に向かうような誤協調問題を克服すること。
  • 学習済み運動予測子を用いて計画と制御のフィードバックループを閉じ、動的で障害物が多様な状況において適応的で目標に一致した行動を可能にすること。

提案手法

  • 各エージェントの自身の観測と仮定された目標のみを用いて自己教師付きで運動予測モデルを学習し、エージェントの局所座標系におけるチームメイトの相対運動を予測する。
  • 学習済み運動モデルを用いて、可能な集合サブゴールを階層的計画プロセスで評価し、可能な目標の信念分布を維持する。
  • 計画モジュールで、運動モデルからの予測を用いて実現可能性、協調性、障害物回避をバランスさせる共同目的関数を実装する。
  • 事前に訓練済みのポイントツーポイントナビゲーションポリシーを制御モジュールとして統合し、HPPが予測計画に基づいて集合目標を選択・更新する。
  • 運動予測を用いた反復的再計画により、エージェントが競合する集合点に向かうような誤協調を解消する。
  • エージェントの能力をタスクから分離するために、下位のナビゲーションポリシーのダイナミクスと制限を反映する運動モデルを学習する。

実験結果

リサーチクエスチョン

  • RQ1分散型マルチエージェントシステムは、明示的通信や集中型制御なしにどのように集合を達成できるか?
  • RQ2シミュレーションで訓練された自己教師付き運動予測モデルは、高次元でノイジーなセンサ入力を持つ現実世界環境に一般化可能か?
  • RQ3モデルベース強化学習は、マルチエージェントナビゲーションタスクにおける協調性を向上させ、誤協調を低減するのにどのように寄与するか?
  • RQ4予測モデルを用いた階層的計画は、実現可能で協調的かつ障害物のない集合点の選択をエージェントにどのように可能にするか?
  • RQ5シミュレーションで訓練された運動予測モデルは、複雑で障害物が多様な環境において、どの程度ゼロショットシミュレーションから現実世界への転送を可能にするか?

主な発見

  • HPPは、障害物が多く、対称的なレイアウトを有する複雑で未知のシミュレート環境において、代替の強化学習、経路計画、ヒューリスティックベースのベースラインを上回る性能を発揮する。
  • HPPはゼロショットシミュレーションから現実世界への転送を達成し、運動予測モデルの追加微調整なしに、現実世界環境でも集合タスクを正常に完了する。
  • 現実世界でのテストでは、HPPは一貫して集合タスクを完了するが、MADDPGエージェントはLiDARの効果的利用が不十分で誤協調のため、しばしば円を描いて徘徊する。
  • HPPの性能は、複雑な環境において計画頻度と計画予測範囲が増加するに従い、顕著に向上する。これは、困難な状況において優れたスケーラビリティを示している。
  • アブレーションスタディの結果、エージェントの局所座標系における相対ポーズ変化の予測が、絶対ポーズやグローバルフレームの予測よりも優れた運動モデルをもたらす。
  • HPPは運動予測を用いて信念を更新し、動的に再計画することで、エージェントが逆方向の集合点に向かうような誤協調を効果的に解消する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。