Skip to main content
QUICK REVIEW

[論文レビュー] Co-GAIL: Learning Diverse Strategies for Human-Robot Collaboration

Chen Wang, Claudia Pérez-D’Arpino|arXiv (Cornell University)|Aug 13, 2021
Reinforcement Learning in Robotics参考文献 48被引用数 6
ひとこと要約

Co-GAILは、人間同士の協働デモンストレーションから、人間とロボットのポリシーを同時に学習する共同最適化フレームワークを提案する。分離された潜在戦略空間を用いて多様な人間の行動をモデル化し、2D協調、手渡し、順次操作タスクにおいて、シミュレーションおよび実際の人間を含むループ評価で最先端の手法を上回る。これは、多様な人間の戦略に柔軟に適応できる強固な能力を実現する。

ABSTRACT

We present a method for learning a human-robot collaboration policy from human-human collaboration demonstrations. An effective robot assistant must learn to handle diverse human behaviors shown in the demonstrations and be robust when the humans adjust their strategies during online task execution. Our method co-optimizes a human policy and a robot policy in an interactive learning process: the human policy learns to generate diverse and plausible collaborative behaviors from demonstrations while the robot policy learns to assist by estimating the unobserved latent strategy of its human collaborator. Across a 2D strategy game, a human-robot handover task, and a multi-step collaborative manipulation task, our method outperforms the alternatives in both simulated evaluations and when executing the tasks with a real human operator in-the-loop. Supplementary materials and videos at https://sites.google.com/view/co-gail-web/home

研究の動機と目的

  • 人間同士のデモンストレーションで観察された多様な人間協働戦略に適応できるロボットポリシーの開発を目的とする。
  • 従来の手法が人間を静的環境要因として扱い、学習中に相互的な行動適応をモデル化できないという限界を解決することを目的とする。
  • ロボットが未観測の人間の潜在戦略を推論・予測し、効果的なリアルタイム協働を可能にする。
  • デモンストレーションから分離可能で解釈可能な戦略表現を学習することで、人間-ロボット協働の一般化とロバストネスを向上させることを目的とする。
  • 複雑な操作タスクにおける多様な人間行動に適応できる能力を、実際の人間を含むループ環境で実証することを目的とする。

提案手法

  • 人間ポリシーとロボットポリシーを、両者が同時に学習過程で進化する相互作用学習プロセスを通じて共同最適化する。
  • 人間デモンストレーションから得られる多様な協働行動を分離・モデル化するための潜在戦略表現を導入する。
  • 推論時に相手人間の潜在戦略コードを推定するための戦略認識ネットワークψを用い、将来の行動を予測可能にする。
  • 潜在空間における多様性目的(式3)を採用し、全デモンストレーション戦略のカバー範囲を確保し、過学習を防ぐ。
  • 生成された人間-ロボット軌道とエキスパートの軌道を区別する識別器を用いた敵対的インスパイラショングレーディング(GAIL)により、ロボットポリシーを学習する。
  • 手動で設計された報酬関数を避けるために、人間同士のデモンストレーションデータのみを教師信号として用いる。

実験結果

リサーチクエスチョン

  • RQ1人間同士のデモンストレーションで観察された多様な人間協働戦略に一般化できるロボットポリシーを学習できるか?
  • RQ2学習中に人間とロボットのポリシーを共同最適化することで、人間を静的環境とみなす従来手法と比較して、より優れた適応性とロバストネスが得られるか?
  • RQ3分離された潜在戦略空間は、複雑なタスクにおける明確に異なる人間協働行動を効果的に表現・一般化できるか?
  • RQ4従来のインスパイラショングレーディングベースラインと比較して、実際の人間を含むループ環境での性能はどの程度か?
  • RQ5補間およびゼロショット適応の文脈で、未観測の人間戦略への一般化度はどの程度達成できるか?

主な発見

  • 2D-Fetch-Questタスクにおいて、Co-GAILは全ユーザーで100%の成功率を達成し、MA-InfoGAIL(平均85%)およびMA-GAIL(65%)を顕著に上回った。
  • HR-Handoverタスクでは、Co-GAILがユーザー平均で75%の成功率を達成し、BC-single(20%)、MA-GAIL(35%)、MA-InfoGAIL(65%)を上回った。
  • HR-SeqManipタスクでは、Co-GAILがユーザー平均で60%の成功率を達成し、BC-single(10%)、MA-GAIL(25%)、MA-InfoGAIL(35%)を上回った。
  • 潜在空間の可視化から、Co-GAILはMA-GAILやMA-InfoGAILと比較して、明確な人間戦略(例:左/中央/右の手渡しゾーン)の分離をよりよく学習していることが示された。
  • 補間タスクにおいて、Co-GAILはMA-GAIL、MA-InfoGAIL、DIAYNと比較して、デモンストレーション分布のより広範なカバーを示し、過学習が少ないことが確認された。
  • 実際の人間評価では、Co-GAILが多様な人間行動への優れた適応性を示し、ユーザーおよび試行間で一貫したパフォーマンスを発揮した。これは、複雑な連続運動タスクにおけるこのような適応性の成功実証として、初めての例である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。