Skip to main content
QUICK REVIEW

[論文レビュー] i-Sim2Real: Reinforcement Learning of Robotic Policies in Tight Human-Robot Interaction Loops

Saminda Abeyruwan, Laura Graesser|arXiv (Cornell University)|Jul 14, 2022
Reinforcement Learning in Robotics被引用数 12
ひとこと要約

本論文では、人間の行動モデルとロボット方策を交互にシミュレーションと現実世界のデプロイメントを繰り返すことで共進化させる、反復的シミュレーションから現実への強化学習フレームワークi-Sim2Real (i-S2R) を提案する。本手法は、独自のブラックボックス勾配センシング(BGS)アルゴリズムを用い、現実の相互作用データから人間の行動モデルを精緻化することで、人間との密接なヒューマンロボットインタラクションを実現するロボット方策の訓練を可能にした。その結果、人間とのテーブルテニスのラリー平均22本を達成し、S2R+FTベースライン比で70–175%の延長を実現した。

ABSTRACT

Sim-to-real transfer is a powerful paradigm for robotic reinforcement learning. The ability to train policies in simulation enables safe exploration and large-scale data collection quickly at low cost. However, prior works in sim-to-real transfer of robotic policies typically do not involve any human-robot interaction because accurately simulating human behavior is an open problem. In this work, our goal is to leverage the power of simulation to train robotic policies that are proficient at interacting with humans upon deployment. But there is a chicken and egg problem -- how to gather examples of a human interacting with a physical robot so as to model human behavior in simulation without already having a robot that is able to interact with a human? Our proposed method, Iterative-Sim-to-Real (i-S2R), attempts to address this. i-S2R bootstraps from a simple model of human behavior and alternates between training in simulation and deploying in the real world. In each iteration, both the human behavior model and the policy are refined. For all training we apply a new evolutionary search algorithm called Blackbox Gradient Sensing (BGS). We evaluate our method on a real world robotic table tennis setting, where the objective for the robot is to play cooperatively with a human player for as long as possible. Table tennis is a high-speed, dynamic task that requires the two players to react quickly to each other's moves, making for a challenging test bed for research on human-robot interaction. We present results on an industrial robotic arm that is able to cooperatively play table tennis with human players, achieving rallies of 22 successive hits on average and 150 at best. Further, for 80% of players, rally lengths are 70% to 175% longer compared to the sim-to-real plus fine-tuning (S2R+FT) baseline. For videos of our system in action, please see https://sites.google.com/view/is2r.

研究の動機と目的

  • 人間の行動がシミュレーションしにくく、そのモデル化に現実世界のデータが必要となる、シミュレーションから現実への強化学習における「鶏とたまごの問題」を解決すること。
  • 現実世界にデプロイした際に人間と効果的に相互作用できるロボット方策を、シミュレーション内で訓練できるフレームワークを開発すること。
  • 反復的に現実の相互作用データを用いて人間の行動モデルとロボット方策を改善することで、高価な現実世界のファインチューニングへの依存を低減すること。
  • 高速でダイナミックなタスク—密接かつリアルタイムなヒューマンロボット協調を要する協同的テーブルテニス—において、本手法を評価すること。
  • 反復的な人間の行動モデルの精緻化が、標準的なシミュレーションから現実への移行と比較して、顕著に向上した現実世界のパフォーマンスをもたらすことを実証すること。

提案手法

  • 本手法は、人間の行動モデルを用いてシミュレーションでロボット方策を訓練し、その後その方策を現実世界にデプロイしてヒューマンロボット相互作用データを収集するというプロセスを繰り返す。
  • ロボットデプロイの前段階で収集した現実世界データから、初期の粗い人間の行動モデルを構築し、ボールの軌道分布を捉える。
  • 現実世界の相互作用データを用いて、人間の行動モデルを反復的に精緻化し、その後続のシミュレーション訓練における忠実度を向上させる。
  • 環境を介した勾配計算を必要としないため、効率的な方策最適化が可能な、新規の進化的探索アルゴリズム「ブラックボックス勾配センシング(BGS)」を用いてロボット方策を訓練する。
  • ボールの投げ方の分布に基づく表現を用いて人間の行動モデルを更新し、観測された人間の投げ方のパターンに一致するようにパラメータを調整する。
  • 複数の反復サイクルを経て、各サイクルで人間モデルとロボット方策の両方が向上し、性能が収束するまで繰り返す。

実験結果

リサーチクエスチョン

  • RQ1事前に現実世界の相互作用データが得られない状況下でも、シミュレーション内で人間と協同的に相互作用できるロボット方策を、高速でダイナミックなタスク(例:テーブルテニス)において有効に訓練できるか?
  • RQ2現実世界の相互作用データから人間の行動モデルを反復的に精緻化することで、ヒューマンロボットインタラクションにおけるシミュレーションから現実への移行パフォーマンスはどのように向上するか?
  • RQ3人間の行動モデルの品質が、ゼロショットのシミュレーションから現実への移行パフォーマンスおよびファインチューニングの効率に、どの程度影響を与えるか?
  • RQ4本手法であるi-S2Rフレームワークは、標準的なシミュレーションから現実への移行に加え、ファインチューニング(S2R+FT)と比較して、多様な人間プレイヤーにおいてラリー長および耐性の面で優れているか?
  • RQ5学習された人間の行動モデルは、ロボット方策の強化に適した多様で現実的である人間の軌道をシミュレーションで効果的に生成できるか?

主な発見

  • i-S2R手法は、現実世界における協同的テーブルテニスで平均22本の成功ラリーを達成し、S2R+FTベースラインを著しく上回った。
  • 80%のプレイヤーにおいて、i-S2R方策はS2R+FTベースライン比で70%から175%のラリー延長を達成した。
  • i-S2R方策のゼロショット移行パフォーマンスは、ベースライン手法よりも顕著に優れており、中程度の分布を持つ人間モデルがS2Rオラクル(理想)モデルと同等のパフォーマンスを達成した。
  • 反復的な人間モデルの精緻化により、初期方策の一般化性能が向上したため、高価な現実世界のファインチューニングの必要性が低減された。
  • ヒートマップ分析の結果、i-S2R方策はS2R+FTと比較して、ボールの発進位置および着地位置の広い範囲で高いヒット率を達成した。
  • ボールの分布のt-SNE可視化により、i-S2R手法が時間経過とともにより多様で人間と一致するボール軌道を学習したことが確認され、シミュレートされた分布と現実世界の分布との重なりが向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。