Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Handover: Throw and Catch with Bimanual Hands

Binghao Huang, Yuanpei Chen|arXiv (Cornell University)|Sep 11, 2023
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本論文では、シミュレーションにおけるマルチエージェント強化学習(MARL)を用い、Sim2Real移行を実現した、二本の多指ハンド(xArm ロボット上に搭載された Allegro Hands)を用いた高速投げ・受け渡しタスクを実行する、二腕型ロボットシステム「Dynamic Handover」を提案する。主な貢献は、物体の軌道をリアルタイムで予測するモデルを導入し、動的で閉ループな受け渡しを可能にしたことである。このアプローチにより、多様な物体を対象とした実世界実験で、ベースラインと比較して著しく高い成功確率が達成された。

ABSTRACT

Humans throw and catch objects all the time. However, such a seemingly common skill introduces a lot of challenges for robots to achieve: The robots need to operate such dynamic actions at high-speed, collaborate precisely, and interact with diverse objects. In this paper, we design a system with two multi-finger hands attached to robot arms to solve this problem. We train our system using Multi-Agent Reinforcement Learning in simulation and perform Sim2Real transfer to deploy on the real robots. To overcome the Sim2Real gap, we provide multiple novel algorithm designs including learning a trajectory prediction model for the object. Such a model can help the robot catcher has a real-time estimation of where the object will be heading, and then react accordingly. We conduct our experiments with multiple objects in the real-world system, and show significant improvements over multiple baselines. Our project page is available at \url{https://binghao-huang.github.io/dynamic_handover/}.

研究の動機と目的

  • ロボットにおける高速で力学的かつ動的な投げ・受け渡しタスクを、二腕型の器用な操作で安定して実行可能にするための研究。
  • 二腕型器用操作における高次元の行動空間、多様な物体の動的特性、およびシミュレーションと現実世界のドメインギャップという課題に取り組むこと。
  • 物体のリアルタイム軌道予測を組み込むことで、適応的な受け渡しを可能にし、実世界での耐障害性を向上させること。
  • 未観測の物体や物理的不確実性下でも安定した性能を示す一般化能力を実証すること。
  • エンドツーエンド学習と Sim2Real 移行を用いた、動的二腕操作のための新たなベンチマークを確立すること。

提案手法

  • 投げ手と受け手の2つの独立エージェント(それぞれ別個の強化学習ポリシー)を用い、高速な二腕操作を調整するマルチエージェント強化学習(MARL)ポリシーを訓練する。
  • 一般化性能と耐障害性を向上させるために、訓練段階で摩擦、慣性、重心位置、接触力などの物理的パrameterを広範囲にランダム化する。
  • 物体の将来位置をリアルタイムで推定する学習済みの軌道予測モデルを導入し、受け手ポリシーが閉ループで制御できるようにする。
  • 各エージェントに部分観測を適用することで、ポリシーの耐障害性を高め、シミュレーションと実世界のドメインギャップを低減する。
  • シミュレーションと実機ロボットハードウェア間の PD コントローラーを一致させるためのシステム同定を実施し、Sim2Real 移行を成功させる。
  • 複雑な動的タスクにおける安定したポリシー学習と収束を改善するための段階的訓練パイプラインを採用する。

実験結果

リサーチクエスチョン

  • RQ1マルチエージェント強化学習は、高速で動的な投げ・受け渡しタスクにおいて、二つの器用なハンドを効果的に協調制御できるか?
  • RQ2リアルタイムの物体軌道予測は、実世界における Sim2Real 移行の耐障害性と成功確率をどのように向上させるか?
  • RQ3訓練段階での物理的ランダム化は、未観測の物体や実世界の動的特性への一般化をどの程度向上させるか?
  • RQ4初期の把持の質は、投げの再現性と動的ハンドオーバーの成功にどのように影響するか?
  • RQ5実世界環境下で、MARL と軌道予測の両者が全体のシステム性能に果たす相対的貢献度はどの程度か?

主な発見

  • 実世界実験において、本手法はボールで60%、シリンダーで53%、三角形で33%の成功確率を達成し、すべてのアブレーションベースラインを著しく上回った。
  • アブレーションスタディの結果、MARL と軌道予測の両方を削除すると、三角形のタスクで成功確率が0%に低下し、両者の必要性が明確に示された。
  • 本手法のヒットレートはボールで93%に達し、物体の軌道予測の高精度と受け手ポリシーへの的確な誘導を示している。
  • MARL を除いたアブレーションでは、ボールで40%、シリンダーで20%の成功確率に低下し、協調的でマルチエージェント学習の重要性が裏付けられた。
  • 軌道予測を除いたアブレーションでは、ボールで33%、シリンダーで40%の成功確率にとどまり、リアルタイム予測が適応性と耐障害性を向上させることの有効性が示された。
  • 初期のしっかりとした把持(Pose C)により、着地位置の分散が x 方向で 0.024m、y 方向で 0.043m にまで低下し、投げの安定性と再現性が優れていることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。