Skip to main content
QUICK REVIEW

[論文レビュー] A System for General In-Hand Object Re-Orientation

Tao Chen, Jie Xu|arXiv (Cornell University)|Nov 4, 2021
Robot Manipulation and Learning被引用数 7
ひとこと要約

この論文は、教師-生徒蒸留手法を用いたモデルフリー強化学習フレームワークを提示し、2,000種類以上の多様な物体形状に対して高精度のゼロショット転送を実現する。物体形状の情報が不要であり、上向きおよび下向きのハンド配置の両方で頑健な再配置を達成しており、蒸留とドメインランダマイゼーションにより現実世界への実装可能性を強く示している。

ABSTRACT

In-hand object reorientation has been a challenging problem in robotics due to high dimensional actuation space and the frequent change in contact state between the fingers and the objects. We present a simple model-free framework that can learn to reorient objects with both the hand facing upwards and downwards. We demonstrate the capability of reorienting over 2000 geometrically different objects in both cases. The learned policies show strong zero-shot transfer performance on new objects. We provide evidence that these policies are amenable to real-world operation by distilling them to use observations easily available in the real world. The videos of the learned policies are available at: https://taochenshh.github.io/projects/in-hand-reorientation.

研究の動機と目的

  • 最小限の事前知識で、多様な物体形状に一般化可能なハンド内物体再配置の課題に取り組む。
  • テーブルサポートの有無に関わらず、上向きおよび下向きのハンド配置での操作を可能にする。
  • 実世界ロボットで容易に入手可能なRGBD観測と関節位置のみを入力として使用するシステムを構築する。
  • 物体形状の明示的监督なしに、未観測の新しい物体形状に対しても強いゼロショット一般化を達成する。
  • 蒸留を用いて特権情報を持つポリシーの知識を現実世界対応ポリシーに統合し、実世界への展開可能性を実証する。

提案手法

  • 特権状態情報(例:物体の速度)を用いて訓練された教師ポリシーを、実世界センサー入力のみを用いる学生ポリシーに、モデルフリー深層強化学習と教師-生徒訓練パラダイムを用いて蒸留する。
  • 訓練中に重力の強さを段階的に増加させる重力カリキュラムを導入し、再配置タスクの難易度を段階的に上げることで、サンプル効率と安定性を向上させる。
  • 下向きハンド操作は本質的に不安定であるため、事前学習済みの持ち上げポリシーを用いて安定した物体初期化を実現し、一貫した初期状態を保証する。
  • 物体モデルや接触ダイナミクス、複雑な前処理に依存せずに、生の点群観測と関節位置を入力として使用する。
  • 訓練中にドメインランダマイゼーションを適用し、センサーノイズや分布シフトに強い耐性を付与し、実世界環境への転送を可能にする。
  • 2,000種類以上の幾何的に異なる物体をカバーする一様なポリシーを訓練し、形状に依存しない制御戦略の有効性を示す。

実験結果

リサーチクエスチョン

  • RQ1一様な形状に依存しないポリシーは、上向きおよび下向きのハンド配置の両方で、多数の幾何的に異なる物体を再配置できるか?
  • RQ2物体形状や物理モデルの情報が入手不可な状況下でも、モデルフリー強化学習がハンド内再配置で高い成功確率を達成できるか、その程度は?
  • RQ3特権情報を持つポリシーを、RGBDと関節状態入力のみを用いて実世界対応ポリシーに効果的に転送する教師-生徒蒸留は、どの程度有効か?
  • RQ4重力カリキュラムは、不安定な下向きハンド操作タスクにおいて学習効率と性能を顕著に向上させるか?
  • RQ5ドメインランダマイゼーションとトルク解析は、学習済みポリシーを実ロボットハンドに展開可能であることを検証できるか?

主な発見

  • 本システムは、上向きおよび下向きのハンド配置の両方で、2,000種類以上の幾何的に異なる物体を再配置に成功した。
  • 形状情報が訓練中に提供されない状況下でも、未観測の新しい物体形状に対して強いゼロショット一般化を達成した。
  • 本研究は、形状に依存しない制御が、高性能なハンド内再配置を達成可能であることを示し、このようなタスクにおいて形状認識が不可欠であるという仮定に疑問を呈した。
  • 実世界センサー入力のみで訓練された蒸留済み学生ポリシーは、ドメインランダマイゼーションとトルク解析により、実世界への展開可能性が強く裏付けられた。
  • 重力カリキュラムと持ち上げポリシーによる安定的初期化は、困難な下向きハンド配置での高い性能を達成するために不可欠であった。
  • ピークトルク解析により、生成された制御命令が実ロボットハンドの実行可能制御限界内にあることが確認され、実世界への転送可能性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。