Skip to main content
QUICK REVIEW

[論文レビュー] Learning Purely Tactile In-Hand Manipulation with a Torque-Controlled Hand

Leon Sievers, Johannes Pitz|arXiv (Cornell University)|Apr 7, 2022
Robot Manipulation and Learning被引用数 6
ひとこと要約

本論文は、トルク制御可能な人間型ハンドを用いた、最初の成功した学習ベースの純粋なタクトイルによるハンドインマニピュレーションポリシーを提示する。シミュレーションでオフポリシー深層強化学習を用い、ドメイン適応型カリキュラムを適用して訓練した。このポリシーは、視覚フィードバックや外部状態推定を一切使用せず、ジョイント位置およびトルクフィードバックのみを用いて、安定的かつ連続的な2π回転を実現し、実世界の実験でも撫でるような干渉があっても46回を超える完全な回転を達成した。

ABSTRACT

We show that a purely tactile dextrous in-hand manipulation task with continuous regrasping, requiring permanent force closure, can be learned from scratch and executed robustly on a torque-controlled humanoid robotic hand. The task is rotating a cube without dropping it, but in contrast to OpenAI's seminal cube manipulation task, the palm faces downwards and no cameras but only the hand's position and torque sensing are used. Although the task seems simple, it combines for the first time all the challenges in execution as well as learning that are important for using in-hand manipulation in real-world applications. We efficiently train in a precisely modeled and identified rigid body simulation with off-policy deep reinforcement learning, significantly sped up by a domain adapted curriculum, leading to a moderate 600 CPU hours of training time. The resulting policy is robustly transferred to the real humanoid DLR Hand-II, e.g., reaching more than 46 full 2$π$ rotations of the cube in a single run and allowing for disturbances like different cube sizes, hand orientation, or pulling a finger.

研究の動機と目的

  • 視覚フィードバックや外部オブジェクト状態推定に依存しない、完全にタクトイルなハンドインマニピュレーションポリシーの開発。
  • 常に力閉じ込め状態が維持される中で、探索が制限される中での連続的再グリップの課題に対処すること。
  • 高自由度の人間型ロボットハンドにおける複雑なタクトイルマニピュレーションタスクについて、効率的なシミュレーションから実世界への転送を達成すること。
  • ハンドの向きの変化、指の引き抜き、オブジェクトサイズの変動といった実世界の摂動に対して頑健であることを実証すること。
  • DLR Hand-IIの組み込みジョイントおよびトルクセンサのみを用いて、46回を超える長時間スケールのマニピュレーション(2π回転)を可能にすること。

提案手法

  • トルクベースのインピーダンス制御を備えたDLR Hand-IIの高精度な剛体シミュレーションを用い、オフポリシーのソフトアクターキャスティング(SAC)を用いて深層強化学習ポリシーを訓練した。
  • シミュレーションのハイパーパrameter(例:フィルタ定数、重力)を調整するドメイン適応型カリキュラムを統合し、収束を加速させるとともに、シミュレーションから実世界への転送を改善した。
  • 外部状態推定や視覚を必要とせず、組み込みのジョイント位置および出力側トルクセンサの読み出し値のみを観測として使用した。
  • 駆動系の弾性特性およびスリップ・スティック摩擦を、トルクコントローラーの抽象化によって正確に再現する高精度なシミュレーションモデルを実装した。
  • ドメインランダマイゼーションおよびシミュレーション同定を適用し、頑健性を向上させるとともに、実世界への正確な転送を保証した。
  • 継続的トレーニングを用いてポリシーを微調整し、既知の形状の直方体のような非立方体オブジェクトに対しても対応できるようにした。

実験結果

リサーチクエスチョン

  • RQ1視覚フィードバックなしで、完全にタクトイルなハンドインマニピュレーションポリシーを初期状態から学習し、実際のトルク制御人間型ハンドに成功裏に転送できるか?
  • RQ2グリップを維持する必要がある中で探索が制限される中で、常に力閉じ込め状態にある条件下で、連続的再グリップを効果的に学習する方法は何か?
  • RQ3ドメイン適応型カリキュラムは、タクトイルマニピュレーションタスクにおけるトレーニングの加速およびシミュレーションから実世界への転送改善にどのような役割を果たすか?
  • RQ4指の引き抜き、ハンドの再方向転換、オブジェクトサイズの変動といった実世界の摂動に対して、学習済みポリシーがどの程度耐性を示すか?
  • RQ5立方体で学習したポリシーは、微調整によって直方体などの既知の形状のオブジェクトに一般化可能か?

主な発見

  • ポリシーは1回の実世界実験で289ラジアン(46回を超える2π回転)の立方体回転を達成し、極めて優れた長時間スケールの安定性を示した。
  • 10回中8回の実世界実験が成功した(最良のシミュレーション性能の80%以上を達成)ことで、強力なシミュレーションから実世界への転送が確認された。
  • ポリシーはオープンループの手作業で設計された軌道や、再再生されたジョイント角度シーケンスよりも優れており、不安定性によりわずかπ/2ラジアンで失敗した。
  • 予期しない摂動、例えば指の引き抜き、ハンドの再方向転換、最大2cmまでのオブジェクトサイズの変動に対しても、ポリシーは頑健であることを示した。
  • リンク側トルクセンサの使用により、制御誤差を検知し、グリップ失敗からの回復が可能となり、閉ループでの適応が可能になった。
  • 微調整により、ポリシーは直方体のマニピュレーションにも成功し、元の立方体タスクを超えて、既知の任意の形状への応用が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。