Skip to main content
QUICK REVIEW

[論文レビュー] Dexterous Manipulation with Deep Reinforcement Learning: Efficient, General, and Low-Cost

Henry Zhu, Abhishek Gupta|arXiv (Cornell University)|Oct 14, 2018
Robot Manipulation and Learning参考文献 26被引用数 19
ひとこと要約

この論文は、モデルフリーの深層強化学習(DRL)が、シミュレーションを経由せずに、実世界で低コストの多指ハンドを用いて、バルブの回転やドアの開閉といった接触が豊富な複雑な操作タスクを直接学習可能であることを示している。タスクの完了には4〜7時間の学習を要するが、20件のヒューマンデモを用いることで、学習時間は2〜3時間に短縮され、シミュレーションやモデルベース制御の代替手段として実用的でスケーラブルであることが実証された。

ABSTRACT

Dexterous multi-fingered robotic hands can perform a wide range of manipulation skills, making them an appealing component for general-purpose robotic manipulators. However, such hands pose a major challenge for autonomous control, due to the high dimensionality of their configuration space and complex intermittent contact interactions. In this work, we propose deep reinforcement learning (deep RL) as a scalable solution for learning complex, contact rich behaviors with multi-fingered hands. Deep RL provides an end-to-end approach to directly map sensor readings to actions, without the need for task specific models or policy classes. We show that contact-rich manipulation behavior with multi-fingered hands can be learned by directly training with model-free deep RL algorithms in the real world, with minimal additional assumption and without the aid of simulation. We learn a variety of complex behaviors on two different low-cost hardware platforms. We show that each task can be learned entirely from scratch, and further study how the learning process can be further accelerated by using a small number of human demonstrations to bootstrap learning. Our experiments demonstrate that complex multi-fingered manipulation skills can be learned in the real world in about 4-7 hours for most tasks, and that demonstrations can decrease this to 2-3 hours, indicating that direct deep RL training in the real world is a viable and practical alternative to simulation and model-based control. \url{https://sites.google.com/view/deeprl-handmanipulation}

研究の動機と目的

  • 実世界環境において複雑な操作タスクを実行できるスケーラブルで汎用的な方法の開発。
  • エンドツーエンドの深層強化学習を用いて、シミュレーションや手作業で設計されたモデル、タスク固有のポリシー設計に依存しないこと。
  • 最小限の事前仮定のもとで、直接実世界での学習の実現可能性と効率性を評価すること。
  • 少量のヒューマンデモが実世界のDRLにおける学習をどの程度高速化できるかを調査すること。
  • センシングやアクチュエーション能力に制限のある低コストの一般部品型ロボットハンドを用いた、高精度な操作の実現可能性を検証すること。

提案手法

  • タスク固有のモデルを一切使用せず、原始的なセンサ観測からモーター出力へと直接マッピングするエンドツーエンドのモデルフリー強化学習アルゴリズムを用いてポリシーを学習した。
  • トルク制御や高次元制御と比較して、発生する振動が少なく、学習の安定性が向上するため、位置制御をアクチュエーション方式として採用した。
  • ゴールまでの距離に基づく報酬関数(例:$ r_1 = -ig Vert heta - heta_{ ext{goal}} ig Vert_2 $)を用い、疎な形状付けにより収束を促進した。
  • DAPGアルゴリズムを用い、ヒューマンデモに基づくファインチューニングを実施し、キネスティックデモを用いてポリシー学習のブートストラップを実現した。
  • 実世界への展開前に、最適な制御方式と報酬関数を選定するために、シミュレーション上でのアブレーションスタディを実施した。
  • センサのノイズ、アクチュエータの遅延、機械的不正確性を含む実機の固有の特性をそのまま反映して、実機上でポリシーを直接学習した。

実験結果

リサーチクエスチョン

  • RQ1モデルフリーの深層強化学習は、シミュレーションや手作業で設計されたモデルを一切用いずに、実世界で接触が豊富な複雑な操作行動を直接学習できるか?
  • RQ2位置制御とトルク制御のような制御空間の選択が、実ロボットハンド上での学習安定性と性能に与える影響はいかほどか?
  • RQ3少量のヒューマンデモが、高精度操作の実世界DRLにおけるサンプル複雑性をどの程度低減できるか?
  • RQ4異なる報酬形状戦略が、実世界での学習速度とポリシー品質に与える影響は何か?
  • RQ5センシングやアクチュエーション能力に制限のある低コストの一般部品型ロボットハンドが、直接実世界で強化学習を用いて高精度な操作を達成できるか?

主な発見

  • バルブの回転やブロックのひっくり返しといった複雑なデリケートな操作タスクが、シミュレーションを一切使用せず、タスク報酬のみを用いて実世界で4〜7時間の学習で成功裏に学習された。
  • 位置制御を採用することで、振動が著しく低減され、トルク制御や高次元制御と比較して、より安定的かつ高速に学習が進行した。
  • 20件のヒューマンデモを用いることで、平均的な学習時間が4〜7時間から2〜3時間に短縮され、サンプル効率が2倍向上した。
  • 疎な密度報酬(例:$ r_2 $)を用いた報酬形状付けにより、制御コストペナルティを用いた場合に比べ、学習の進行が向上した。制御コストペナルティは探索を制限し、収束を遅くする要因となった。
  • 制御コストを導入しなくても、位置制御を用いた場合、実世界で安全で滑らかな動作が得られた。これは、位置制御を用いる場合、制御コストが安全確保に不可欠ではないことを示している。
  • 本手法は、異なる低コストロボットハンドやタスク(剛体および変形体の操作を含む)に一般化可能であり、広範な適用可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。