Skip to main content
QUICK REVIEW

[論文レビュー] DiffSkill: Skill Abstraction from Differentiable Physics for Deformable Object Manipulations with Tools

Xingyu Lin, Zhiao Huang|arXiv (Cornell University)|Mar 31, 2022
Robot Manipulation and Learning被引用数 14
ひとこと要約

DiffSkillは、微分可能物理シミュレータを活用して、工具を用いた延々とした時間枠の変形物体の操作において再利用可能なスキルを自動で抽象化するフレームワークを提案する。勾配ベースの最適化によるデモ軌道を用いて訓練されたニューラルスキル抽象化器を活用し、RGB-D観測に基づいてこれらの抽象化されたスキルを計画することで、複雑な生地操作タスクにおいて、モデルフリー強化学習および単独の軌道最適化よりも優れた性能を達成する。

ABSTRACT

We consider the problem of sequential robotic manipulation of deformable objects using tools. Previous works have shown that differentiable physics simulators provide gradients to the environment state and help trajectory optimization to converge orders of magnitude faster than model-free reinforcement learning algorithms for deformable object manipulation. However, such gradient-based trajectory optimization typically requires access to the full simulator states and can only solve short-horizon, single-skill tasks due to local optima. In this work, we propose a novel framework, named DiffSkill, that uses a differentiable physics simulator for skill abstraction to solve long-horizon deformable object manipulation tasks from sensory observations. In particular, we first obtain short-horizon skills using individual tools from a gradient-based optimizer, using the full state information in a differentiable simulator; we then learn a neural skill abstractor from the demonstration trajectories which takes RGBD images as input. Finally, we plan over the skills by finding the intermediate goals and then solve long-horizon tasks. We show the advantages of our method in a new set of sequential deformable object manipulation tasks compared to previous reinforcement learning algorithms and compared to the trajectory optimizer.

研究の動機と目的

  • 局所最適解のため、勾配ベースの最適化手法が困難となる、工具を用いた延々とした時間枠・多段階の変形物体操作の課題に対処する。
  • 微分可能物理シミュレータが完全な状態情報が必要であり、短時間枠タスクに限定されるという制限を克服する。
  • 完全なシミュレータ状態に依存せず、RGB-D観測から直接スキル抽象化を学習することで、現実世界への一般化を可能にする。
  • 持ち上げ、広げる、集める、運ぶ、切る、再配置するといった複雑な順序タスクを実現するための抽象化されたスキルの組み合わせを構築する手法を開発する。
  • 微分可能物理の高いサンプル効率性と、長時間枠ロボット操作における階層的計画のニーズのギャップを埋める。

提案手法

  • 微分可能物理シミュレータ内で勾配ベースの軌道最適化手法を用い、完全なシミュレータ状態を用いて短時間枠・単一スキルタスクのエキスパートデモ軌道を生成する。
  • デモ軌道を模倣するように、RGB-D画像からスキル埋め込みを出力するゴール条件付きポリシーとして、ニューラルスキル抽象化器を訓練する。
  • スキル埋め込みの潜在空間における中間的ゴールを計画することで、長時間枠タスクをスキルのシーケンスに分解する。
  • 2つの潜在状態間の遷移がスキルによって達成可能かどうかを評価する可能性予測子を用いて、中間的ゴールを最適化する。
  • 抽象化されたスキルの離散的計画を実行し、タスク完了に至るゴールのシーケンスを探索することで、階層的制御を実現する。
  • 学習段階では微分可能シミュレータを活用して多様で高品質なデモを生成しスキル学習を支援するが、推論段階では視覚的観測のみに依存する。

実験結果

リサーチクエスチョン

  • RQ1微分可能物理シミュレータを用いて、複雑で長時間枠の変形物体操作の再利用可能なスキルを自動で発見できるか?
  • RQ2微分可能物理によるスキル抽象化を、視覚的観測(RGB-D)とどのように統合することで、現実世界への一般化を向上させられるか?
  • RQ3抽象化されたスキルの上での計画が、エンドツーエンドの強化学習および直接的な軌道最適化よりも顕著に優れた性能を発揮できるか?
  • RQ4スキル習得に勾配ベース最適化を、潜在空間における計画を組み合わせることで、変形物体操作におけるサンプル効率性とタスク成功確率がどのように向上するか?
  • RQ5シミュレーションデータで学習されたニューラルスキル抽象化器が、未観測のシナリオや現実世界への展開において、どのような限界を示すか?

主な発見

  • DiffSkillは、変形生地を用いた工具操作において、3つの挑戦的な長時間枠の順序タスク(LiftSpread, GatherTransport, CutRearrange)を成功裏に解決した。
  • 評価されたすべてのタスクにおいて、モデルフリー強化学習ベースラインを上回り、優れたサンプル効率性と成功確率を示した。
  • DiffSkillは、長時間枠設定で局所最適解に陥るため失敗する単独の勾配ベースの軌道最適化器よりも高いタスク成功確率を達成した。
  • ニューラルスキル抽象化器はRGB-D観測から良好に一般化でき、完全なシミュレータ状態にアクセスできない状況でも計画が可能であることを示した。
  • 可能性予測子により、潜在空間におけるスキルダイナミクスを暗黙的にモデル化し、スキルシーケンスに対する効果的な離散的計画が可能になった。
  • 実験により、微分可能物理によるスキル生成と階層的計画の組み合わせが、複雑な変形材料のロバストかつスケーラブルな操作を可能にすることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。