Skip to main content
QUICK REVIEW

[論文レビュー] Transferable Force-Torque Dynamics Model for Peg-in-hole Task

Junfeng Ding, Chen Wang|arXiv (Cornell University)|Nov 30, 2019
Iterative Learning Control Systems参考文献 35被引用数 15
ひとこと要約

本稿では、マルチポーズの力・トルク状態表現とオフラインデータ生成を用いて、移行可能な力・トルクダイナミクスモデルを提案し、サンプル効率の高い学習と未観測のピンと穴の幾何形状への迅速な適応を可能にした。モデル予測制御およびモデルベース強化学習を用いることで、微調整に必要なトレーニングデータの2%のみで80%以上の挿入成功率を達成し、優れた一般化性能とサンプル効率を示した。

ABSTRACT

We present a learning-based force-torque dynamics to achieve model-based control for contact-rich peg-in-hole task using force-only inputs. Learning the force-torque dynamics is challenging because of the ambiguity of the low-dimensional 6-d force signal and the requirement of excessive training data. To tackle these problems, we propose a multi-pose force-torque state representation, based on which a dynamics model is learned with the data generated in a sample-efficient offline fashion. In addition, by training the dynamics model with peg-and-holes of various shapes, scales, and elasticities, the model could quickly transfer to new peg-and-holes after a small number of trials. Extensive experiments show that our dynamics model could adapt to unseen peg-and-holes with 70% fewer samples required compared to learning from scratch. Along with the learned dynamics, model predictive control and model-based reinforcement learning policies achieve over 80% insertion success rate. Our video is available at https://youtu.be/ZAqldpVZgm4.

研究の動機と目的

  • 限られた実世界データにおける接触が豊富な力・トルクダイナミクスの学習という課題に対処すること。
  • 局所化に不確かさをもたらす単一の6次元力・トルク信号の曖昧さを解消すること。
  • 形状、スケール、弾性率が異なる未確認のピン・穴構成に、迅速にダイナミクスモデルを適応させること。
  • 高価なオンライン実ロボットデータ収集に依存しない、サンプル効率の高いトレーニングパイプラインの開発。
  • 学習されたダイナミクスをモデルベース制御ポリシーに統合し、高精度な挿入を実現すること。

提案手法

  • 接触位置ごとにエンドエフェクタの複数のポーズから力・トルクフィードバックを収集することで、接触位置の曖昧さを解消するマルチポーズ力・トルク状態表現を導入。
  • 少量のグリッドサンプリングされた力・トルク測定値から多数の軌道を合成する、新しいオフラインデータ生成手法を提案し、効率的な教師あり学習を可能に。
  • 形状、スケール、弾性率が異なる多数のピンと穴のデータセットを用いて、モデルの移行可能性を確保するためのトレーニング。
  • 新しい未確認のピン・穴ペアに適応させるために、わずかな実世界サンプル(例:全データの2%)での微調整を実施。
  • 学習されたダイナミクスを用いて、モデル予測制御(MPC)およびモデルベース強化学習(RL)を適用し、挿入をガイド。
  • ビジョンやプロピrioceptionに依存せず、エンドエフェクタの力・トルクフィードバックのみを活用。

実験結果

リサーチクエスチョン

  • RQ1力のみの入力で、ピンインホールタスクにおける状態遷移を正確に予測できる力・トルクダイナミクスモデルを学習できるか?
  • RQ26次元力・トルク信号の曇りをどのように解消し、挿入中に信頼性の高い接触位置の局所化を実現できるか?
  • RQ3多様なピン・穴構成でトレーニングされたダイナミクスモデルが、最小限の微調整で未確認の幾何形状にどの程度一般化できるか?
  • RQ4オフラインデータ生成は、力・トルクダイナミクスの学習におけるオンライン実ロボットデータ収集の必要性を著しく低減できるか?
  • RQ5学習されたダイナミクスモデルは、成功確率とサンプル効率の観点から、制御ポリシーのパフォーマンスを向上させられるか?

主な発見

  • モデル予測制御またはモデルベース強化学習と組み合わせたダイナミクスモデルは、80%以上の挿入成功率を達成した。
  • 事前学習済みのダイナミクスモデルを全データの2%(1ホールあたり1.6サンプル)で微調整した結果、予測誤差が0.1 N·m未満に抑えられ、高い精度を示した。
  • 全データから学習を開始する場合と比較して、必要なサンプル数を70%削減でき、優れたサンプル効率を示した。
  • 全データの20%のデータで微調整したダイナミクスモデルは、全データ100%で学習したモデルよりも優れた性能を達成した。
  • 微調整済みのダイナミクスモデルを用いたモデルベース強化学習では、16個の実世界サンプルで90%以上の成功率を達成したのに対し、オンラインポリシー学習には12,000個のサンプルが必要だった。
  • 硬い円形穴(直径15 mm)を含む未確認のピン・穴構成に対しても、最小限の微調整でモデルが正常に移行した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。