Skip to main content
QUICK REVIEW

[論文レビュー] Estimating Mass Distribution of Articulated Objects using Non-prehensile Manipulation

K. Niranjan Kumar, Irfan Essa|arXiv (Cornell University)|Jul 9, 2019
Robot Manipulation and Learning参考文献 42被引用数 13
ひとこと要約

本論文では、非把持的プッシュを用いて、2次元チェーンのようなアーチレートドオブジェクトの質量分布を推定できる強化学習および教師あり学習フレームワークを提案する。シミュレーションで戦略的相互作用ポリシーと質量分布予測器を学習することで、実世界の2リンクチェーンにおいて81.4%の分類精度を達成し、ランダムなプッシュ(40.74%)を著しく上回った。

ABSTRACT

We explore the problem of estimating the mass distribution of an articulated object by an interactive robotic agent. Our method predicts the mass distribution of an object by using the limited sensing and actuating capabilities of a robotic agent that is interacting with the object. We are inspired by the role of exploratory play in human infants. We take the combined approach of supervised and reinforcement learning to train an agent that learns to strategically interact with the object to estimate the object's mass distribution. Our method consists of two neural networks: (i) the policy network which decides how to interact with the object, and (ii) the predictor network that estimates the mass distribution given a history of observations and interactions. Using our method, we train a robotic arm to estimate the mass distribution of an object with moving parts (e.g. an articulated rigid body system) by pushing it on a surface with unknown friction properties. We also demonstrate how our training from simulations can be transferred to real hardware using a small amount of real-world data for fine-tuning. We use a UR10 robot to interact with 3D printed articulated chains with varying mass distributions and show that our method significantly outperforms the baseline system that uses random pushes to interact with the object.

研究の動機と目的

  • 把持せずに物理的相互作用を通じてアーチレートドオブジェクトの質量分布を推定できるロボットエージェントを実現すること。
  • 質量分布に関する情報量を最大化するように、有益なプッシュを選択するポリシーを開発すること。
  • 相互作用の軌道から質量分布を推定するための予測ネットワークを、シミュレーテッドデータを用いて訓練すること。
  • 最小限の実世界でのファインチューニングで、シミュレーションから実世界のデプロイメントに移行できるようにすること。
  • 戦略的相互作用が、ランダムなプッシュに比べて、アーチレートドシステムの物理的性質の推定において顕著に優れていることを示すこと。

提案手法

  • 本手法は二重のニューラルネットワークアーキテクチャを用いる:プッシュ行動を選択するポリシーネットワークと、質量分布を推定する予測ネットワーク。
  • ポリシーネットワークは、各プッシュからの情報量を最大化するように強化学習で訓練される。
  • 予測ネットワークは、既知の質量分布を伴うシミュレーテッドな状態-行動軌道を用いて教師あり学習で訓練される。
  • システムは、予測ネットワークの訓練とポリシーの最適化を繰り返すメタ最適化ループで交互に実行する。
  • シミュレーションは、2次元および3次元のアーチレートドチェーンを用い、質量分布や摩擦係数を変化させて実施される。
  • 実世界への移行は、UR10ロボットを用いて150件の実世界の相互作用エピソードでファインチューニングすることで達成される。

実験結果

リサーチクエスチョン

  • RQ1ロボットは、把持を除く非把持的プッシュのみを用いて、アーチレートドオブジェクトの質量分布を学習的に推定できるか?
  • RQ2学習された相互作用ポリシーは、ランダムなプッシュに比べて、質量推定の精度を顕著に向上させるか?
  • RQ3最小限の実世界データで、シミュレーションで訓練されたモデルを実世界のロボットハードウェアにどれほど効果的に移行できるか?
  • RQ4プッシュの位置と力の選択が、個々のリンク質量を推定する能力にどのように影響するか?
  • RQ5同様の幾何学的形状を持つ異なるアーチレートドオブジェクトタイプに、本システムは一般化可能か?

主な発見

  • 提案手法は、実世界の2リンクチェーンにおいて81.4%の分類精度を達成し、ランダムポリシーのベースライン(40.74%)を著しく上回った。
  • 学習されたポリシーは、一貫して関節運動を誘発するプッシュを選択し、個々のリンク質量の分離をより効果的に行えるようにした。
  • わずか150件の実世界エピソードでのファインチューニングで、シミュレーションから実ハードウェアへの成功した移行が達成された。
  • 多様な質量分布と摩擦係数を伴うシミュレーテッドデータで訓練された予測ネットワークは、未観測の構成に対しても一般化した。
  • 本手法は、すべてのプッシュが等しく情報量が多いわけではないことを示した。戦略的行動は、著しく優れた推論性能をもたらした。
  • ポリシーは、大きな制御不能な運動や関節のロックを引き起こすようなプッシュを回避するように学習し、推定精度の低下を防いだ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。