Skip to main content
QUICK REVIEW

[論文レビュー] Tactile Pose Estimation and Policy Learning for Unknown Object Manipulation

Tarik Keleştemur, Robert Platt|arXiv (Cornell University)|Mar 21, 2022
Robot Manipulation and Learning被引用数 11
ひとこと要約

本論文は、物体の形状やサイズに関する事前知識がなくとも、未知の物体を操作するためのタクトイルベースのポーズ推定およびポリシー学習フレームワークを提案する。本手法は、離散ベイズフィルタ内に学習されたタクトイル観測モデルを組み込み、正確な2-mmの位置および1度の方向のポーズ推定を実現し、深層強化学習ポリシーがシミュレーションおよび現実世界のボトル開けタスクにおいて81%の成功率で新たな物体を効果的に操作可能にする。

ABSTRACT

Object pose estimation methods allow finding locations of objects in unstructured environments. This is a highly desired skill for autonomous robot manipulation as robots need to estimate the precise poses of the objects in order to manipulate them. In this paper, we investigate the problems of tactile pose estimation and manipulation for category-level objects. Our proposed method uses a Bayes filter with a learned tactile observation model and a deterministic motion model. Later, we train policies using deep reinforcement learning where the agents use the belief estimation from the Bayes filter. Our models are trained in simulation and transferred to the real world. We analyze the reliability and the performance of our framework through a series of simulated and real-world experiments and compare our method to the baseline work. Our results show that the learned tactile observation model can localize the pose of novel objects at 2-mm and 1-degree resolution for position and orientation, respectively. Furthermore, we experiment on a bottle opening task where the gripper needs to reach the desired grasp state.

研究の動機と目的

  • 物体の形状やサイズに関する事前知識がなくとも、タクトイルフィードバックのみを用いて未知の物体の正確なポーズ推定を可能にすること。
  • シミュレーションと現実世界の両方で新規物体に一般化可能な、頑健なタクトイル観測モデルの開発。
  • ベイズフィルタの信念状態を入力として使用して、非構造的環境におけるタスクパフォーマンスを向上させる操作ポリシーの学習。
  • タクトイルセンシングのみを用いて、新規物体に対して高精度(2 mm、1°)な操作を実現すること。
  • ドメインランダマイゼーションを最小限に抑えて、シミュレーションで学習したポリシーの現実世界への転送を可能にすること。

提案手法

  • 離散ベイズフィルタは、学習されたタクトイル観測モデルと決定的運動モデルを統合し、未知の物体に対するグリッパーのポーズを推定する。
  • タクトイル観測モデルは、グリッパーにビジュオタクトイルセンサを装備したシミュレーテッド環境で生成された合成タクトイル画像を用いて学習された深層ニューラルネットワークである。
  • シミュレーション内でのタクトイル画像の拡張には、実際のセンサの背景画像を用い、ガウスノイズを追加することで、シミュレーションから現実世界への転送性を向上させる。
  • ポリシーは、ベイズフィルタの信念状態を入力として使用した深層強化学習により訓練され、アクションはエンドエフェクタのインクリメンタルな移動として定義される。
  • システムはTACTOシミュレータを用い、ピクセル単位のタクトイル差分を生成し、実際のセンサ背景を用いて合成タクトイルデータをキャリブレーションする。
  • 実際のUR5ロボットでアクションを実行するために、オンラインで逆運動学を解き、信念からゴールへの誤差に基づいてエピソードを終了させる。

実験結果

リサーチクエスチョン

  • RQ1学習されたタクトイル観測モデルは、1cm未塔および1度未塔の精度で未知の物体のポーズを推定できるか?
  • RQ2シミュレーションデータで学習した信念ベースのポリシーは、現実世界の操作タスクにどの程度一般化できるか?
  • RQ3広範なドメインランダマイゼーションを用いずに、現実世界の操作タスクで高い成功率を達成できるか?
  • RQ4信念推定を用いる場合と再帰型ネットワークを用いる場合とを比較した場合、タクトイル操作のポリシー学習に与える影響は何か?
  • RQ5再トレーニングなしに、複数の異なるカテゴリに属する新規物体をフレームワークが処理できるか?

主な発見

  • 学習されたタクトイル観測モデルは、シミュレーション内での新規物体のポーズ推定において、2-mmの位置分解能および1度の方向分解能を達成した。
  • 現実世界のボトル開けタスクにおいて、モデルの事前知識なしに5種類の異なるボトルに対して81%の成功率を達成した。
  • 現実世界における平均エピソード長は7.09ステップであり、一部のボトルでは最大8.57ステップを要した。
  • 失敗事例の主な原因は、グリッパーが完全に閉じることに起因し、誤ったタクトイル観測と信念のずれを引き起こし、ポリシーがそれを回復できなかったことである。
  • ポリシー学習に再帰型ネットワークを用いたベースラインと比較して、本手法は信念状態入力を用いることの利点を示した。
  • 実際のセンサ背景画像を1枚のみ用いてタクトイル拡張を実施したことで、シミュレーションから現実世界への転送に成功した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。