Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised 6D Object Pose Estimation for Robot Manipulation

Xinke Deng, Xiang Yu|arXiv (Cornell University)|Sep 23, 2019
Robot Manipulation and Learning参考文献 40被引用数 14
ひとこと要約

本論文は、アクティブビジョンとロボットの相互作用を活用して、正確で現実世界のポーズラベル付きデータを生成する自己教師付き6次元物体ポーズ推定システムを提案する。RGB-Dカメラのフィードバックとロボットによるシーン変化を活用することで、セグメンテーションとポーズ推定の精度が向上し、 grasping 成功率が 46.7% から 86.7% に向上、合成データのみでの学習と比較して初期化時間は 55.3% 減少した。

ABSTRACT

To teach robots skills, it is crucial to obtain data with supervision. Since annotating real world data is time-consuming and expensive, enabling robots to learn in a self-supervised way is important. In this work, we introduce a robot system for self-supervised 6D object pose estimation. Starting from modules trained in simulation, our system is able to label real world images with accurate 6D object poses for self-supervised learning. In addition, the robot interacts with objects in the environment to change the object configuration by grasping or pushing objects. In this way, our system is able to continuously collect data and improve its pose estimation modules. We show that the self-supervised learning improves object segmentation and 6D pose estimation performance, and consequently enables the system to grasp objects more reliably. A video showing the experiments can be found at https://youtu.be/W1Y0Mmh1Gd8.

研究の動機と目的

  • 6次元物体ポーズ推定における合成データと現実世界データのドメインギャップを解消すること。
  • グリッピングやプushingなどのロボットの相互作用を用いて、継続的で自己教師付きのデータ収集を可能にすること。
  • 自己アノテートされた現実世界データを活用して、6次元物体ポーズ推定とセマンティックセグメンテーションの精度を向上させること。
  • ファインチューニングされたポーズ推定ネットワークを用いて、モデルベースグリッピングのパフォーマンスを向上させること。
  • アクティブなデータ収集を繰り返し行うことで、ロボットシステムにおける生涯学習を実現すること。

提案手法

  • RGB-Dカメラをロボットアームに取り付け、作業領域内の物体のマルチビュー画像を取得する。
  • 前方運動学をモーションプライアとして用いたパーティクルフィルタを用いて6次元物体ポーズを初期化し、複数の視点間での正確なトラッキングを実現する。
  • 自己教師付きループを採用:ポーズトラッキング後、ロボットが物体をグリッピングまたはプッシュすることで新しいシーンと新しいデータを生成する。
  • 自己アノテートされた現実画像を用いて、事前学習済みのニューラルネットワークをファインチューニングし、セマンティックセグメンテーションと6次元ポーズ推定を実行する。
  • 初期推定後にSDFベースのポーズリファインメントを適用し、並進と回転の精度を向上させる。
  • RGB画像上でトレーニングされたオートエンコーダーを用いて、物体形状を再構築し、ポーズ予測を精緻化する。
Figure 1: Our self-supervised learning process for robot manipulation.
Figure 1: Our self-supervised learning process for robot manipulation.

実験結果

リサーチクエスチョン

  • RQ1ロボットが人間の監視なしに、現実世界の画像に対して正確な6次元ポーズアノテーションを自動生成できるか?
  • RQ2ロボットの相互作用によって収集された現実世界データを用いた自己教師付きファインチューニングは、6次元ポーズ推定とセグメンテーションのパフォーマンスをどのように向上させるか?
  • RQ3グリッピングやプッシュによるアクティブなシーン再構成は、データの多様性とモデルの一般化能力をどの程度向上させるか?
  • RQ4自己教師付き学習は、ごみくずの多い現実世界環境におけるグリップ成功確率を顕著に向上させられるか?
  • RQ5粒子フィルタにおけるRGBのみとRGB-Dデータの使用にどのような影響があるか?

主な発見

  • 自己アノテートされた現実画像を用いたセマンティックセグメンテーションネットワークのファインチューニングにより、特に光沢のある素材を有する物体においてもセグメンテーション精度が顕著に向上した。
  • オートエンコーダーの自己教師付きファインチューニングにより、再構築品質が向上し、その結果、6次元ポーズ推定の精度も向上した。
  • 実データを用いたファインチューニングにより、グリップ成功確率は合成データのみでの学習と比較して85.7ポイント向上し、86.7%に達した。
  • 平均的な物体初期化時間は、自己教師付きファインチューニング後、10.04秒から4.48秒に55.3%減少した。
  • ポーズ初期化の高速化と正確さのおかげで、グリップ試行1回あたりの総時間は21.27秒から15.47秒に27.3%短縮された。
  • 驚くべきことに、SDFリファインメントを施したRGBのみの粒子フィルタがRGB-Dバージョンを上回り、オートエンコーダーがRGBデータのみでトレーニングされたため、回転推定がより正確になった。
Figure 2: Overview of our self-supervised 6D object pose estimation system.
Figure 2: Overview of our self-supervised 6D object pose estimation system.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。