Skip to main content
QUICK REVIEW

[論文レビュー] 6D Object Pose Regression via Supervised Learning on Point Clouds

Ge Gao, Mikko Lauri|arXiv (Cornell University)|Jan 24, 2020
Robot Manipulation and Learning参考文献 32被引用数 10
ひとこと要約

本論文は、深度から得られる点群のみを用いた6次元オブジェクトポーズ推定のための教師あり深層学習手法を提案する。回転推定には軸角表現と測地的損失を用いた別個のネットワークを採用し、並進推定には回帰ネットワークを適用する。本手法はYCB-Videoデータセットにおいて最先端技術を上回る性能を示し、RGB-Dデータを用いる手法よりも、幾何的特徴を注意深く設計した点群特徴が優れていることを示している。

ABSTRACT

This paper addresses the task of estimating the 6 degrees of freedom pose of a known 3D object from depth information represented by a point cloud. Deep features learned by convolutional neural networks from color information have been the dominant features to be used for inferring object poses, while depth information receives much less attention. However, depth information contains rich geometric information of the object shape, which is important for inferring the object pose. We use depth information represented by point clouds as the input to both deep networks and geometry-based pose refinement and use separate networks for rotation and translation regression. We argue that the axis-angle representation is a suitable rotation representation for deep learning, and use a geodesic loss function for rotation regression. Ablation studies show that these design choices outperform alternatives such as the quaternion representation and L2 loss, or regressing translation and rotation with the same network. Our simple yet effective approach clearly outperforms state-of-the-art methods on the YCB-video dataset. The implementation and trained model are avaliable at: https://github.com/GeeeG/CloudPose.

研究の動機と目的

  • 点群として表現された幾何的深度情報のみを用いて6次元オブジェクトポーズ推定を実現し、色データに依存しないようにすること。
  • 並進と回転の回帰に別個の深層ネットワークを用いることで、共有アーキテクチャに比べて性能が向上するかどうかを調査すること。
  • 深層学習フレームワークにおける回転回帰のための軸角表現とクォータニオン表現の性能を比較すること。
  • 学習フレームワークにおける回転誤差の測定に、測地的距離とL2損失のどちらがより効果的かを比較すること。
  • 点群ベースの深層学習が、RGB-Dデータを用いる最先端手法に比べて、6次元ポーズ推定において優れた性能を達成できることを示すこと。

提案手法

  • 3次元オブジェクトの幾何形状を表す無順序点群入力を処理するため、PointNetにインspiredしたアーキテクチャを採用する。
  • 2つの別個の深層ニューラルネットワークを用いる:1つは軸角形式での3次元回転を予測し、もう1つは3次元並進を回帰する。
  • 回転回帰のための損失関数として、数学的に整合性のある最適化を保証するため、測地的距離を適用する。
  • 一貫した入力を得るために、表面構造を保持しつつ点群をダウンサンプリングするための最も遠い点サンプリングを適用する。
  • 予測された初期ポーズを用いて、反復的最密対応(ICP)のリファインメントを実行し、精度を向上させる。
  • クォータニオン出力を正規化し、比較のため軸角に変換することで、回転表現の評価を公平に保つ。
Figure 1: System overview. A point cloud is created using the depth data and the output from a semantic segmentation method. This segment is processed with farthest point sampling to obtain a down-sampled segment with consistent surface structure. The segment with object class information is fed int
Figure 1: System overview. A point cloud is created using the depth data and the output from a semantic segmentation method. This segment is processed with farthest point sampling to obtain a down-sampled segment with consistent surface structure. The segment with object class information is fed int

実験結果

リサーチクエスチョン

  • RQ1無順序点群として表現された深度情報のみを用いて、6次元オブジェクトポーズを正確に推定できるか?
  • RQ2共有アーキテクチャよりも、並進と回転の回帰に別個の深層ネットワークを用いる方が性能が良いか?
  • RQ3深層学習フレームワークにおいて、回転回帰の文脈で軸角表現がクォータニオン表現を上回るか?
  • RQ4回転誤差の測定に、測地的距離がL2損失よりも効果的か?
  • RQ5完全に幾何的特徴に基づく点群ベースの深層学習システムが、RGB-Dデータを用いる最先端手法を上回ることができるか?

主な発見

  • 回転と並進に別個のネットワークを用いた本手法は、YCB-VideoデータセットでAD 76.0、ADS 91.3を達成し、共有アーキテクチャのバリエーションを上回った。
  • 回転誤差が10°未満の精度は、軸角表現を用いた場合が41.3%であり、クォータニオンを用いた場合が37.1%であった。
  • 測地的損失は回転誤差が10°未満の精度で41.3%を達成し、L2損失(40.8%)をわずかに上回った。数学的根拠も強く、より妥当である。
  • 本システムは、色と深度の両方を用いる2つの最先端手法を、YCB-Videoベンチマークで上回った。
  • 1回の順伝播によるポーズ推定は0.11秒で完了し、Titan X GPU上で10回のICPリファインメントに0.3秒を要した。
  • アブレーションスタディの結果、回転と並進のネットワーク間で層を共有した場合でさえ、性能が低下することが確認された(容量を2倍にした場合でも)。
(a)
(a)

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。