Skip to main content
QUICK REVIEW

[論文レビュー] Point-to-Pose Voting based Hand Pose Estimation using Residual Permutation Equivariant Layer

Shile Li, Dongheui Lee|arXiv (Cornell University)|Dec 5, 2018
Human Pose and Action Recognition参考文献 35被引用数 4
ひとこと要約

本論文は、順序なし3次元点群に対して、KNN や法線推定などの前処理を不要とする、残留置換等長層(ResidualPEL)を用いた新規なポイントからポーズへの投票による手のポーズ推定手法を提案する。この手法は、Hands2017チャレンジデータセットで平均関節誤差9.82 mmを達成し、最先端の性能を発揮するとともに、学習された重要度重みを用いた自己教師付き手部分類を可能にする。

ABSTRACT

Recently, 3D input data based hand pose estimation methods have shown state-of-the-art performance, because 3D data capture more spatial information than the depth image. Whereas 3D voxel-based methods need a large amount of memory, PointNet based methods need tedious preprocessing steps such as K-nearest neighbour search for each point. In this paper, we present a novel deep learning hand pose estimation method for an unordered point cloud. Our method takes 1024 3D points as input and does not require additional information. We use Permutation Equivariant Layer (PEL) as the basic element, where a residual network version of PEL is proposed for the hand pose estimation task. Furthermore, we propose a voting based scheme to merge information from individual points to the final pose output. In addition to the pose estimation task, the voting-based scheme can also provide point cloud segmentation result without ground-truth for segmentation. We evaluate our method on both NYU dataset and the Hands2017Challenge dataset. Our method outperforms recent state-of-the-art methods, where our pose accuracy is currently the best for the Hands2017Challenge dataset.

研究の動機と目的

  • ポイントの順序に不変で、KNN や表面法線推定などの前処理を必要としない3次元手のポーズ推定のための深層学習手法の開発。
  • マックスプールングに依存し、局所的な空間的情報を失うPointNetベースの手法の制限を克服すること。
  • セグメンテーションの真値が不要な3次元点群から、手のポーズとセグメンテーションをエンドツーエンドで学習可能にすること。
  • 最小限のメモリと計算リソースで、高い精度と効率性を実現する手のポーズ推定を達成すること。

提案手法

  • ポイントの順序変換に対して等長である特徴学習が可能で、局所的な空間的構造を保持する、コアとなる構成要素として残留置換等長層(ResidualPEL)を採用。
  • 各ポイントからの局所的予測を統合してグローバルな手のポーズを生成するポイントからポーズへの投票方式を導入し、PointNetで用いられるマックスプールング層に代わる。
  • 投票機構から得られる重要度重みを活用し、セグメンテーションのアノテーションが一切不要な自己教師付きの手部分類を実現。
  • ボクセル化を回避し、完全な空間分解能を維持するため、1024個の入力3次元ポイントを直接処理。
  • PELブロック内に残留ネットワーク構造を採用することで、学習の深さと特徴表現の質を向上。
  • 3次元点群の座標と真値の関節位置のみを用いて、エンドツーエンドでモデルを学習。

実験結果

リサーチクエスチョン

  • RQ1置換等長の深層学習アーキテクチャは、PointNetベースの手法と比較して3次元手のポーズ推定精度を向上させることができるか?
  • RQ2投票ベースの統合機構は、ポイントクラウドベースの手のポーズ推定において、マックスプールングを上回るグローバル特徴統合性能を発揮するか?
  • RQ3投票機構から得られる重要度重みを用いることで、セグメンテーションラベルの真値がなくても高品質な自己教師付き手部分類が可能になるか?
  • RQ4提案手法は、従来の3次元ベースの手のポーズ推定手法と比較して、より低いメモリ使用量と推論コストで最先端の性能を達成できるか?

主な発見

  • 本手法は、提出時までに報告された中で最も低い値となる、Hands2017チャレンジデータセットにおける平均関節誤差9.82 mmを達成。
  • 未知の被験者に対しては平均関節誤差12.04 mmを達成し、明示的な正則化なしでも優れた一般化能力を示す。
  • NYUデータセットでは1視点で2番目の性能を達成し、3視点で最近の最先端手法をすべて上回る。
  • モデルサイズはたったの38–44 MBであり、3次元CNNベースの手法(例:420 MB)と比較して顕著に小さく、効率的なデプロイが可能。
  • 1台の中程度のGPUで1フレームあたり10.7–12.5 msで推論が実行され、より弱いハードウェアを使用しているにもかかわらず、他の最先端手法を上回る推論速度を達成。
  • 重要度重みを用いた自己教師付きセグメンテーションは、自己遮蔽の状況下でも、指や手部の明確で意味のあるセグメンテーションを生成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。