Skip to main content
QUICK REVIEW

[論文レビュー] JGR-P2O: Joint Graph Reasoning based Pixel-to-Offset Prediction Network for 3D Hand Pose Estimation from a Single Depth Image

Linpu Fang, Xingyan Liu|arXiv (Cornell University)|Jul 9, 2020
Human Pose and Action Recognition参考文献 50被引用数 5
ひとこと要約

本論文は、1枚の深度画像から3次元ハンドポーズ推定を行うための新しい2次元完全畳み込みネットワークJGR-P2Oを提案する。この手法は、関節間の依存関係をモデル化し、局所的特徴表現を強化するためのグラフ畳み込みネットワーク(GCN)ベースの関節グラフ推論モジュールを活用するとともに、ピクセルからオフセットを予測するアプローチにより、エンドツーエンドの関節回帰を実現している。本手法は、たった140万パラメータで最先端の精度を達成し、単一GPUで111.2fpsの高速な推論が可能である。

ABSTRACT

State-of-the-art single depth image-based 3D hand pose estimation methods are based on dense predictions, including voxel-to-voxel predictions, point-to-point regression, and pixel-wise estimations. Despite the good performance, those methods have a few issues in nature, such as the poor trade-off between accuracy and efficiency, and plain feature representation learning with local convolutions. In this paper, a novel pixel-wise prediction-based method is proposed to address the above issues. The key ideas are two-fold: a) explicitly modeling the dependencies among joints and the relations between the pixels and the joints for better local feature representation learning; b) unifying the dense pixel-wise offset predictions and direct joint regression for end-to-end training. Specifically, we first propose a graph convolutional network (GCN) based joint graph reasoning module to model the complex dependencies among joints and augment the representation capability of each pixel. Then we densely estimate all pixels' offsets to joints in both image plane and depth space and calculate the joints' positions by a weighted average over all pixels' predictions, totally discarding the complex postprocessing operations. The proposed model is implemented with an efficient 2D fully convolutional network (FCN) backbone and has only about 1.4M parameters. Extensive experiments on multiple 3D hand pose estimation benchmarks demonstrate that the proposed method achieves new state-of-the-art accuracy while running very efficiently with around a speed of 110fps on a single NVIDIA 1080Ti GPU.

研究の動機と目的

  • 密な予測に基づく従来の3次元ハンドポーズ推定手法における精度と効率のトレードオフを解消すること。
  • 関節間の依存関係を明示的にモデル化し、ピクセルと関節の関係を捉えることで、局所的特徴表現を向上させること。
  • エンドツーエンドの学習フレームワーク内で、密なピクセル単位のオフセット予測と直接的な関節回帰を統合することで、微分不能な後処理を排除すること。
  • 最小限のパラメータ数で、軽量な2次元完全畳み込みネットワークを用いて、高い効率性と精度を達成すること。

提案手法

  • 21個のハンド関節間の依存関係をモデル化するGCNベースの関節グラフ推論(JGR)モジュールを導入し、局所的特徴表現を強化する。
  • 各ピクセルから全関節への2次元画像平面および深度空間のオフセットを推定するピクセルからオフセット予測(P2O)モジュールを採用し、密で微分可能な回帰を実現する。
  • すべてのピクセルの予測を重み付き平均で統合することで、最終的な関節位置を推定し、複雑な後処理を回避する。
  • 推論速度を高めるために、たった140万パラメータの2次元完全畳み込みネットワーク(FCN)バックボーンを採用する。
  • 密なオフセット予測と直接的な関節回帰を1つのエンドツーエンド学習プロセスに統合することで、最適化を向上させ、量子化誤差を低減する。
  • 深度画像の2.5次元性を活用し、統合的なフレームワーク内で2次元座標と深度値を同時に回帰する。

実験結果

リサーチクエスチョン

  • RQ1関節間の依存関係をモデル化することで、3次元ハンドポーズ推定における局所的特徴表現が向上するか?
  • RQ2エンドツーエンドのピクセルからオフセット予測により、微分不能な後処理の必要性が排除され、精度が向上するか?
  • RQ3グラフ推論を組み込んだ軽量な2次元FCNは、高速性を維持しながら最先端の性能を達成できるか?
  • RQ4提案手法は、従来の密な予測および直接回帰ベースの手法と比較して、精度と効率の両面で優れているか?

主な発見

  • ICVLデータセットにおいて、JGR-P2Oは6.02mmの平均3次元誤差を達成し、すべての先行手法を上回る。
  • NYUデータセットでは、8.29mmの平均誤差を記録し、すべての最先端手法の中で最低水準であった。
  • 単一のNVIDIA 1080Ti GPUで111.2fpsの推論速度を達成し、従来の密な予測手法よりも顕著に高速であった。
  • わずか140万パラメータで、パラメータ効率性において最も優れた最先端手法であり、より大きなモデルよりも速度と精度の両面で優れている。
  • NYUデータセットにおいて、JGRモジュールはアテンションモジュールよりも平均3次元誤差を0.43mm低減させ、局所的特徴学習の有効性を示した。
  • P2Oモジュールは、微分可能なヒートマップベースラインと比較して0.4mmの誤差低減を達成し、オフセット推定における優位性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。