Skip to main content
QUICK REVIEW

[論文レビュー] Pixel-wise Regression: 3D Hand Pose Estimation via Spatial-form Representation and Differentiable Decoder

Xingyuan Zhang, Fuhai Zhang|arXiv (Cornell University)|May 6, 2019
Human Pose and Action Recognition参考文献 27被引用数 4
ひとこと要約

本論文は、空間的形状表現(SFR)と微分可能デコーダーを組み合わせることで空間的構造を保持し、3次元関節座標に対する直接的監視を可能にする、3次元ハンドポーズ推定のための新しいピクセル単位の回帰フレームワークを提案する。3次元座標を平面成分と深度成分に分離し、それぞれ別々の平面回帰(PR)モジュールと深度回帰(DR)モジュールを用いることで、MSRAデータセット上で平均3次元誤差を25%削減し、最先端の性能を達成した。

ABSTRACT

3D Hand pose estimation from a single depth image is an essential topic in computer vision and human-computer interaction. Although the rising of deep learning method boosts the accuracy a lot, the problem is still hard to solve due to the complex structure of the human hand. Existing methods with deep learning either lose spatial information of hand structure or lack a direct supervision of joint coordinates. In this paper, we propose a novel Pixel-wise Regression method, which use spatial-form representation (SFR) and differentiable decoder (DD) to solve the two problems. To use our method, we build a model, in which we design a particular SFR and its correlative DD which divided the 3D joint coordinates into two parts, plane coordinates and depth coordinates and use two modules named Plane Regression (PR) and Depth Regression (DR) to deal with them respectively. We conduct an ablation experiment to show the method we proposed achieve better results than the former methods. We also make an exploration on how different training strategies influence the learned SFRs and results. The experiment on three public datasets demonstrates that our model is comparable with the existing state-of-the-art models and in one of them our model can reduce mean 3D joint error by 25%.

研究の動機と目的

  • 全結合層におけるフラットネーション処理によって生じる空間情報の損失を、回帰ベースの3次元ハンドポーズ推定において解消すること。
  • 非微分可能デコーダーに依存する検出ベース手法において、3次元関節座標に対する直接的監視が欠如している問題を克服すること。
  • 空間的構造を保持しつつ、3次元座標の直接監視が可能なエンドツーエンド学習を可能にする空間的形状表現(SFR)を設計すること。
  • 自己遮蔽や深度ノイズなどの困難な状況下でも、3次元ハンドポーズ推定の精度を向上させること。
  • 公的データセットを用いたアブレーションおよびベンチマーク評価を通じて、微分可能デコーディングとSFR設計の有効性を実証すること。

提案手法

  • 本手法は、3次元関節座標を2次元特徴マップに符号化することで、ハンド全体にわたる空間的構造を保持する空間的形状表現(SFR)を導入する。
  • SFRから直接3次元関節座標を再構築できる微分可能デコーダー(DD)を設計し、3次元監視によるエンドツーエンド学習を可能にする。
  • デコーダーは2つの並列モジュールに分解される:2次元(u,v)座標のための平面回帰(PR)と深度(z)値のための深度回帰(DR)。
  • SFRは完全畳み込みネットワーク(FCN)を用いて学習され、DDはネットワーク内に学習可能な層として実装され、パイプライン全体にバックプロパゲーションが可能になる。
  • 予測値と真値の3次元関節座標間のL2誤差を最小化する統合損失関数を用いてモデルを訓練する。
  • 従来の検出ベース手法が非微分可能デコーダーを用いるのに対し、本手法は空間的インダクティブバイアスを維持しつつ、3次元座標に対する直接的監視を可能にする。

実験結果

リサーチクエスチョン

  • RQ1微分可能デコーダーを用いることで、関節座標に対する直接的監視が可能になり、3次元ハンドポーズ推定の精度が向上するか?
  • RQ2空間的形状表現(SFR)を用いて空間的構造を保持することで、3次元ハンドポーズ推定における一般化性能が向上し、誤差が低減するか?
  • RQ3SFRの設計と微分可能デコーダーの相関関係が、自己遮蔽や深度ノイズを含む困難なデータセットにおける性能にどのように影響を与えるか?
  • RQ4トレーニング戦略の選択が、学習されたSFRの品質および最終的な3次元ポーズ精度にどの程度影響を与えるか?
  • RQ5提案されたピクセル単位の回帰フレームワークは、精度およびロバストネスの面で、回帰ベースおよび検出ベースの両手法を上回るか?

主な発見

  • MSRAデータセットでは、提案手法が平均3次元誤差5.186 mmを達成し、以前の最先端手法と比較して25%の誤差低減を達成した。
  • MSRAでは、平均誤差および閾値未満誤差のフレーム数の割合の両面で、すべてのベースラインを上回った。特に高精度領域において顕著な優位性を示した。
  • ICVLデータセットでは、平均3次元誤差6.177 mmを達成し、最高性能を示したモデル(V2V-PoseNet:6.284 mm)に非常に近い性能を示し、10 mm未満の誤差を示すフレーム数でも他を上回った。
  • HAND17データセットでは、平均誤差12.22 mmを達成し、ベースライン(19.71 mm)よりも顕著に優れていたが、トップパフォーマンスモデルよりわずかに劣った。
  • アブレーションスタディの結果、微分可能デコーダーによる直接的監視が極めて重要であり、SFRの設計が、特に遮蔽を受けた関節において性能に顕著な影響を与えることが確認された。
  • 定性的な結果から、モデルの一般化性能が高く、一部の予測は真値アノテーションを上回る結果を示しており、記憶にとどまらない強力な特徴学習が行われていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。