Skip to main content
QUICK REVIEW

[論文レビュー] SeqHAND:RGB-Sequence-Based 3D Hand Pose and Shape Estimation

John Yang, Hyung Jin Chang|arXiv (Cornell University)|Jul 10, 2020
Human Pose and Action Recognition参考文献 50被引用数 4
ひとこと要約

本稿では、合成順序データセットと再帰的ConvLSTMベースのネットワークを活用して時間的運動ダイナミクスを活用する、RGBシーケンスに基づく3Dハンドポーズおよび形状推定フレームワークSeqHANDを提案する。静的アノテーションからポーズフローを生成し、合成から実世界へのドメイン適応中に視覚的時間的特徴を保持することで、フレームごとのベースラインと比較して滑らかでより自然なハンドモーション推定を達成する。

ABSTRACT

3D hand pose estimation based on RGB images has been studied for a long time. Most of the studies, however, have performed frame-by-frame estimation based on independent static images. In this paper, we attempt to not only consider the appearance of a hand but incorporate the temporal movement information of a hand in motion into the learning framework for better 3D hand pose estimation performance, which leads to the necessity of a large scale dataset with sequential RGB hand images. We propose a novel method that generates a synthetic dataset that mimics natural human hand movements by re-engineering annotations of an extant static hand pose dataset into pose-flows. With the generated dataset, we train a newly proposed recurrent framework, exploiting visuo-temporal features from sequential images of synthetic hands in motion and emphasizing temporal smoothness of estimations with a temporal consistency constraint. Our novel training strategy of detaching the recurrent layer of the framework during domain finetuning from synthetic to real allows preservation of the visuo-temporal features learned from sequential synthetic hand images. Hand poses that are sequentially estimated consequently produce natural and smooth hand movements which lead to more robust estimations. We show that utilizing temporal information for 3D hand pose estimation significantly enhances general pose estimations by outperforming state-of-the-art methods in experiments on hand pose estimation benchmarks.

研究の動機と目的

  • 3Dハンドポーズ推定のための、大規模かつ現実的であるRGB順序画像データセットの不足に取り組む。
  • 静的画像の外観を超えて時間的運動ダイナミクスを組み込むことで、3Dハンドポーズ推定を向上させる。
  • ドメイン適応中に視覚的時間的特徴を保持することで、合成から実世界へのドメインギャップを低減する。
  • 順序RGB入力を直接活用して、3Dポーズと形状の同時推定を実現する再帰的ディープラーニングフレームワークを開発する。
  • オクルージョンに対する耐性を高め、ハンドモーション推定における時間的整合性を向上させる。

提案手法

  • BigHand2.2Mデータセットの静的ハンドポーズアノテーションを再設計し、合成RGBハンド画像の時間的整合性を持つシーケンスに変換するポーズフロー生成手法を提案する。
  • 画像シーケンスにおける視覚的時間的依存関係をモデル化するため、ConvLSTM層を用いた再帰的エンコーダデコーダフレームワークを導入し、3Dハンドポーズおよび形状予測を実現する。
  • 連続するポーズ推定間の大きなジャンプをペナルティ化する時間的整合性損失を採用し、滑らかな運動軌道を強制する。
  • 微調整時に再帰層を分離することで、合成から実データへのドメイン適応中に学習済みの時間的特徴を保持する、新しいドメイン適応戦略を設計する。
  • マルチステージトレーニングパイプラインを採用:まず合成されたSeqHANDデータセットで事前学習し、その後、ConvLSTM層を固定したまま実データで微調整する。
  • 3Dハンドモデル(MANO)を活用して、画像特徴から3D関節位置と形状パラメータを回帰する。

実験結果

リサーチクエスチョン

  • RQ1フレームごとの手法と比較して、RGBシーケンスからの時間的運動情報が3Dハンドポーズ推定の正確性を顕著に向上させられるか?
  • RQ2現実的なポーズフローを有する合成データセットが、実世界のRGBシーケンスへの一般化を実現する深層学習モデルの学習に有効であるか?
  • RQ3合成から実世界へのドメイン適応中に視覚的時間的特徴を保持することで、エンドツーエンドの微調整よりも優れた性能が得られるか?
  • RQ4時間的モデリングにより、3Dハンドポーズ推定におけるオクルージョンおよび自己オクルージョンに対する耐性が向上するか?
  • RQ5合成シーケンスで学習した再帰ネットワークは、外観のみに依存するベースラインと比較して、より自然で滑らかなハンドモーション軌道を生成できるか?

主な発見

  • 提案手法は、STB、ED、DOベンチマークにおいてSOTA性能を達成し、EDデータセットでは3D-PCK@10が89.7%、DOデータセットでは85.3%を記録した。
  • 実ドメインへの微調整時にConvLSTM層を分離することで、視覚的時間的特徴を保持し、ベースラインの微調整と比較して3D-PCKで5.2%の絶対的向上を達成した。
  • SeqHAND-Netの形状パラメータ(β)の平均時間差は4.16×10⁻¹¹であり、フレームごとの推定と比較して2.38×10⁻⁵に比べて顕著に滑らかである。
  • SeqHAND-Netのポーズパラメータ(θ)の平均フレーム間差は1.88×10⁻⁶であり、フレームごとの手法と比較して6.90×10⁻⁶に比べて顕著に滑らかである。
  • オクルージョンに対して優れた耐性を示し、特に重度のオクルージョンを伴うDOデータセットにおいて、外部2Dポーズ推定器に依存する手法を上回った。
  • 定性的な結果から、SeqHAND-Netは自然で滑らかなハンドモーション軌道を生成する一方、フレームごとの手法は不自然なジャンプやフレーム間で一貫性のないポーズを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。