Skip to main content
QUICK REVIEW

[論文レビュー] Measuring Generalisation to Unseen Viewpoints, Articulations, Shapes and Objects for 3D Hand Pose Estimation under Hand-Object Interaction

Anil Armagan, Guillermo Garcia-Hernando|arXiv (Cornell University)|Mar 30, 2020
Human Pose and Action Recognition参考文献 50被引用数 6
ひとこと要約

本論文は、HANDS'19チャレンジを用いて、手と物体の相互作用下での未学習の視点、関節可動域、形状、物体に対する3次元手のポーズ推定における一般化性能を評価する。アンサンブル手法、合成データ、パラメトリックな手モデル(MANO)を用いた後処理が顕著な性能向上をもたらし、未学習のポーズにおける平均関節誤差を27mmから13mmに低減することを示している。

ABSTRACT

We study how well different types of approaches generalise in the task of 3D hand pose estimation under single hand scenarios and hand-object interaction. We show that the accuracy of state-of-the-art methods can drop, and that they fail mostly on poses absent from the training set. Unfortunately, since the space of hand poses is highly dimensional, it is inherently not feasible to cover the whole space densely, despite recent efforts in collecting large-scale training datasets. This sampling problem is even more severe when hands are interacting with objects and/or inputs are RGB rather than depth images, as RGB images also vary with lighting conditions and colors. To address these issues, we designed a public challenge (HANDS'19) to evaluate the abilities of current 3D hand pose estimators (HPEs) to interpolate and extrapolate the poses of a training set. More exactly, HANDS'19 is designed (a) to evaluate the influence of both depth and color modalities on 3D hand pose estimation, under the presence or absence of objects; (b) to assess the generalisation abilities w.r.t. four main axes: shapes, articulations, viewpoints, and objects; (c) to explore the use of a synthetic hand model to fill the gaps of current datasets. Through the challenge, the overall accuracy has dramatically improved over the baseline, especially on extrapolation tasks, from 27mm to 13mm mean joint error. Our analyses highlight the impacts of: Data pre-processing, ensemble approaches, the use of a parametric 3D hand model (MANO), and different HPE methods/backbones.

研究の動機と目的

  • 手と物体の相互作用下で、未学習の視点、関節可動域、形状、物体に対する3次元手のポーズ推定器(HPE)の一般化性能を評価すること。
  • 特にエゴセントリックおよび遮蔽状況下において、深度とRGBモダリティがHPEの一般化性能に与える影響を評価すること。
  • 合成データおよびパラメトリックな手モデル(MANO)が、学習データを超えた外挿性能を向上させる役割を調査すること。
  • 最先端のHPE手法をベンチマーク化し、アンサンブル化や後処理といった一般化を高める要因を同定すること。
  • 視点、関節可動域、形状、物体の4つの主要な軸に沿って、一般化を分離・測定できる構造的なチャレンジフレームワークを確立すること。

提案手法

  • 深度ベースのHPE(物体なし)、深度ベースのHPE(物体相互作用あり)、RGBベースのHPE(物体相互作用あり)の3つのタスクを含む公開チャレンジ(HANDS'19)を設計した。
  • 一般化性能を分離できるように、視点、手の形状、関節可動域、物体相互作用に制御された変化を加えたトレーニングセットおよびテストセットを構築した。
  • 参加者にパラメトリック3次元手モデル(MANO)を提供し、トレーニングデータの合成および未学習のポーズへの一般化の向上を可能にした。
  • 合成データ、アンサンブル手法、およびNTIS(非線形変換に基づく推論戦略)や特異値分解(Truncated SVDs)、時間的平滑化を含む後処理技術の使用を可能にした。
  • ResNetベースのバックボーンと2次元/3次元キーポイント回帰器を用い、2次元および3次元HPE間でのメソドロジー的アンサンブルと後処理による最適化を実施した。
  • 遮蔽や視認性が低い状況下でもキーポイント局在の確率マップ品質を向上させるために、学習可能な適応的重み付け回帰(AWR)を適用した。

実験結果

リサーチクエスチョン

  • RQ1最先端の3次元手のポーズ推定器は、特にエゴセントリックまたは遮蔽状況下において、未学習の視点や関節可動域にどの程度一般化できるか?
  • RQ2合成データおよびパラメトリックな手モデル(MANO)の使用が、学習分布を超えた外挿性能をどの程度向上させるか?
  • RQ3アンサンブル手法やNTIS、AWRのような後処理手法が、未学習のポーズにおける一般化性能に与える影響はいかほどか?
  • RQ4特に手と物体の相互作用下において、RGBモダリティと深度モダリティのHPE一般化性能に及ぼす相対的影響は何か?
  • RQ5異なるHPEバックボーンおよびアーキテクチャは、複雑な現実世界のシナリオにおける補間と外挿の両タスクで、どのように性能を発揮するか?

主な発見

  • 外挿タスクにおける平均関節誤差(MJE)は、ベースラインの27mmから優勝手法の13mmに顕著に改善され、一般化性能の大幅な向上が示された。
  • アンサンブル手法、特に後処理における適用が、外挿タスクでMJEを最大15%まで低減した。最良の単一モデル(ResNet-152)ではMJEが14.74mmを達成した。
  • 特異値分解(Truncated SVDs)を用いたNTIS後処理と重み付けアンサンブルが、タスク1でMJEを1.1%低減し、精錬技術の価値を示した。
  • シーケンスベースのタスク2における時間的平滑化は、外挿誤差をわずかに低減したが、より大きなコンテキストサイズはほとんど効果がなく、限界効果が見られた。
  • AWRに基づく適応的重み付けは、NYUで0.49mm、HANDS’17で0.50mmのMJE低減を達成し、曇りや遮蔽のある関節の処理において有効であることが示された。
  • 合成データを活用した手法はわずかにしか存在せず、優勝手法ですら合成画像を57万枚程度しか使用していなかった。これは、一般化性能向上に向けた合成データの潜在的価値がまだ十分に活用されていないことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。