Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Disambiguate Strongly Interacting Hands via Probabilistic Per-pixel Part Segmentation

Zicong Fan, Adrian Spurr|arXiv (Cornell University)|Jul 1, 2021
Human Pose and Action Recognition被引用数 6
ひとこと要約

本論文は、単一のモノクローラル画像から相互作用する両手の3次元手関節姿勢推定のための新しいエンドツーエンドの深層学習手法DIGITを提案する。ピクセル単位のパーツセグメンテーション確率を同時に予測し、それらを視覚的特徴と融合させることで、自己類似性に起因する曖昧性を低減し、InterHand2.6Mデータセットにおいて最先端の性能を達成した。テストセットではMPJPEが16.55mmであった。

ABSTRACT

In natural conversation and interaction, our hands often overlap or are in contact with each other. Due to the homogeneous appearance of hands, this makes estimating the 3D pose of interacting hands from images difficult. In this paper we demonstrate that self-similarity, and the resulting ambiguities in assigning pixel observations to the respective hands and their parts, is a major cause of the final 3D pose error. Motivated by this insight, we propose DIGIT, a novel method for estimating the 3D poses of two interacting hands from a single monocular image. The method consists of two interwoven branches that process the input imagery into a per-pixel semantic part segmentation mask and a visual feature volume. In contrast to prior work, we do not decouple the segmentation from the pose estimation stage, but rather leverage the per-pixel probabilities directly in the downstream pose estimation task. To do so, the part probabilities are merged with the visual features and processed via fully-convolutional layers. We experimentally show that the proposed approach achieves new state-of-the-art performance on the InterHand2.6M dataset. We provide detailed ablation studies to demonstrate the efficacy of our method and to provide insights into how the modelling of pixel ownership affects 3D hand pose estimation.

研究の動機と目的

  • 自己類似性と被覆が高次元の曇りを引き起こす相互作用する両手の3次元手関節姿勢推定の課題に対処すること。
  • 外見が類似した2つの手の間でピクセル所有権が曖昧になることによるポーズ推定誤差を低減すること。
  • パーツセグメンテーションを確率的かつエンドツーエンド微分可能なコンponentとして明示的にモデル化し、視覚的特徴と統合することで性能を向上させること。
  • 離散ラベルではなく、ピクセル単位のセグメンテーション確率を活用することで、ポーズ推定の精度が向上することを示すこと。

提案手法

  • 入力画像をピクセル単位の意味的パーツセグメンテーションマスクと視覚的特徴ボリュームに処理する、二重ブランチで相互に絡み合ったネットワークアーキテクチャを採用する。
  • セグメンテーションブランチは、各ピクセルごとに正規化されていないロジット(完全な確率分布)を出力し、後続タスクに不確実性を保持する。
  • これらのピクセル単位のセグメンテーション確率は、視覚的特徴と連結され、全畳み込み層を経て統合特徴表現が生成される。
  • 3次元ポーズ推定(MPJPE)とパーツセグメンテーション(交差エントロピー)を組み合わせたマルチタスク損失を用いてエンドツーエンドで学習され、同時に最適化が可能となる。
  • 関節位置の予測を正則化し、幾何学的整合性を向上させるためにボーン長さ損失を組み込む。
  • 従来の手法がセグメンテーションとポーズ推定を分離しているのに対し、DIGITはセグメンテーション確率をポーズ推定ストリームに直接統合し、不確実性を考慮した特徴統合を可能にしている。

実験結果

リサーチクエスチョン

  • RQ1ピクセル単位のパーツセグメンテーション確率をモデル化することで、相互作用する手の3次元手関節姿勢推定はどの程度向上するか?
  • RQ2ロジットを用いたセグメンテーション不確実性の統合が、離散的セグメンテーションラベルを用いる場合に比べて、ポーズ推定でどの程度優れているか?
  • RQ3セグメンテーションとポーズ推定をエンドツーエンドで同時に学習することで、分離学習よりも性能が向上するか?
  • RQ4本手法は、外見が類似した手における自己類似性に起因する曇りをどのように低減するか?
  • RQ5セグメンテーションの監視は、相対的ハンド位置推定(MRRPE)にどの程度寄与するか?

主な発見

  • DIGITは、InterHand2.6MデータセットのテストセットでMPJPEが16.55mmに達し、新たな最先端性能を達成した。
  • アブレーションスタディの結果、骨損失を備えたベースラインと比較して、検証セットでMPJPEが1.38mm、テストセットで0.99mm低減された。
  • セグメンテーション損失(SL)単体でも、テストセットでMRRPEが5.97mm改善され、曇りが低減したことによる相対的ハンド位置推定の向上が示された。
  • 離散的クラスラベルではなくロジットを用いることで顕著な性能向上が得られ、不確実性を保持することが重要であることが示された。
  • 骨損失を備えたベースラインと比較して、MRRPEが5.97mm改善され、相対的ハンド位置の推定が向上した。
  • アブレーションにより、性能向上は追加のパラメータによるものではなく、セグメンテーション確率の統合によるものであることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。