Skip to main content
QUICK REVIEW

[論文レビュー] 3D Hand Pose Estimation using Simulation and Partial-Supervision with a Shared Latent Space

Masoud Abdi, Ehsan Abbasnejad|arXiv (Cornell University)|Jul 14, 2018
Human Pose and Action Recognition参考文献 30被引用数 8
ひとこと要約

本稿では、VAE-GANハイブリッドとサイクル整合性制約を用いて、合成深度画像、実際の深度画像、3Dハンドポーズの間で共有される潜在空間を学習する、新しい3Dハンドポーズ推定手法LSPSを提案する。合成データと部分的にラベル付けされた実データを活用することで、NYUでは15.83mm(完全教師あり学習に近い)、ICVLでは14.09mmという最先端の性能を達成し、困難なベンチマークにおいて、従来手法比最大35%の精度向上を実現した。

ABSTRACT

Tremendous amounts of expensive annotated data are a vital ingredient for state-of-the-art 3d hand pose estimation. Therefore, synthetic data has been popularized as annotations are automatically available. However, models trained only with synthetic samples do not generalize to real data, mainly due to the gap between the distribution of synthetic and real data. In this paper, we propose a novel method that seeks to predict the 3d position of the hand using both synthetic and partially-labeled real data. Accordingly, we form a shared latent space between three modalities: synthetic depth image, real depth image, and pose. We demonstrate that by carefully learning the shared latent space, we can find a regression model that is able to generalize to real data. As such, we show that our method produces accurate predictions in both semi-supervised and unsupervised settings. Additionally, the proposed model is capable of generating novel, meaningful, and consistent samples from all of the three domains. We evaluate our method qualitatively and quantitively on two highly competitive benchmarks (i.e., NYU and ICVL) and demonstrate its superiority over the state-of-the-art methods. The source code will be made available at https://github.com/masabdi/LSPS.

研究の動機と目的

  • 実際の3Dハンドポーズデータのアノテーションにかかる高コストを軽減するため、合成データと限定的な実データのラベルを組み合わせること。
  • 通常は一般化を妨げる、合成データと実データの間のドメインギャップを埋める。
  • 合成深度、実深度、3Dハンドポーズの3つのモダリティ間で共有される潜在表現を学習する統合的生成モデルを開発すること。
  • 共有潜在空間を用いて、すべての3つのドメイン間で一貫性があり意味のあるサンプルをゼロショット生成できること。
  • 実世界のベンチマークにおいて、半教師ありおよび教師なし設定での優れた一般化性と頑健性を示すこと。

提案手法

  • 本手法は、実際の深度画像ドメインと合成深度画像ドメインをそれぞれモデル化する2つのVAE-GANハイブリッドを用い、ペアデータが存在しない状態で、分離可能かつ共有される表現を学習する。
  • 3Dハンドポーズドメインは別個のVAEでモデル化され、重み共有とサイクル整合性制約を通じて、すべての3つのモダリティ間で共有潜在空間が強制される。
  • 潜在空間の整合性を図るために、事後分布推定関数(P)とマッピング関数(M)を用い、深度画像の潜在空間と3Dポーズの潜在空間を対応付ける。これにより、ドメイン間変換が可能になる。
  • ペアのない実深度画像と合成深度画像は、サイクル整合性損失により整合化され、共有潜在空間経由での符号化・復元が構造的一致性を保つ。
  • フレームワークは、合成データとラベルなし実データのみを用いた教師なし学習、および少数のラベル付き実データを用いた半教師ありファインチューニングの両方をサポートする。
  • 生成的サンプリングは、共有潜在空間における事前ノイズ(例:𝒩(0, I))からのデコードによって可能となり、すべての3つのドメインで現実的で一貫性のあるサンプルが生成される。

実験結果

リサーチクエスチョン

  • RQ1合成深度画像、実深度画像、3Dハンドポーズの間で共有される潜在空間が、合成データから実データへの一般化を向上させ得るか?
  • RQ2わずかにラベル付き実データが存在する半教師あり設定において、本手法はどの程度効果的か?
  • RQ3共有潜在空間が、すべての3つのモダリティ間で一貫性があり意味のあるサンプルをどの程度生成できるか?
  • RQ4本手法は、NYU や ICVL といった標準ベンチマークで、既存の最先端手法を上回る性能を示すか?
  • RQ5本手法は、合成データと実データの分布の間の大きなドメインギャップをどのように処理するか?

主な発見

  • NYUデータセットでは、提案手法が平均3D誤差15.83mmを達成し、実データに対する完全教師あり学習の性能に非常に近い。
  • ICVLデータセットでは、誤差が14.09mmにまで低下し、合成データのみで学習した場合の23.91mmと比べて顕著に優れている。
  • 最先端のベースラインと比較して、NYUでは40mm以内の誤差を示すフレーム数が19%絶対的に向上し、ICVLでは35%向上した。
  • 実データの10%しかラベルが付いていない状況でも、教師ありベースラインに対して17%の相対的向上、crossingNetの半教師あり手法に対して10%の向上を示した。
  • 本手法は、すべての3つのドメインにおいて高品質で一貫性のあるサンプルを生成でき、事前ノイズからの生成によっても、滑らかで意味のある潜在空間であることが示された。
  • 定性的な結果から、合成データと実データの両方を用いることで、特に合成データのみで失敗する領域において、予測の正確性が著しく向上していることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。