Skip to main content
QUICK REVIEW

[論文レビュー] Disentangling Latent Hands for Image Synthesis and Pose Estimation

Linlin Yang, Angela Yao|arXiv (Cornell University)|Dec 3, 2018
Human Pose and Action Recognition参考文献 40被引用数 13
ひとこと要約

本論文は、RGBハンド画像の合成および3次元ポーズ推定のための共有潜在空間において、手のポーズ、視点、背景コンテンツといった独立で解釈可能な変動要因を学習する、分離型変分オートエンコーダー(dVAE)を提案する。このモデルは、これらの要因を明示的に制御可能であり、弱教師ありまたは半教師あり学習を用いて、3次元ハンドポーズ推定で最先端の精度を達成するとともに、リアルな制御可能なハンド画像を生成する。

ABSTRACT

Hand image synthesis and pose estimation from RGB images are both highly challenging tasks due to the large discrepancy between factors of variation ranging from image background content to camera viewpoint. To better analyze these factors of variation, we propose the use of disentangled representations and a disentangled variational autoencoder (dVAE) that allows for specific sampling and inference of these factors. The derived objective from the variational lower bound as well as the proposed training strategy are highly flexible, allowing us to handle cross-modal encoders and decoders as well as semi-supervised learning scenarios. Experiments show that our dVAE can synthesize highly realistic images of the hand specifiable by both pose and image background content and also estimate 3D hand poses from RGB images with accuracy competitive with state-of-the-art on two public benchmarks.

研究の動機と目的

  • ポーズ、視点、背景などの要因によるRGBハンド画像の高い可変性が、正確な合成やポーズ推定を困難にしているという課題に対処すること。
  • ハンド画像生成における個々の変動要因を明示的に制御できる、分離型表現学習フレームワークの開発。
  • 限定的な3次元アノテーションを用いた弱教師ありまたは半教師あり学習により、1枚のRGB画像から正確な3次元ハンドポーズ推定を実現すること。
  • 分離型で解釈可能な潜在変数を有する1つの生成モデル内で、画像合成、ポーズ転送、3次元ポーズ推定を統合すること。
  • 複数の学習制度をサポートする柔軟な変分推論フレームワークにおいて、クロスモーダルエンコーダーおよびデコーダーの使用を検討すること。

提案手法

  • 本手法は、ポーズ、視点、背景コンテンツ、画像コンテンツに対応する独立した部分空間を有する、分離型変分オートエンコーダー(dVAE)を採用する。
  • 複数の潜在空間を1つの分離型表現に統合する訓練戦略を用いた変分下界目的関数を採用し、共同推論とサンプリングを可能にする。
  • RGB画像、3次元ポーズ、視点ラベルからの共同学習を可能にするために、クロスモーダルエンコーダーおよびデコーダーを導入する。
  • 独立ラベルと混同ラベルの2つの学習バージョンを導入し、監視設定の柔軟性を向上させる。
  • 分離型潜在空間により、条件付きサンプリングが可能である:ユーザーはポーズと背景コンテンツを独立して指定して、リアルなハンド画像を生成できる。
  • 未ラベルデータや部分ラベル(例:視点のみ)を活用することで、半教師ありおよび弱教師あり学習を可能にし、3次元ポーズ推定の性能向上を図る。

実験結果

リサーチクエスチョン

  • RQ1分離型VAEモデルは、ポーズ、視点、背景コンテンツといったRGBハンド画像における独立で解釈可能な変動要因を学習できるか?
  • RQ2dVAEは、背景コンテンツやポーズを含む複数の変動要因を明示的に制御できる、高品質なリアルなハンド画像を生成できるか?
  • RQ3分離型表現は、実世界のRGBベンチマークにおいて、最先端の手法と比較して3次元ハンドポーズ推定の精度を向上させるか?
  • RQ4モデルは、未ラベルまたは弱ラベルデータをどれだけ活用して半教師あり3次元ポーズ推定を実現できるか?
  • RQ5トレーニング時に明示的な背景ラベルがなくても、モデルは要因を正しく分離できるか?

主な発見

  • dVAEは、[25]と同等の性能を示す3次元ハンドポーズ推定性能を達成しており、RHDおよびSTBデータセットでは、わずかに優れた3D PCKスコアを記録した。
  • RHDデータセットでは、完全ラベル(CPose、3DPose、視点)を用いた場合、平均EPEが最大3.5%改善され、弱教師あり設定(視点ラベルのみ)では最大7.5%改善された。
  • 明示的な背景ラベルがなくても、ポーズと背景コンテンツを明示的に制御して、リアルなハンド画像を合成するのに成功した。
  • dVAEは半教師あり学習において優れた一般化性能を示し、完全ラベルが5%のデータのみで使用された場合でも顕著な性能向上を示した。
  • より単純なアーキテクチャを用い、深度監視も行わず、[40]よりもCPoseおよび3DPose推定で優れた性能を示した。
  • 結果から、分離型表現は生成と推論の両方を向上させ、制御可能な画像合成を維持しつつ、正確なポーズ推定を可能にすることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。