Skip to main content
QUICK REVIEW

[論文レビュー] GANerated Hands for Real-time 3D Hand Tracking from Monocular RGB

Franziska Mueller, Florian Bernard|arXiv (Cornell University)|Dec 4, 2017
Human Pose and Action Recognition参考文献 57被引用数 8
ひとこと要約

本論文は、合成データからリアルな手の画像を生成する幾何学的に整合性のあるGAN(GeoConGAN)を用いて、ポーズアノテーションを保持したまま、モノクロナルRGB動画からのリアルタイム3D手のトラッキングを実現するシステムを提案する。この手法は、GANで処理された合成データで訓練されたCNNを用いることで、奥行きの曖昧さ、オクルージョン、視点の変化に強く、時間的に滑らかで解剖学的に妥当な3D手のトラッキングを実現し、RGBのみのベンチマークで最先端の性能を達成する。

ABSTRACT

We address the highly challenging problem of real-time 3D hand tracking based on a monocular RGB-only sequence. Our tracking method combines a convolutional neural network with a kinematic 3D hand model, such that it generalizes well to unseen data, is robust to occlusions and varying camera viewpoints, and leads to anatomically plausible as well as temporally smooth hand motions. For training our CNN we propose a novel approach for the synthetic generation of training data that is based on a geometrically consistent image-to-image translation network. To be more specific, we use a neural network that translates synthetic images to "real" images, such that the so-generated images follow the same statistical distribution as real-world hand images. For training this translation network we combine an adversarial loss and a cycle-consistency loss with a geometric consistency loss in order to preserve geometric properties (such as hand pose) during translation. We demonstrate that our hand tracking system outperforms the current state-of-the-art on challenging RGB-only footage.

研究の動機と目的

  • 制約のないモノクロナルRGB動画からのリアルタイム3D手のトラッキングを可能にすること。これは、奥行きの曖昧さ、オクルージョン、視点の変化のため、困難である。
  • 深層学習モデルのトレーニングに適した大規模で高精細な3Dアノテーション付きRGBデータセットの不足を克服すること。
  • ペアドされたリアル・合成データを必要とせずに、合成データでトレーニングされたCNNの一般化性能を向上させることで、実世界の画像分布と整合性を保つこと。
  • 画像間変換中に手のポーズを保持する手法を開発することにより、合成された3Dアノテーションが変換後のリアルな画像に対しても有効であることを保証すること。

提案手法

  • 幾何学的に整合性のあるGAN(GeoConGAN)を、敵対的損失、サイクル整合性損失、および新規の幾何学的整合性損失を用いて訓練し、合成された手の画像をリアルな見た目に変換しながらも、手のポーズを保持する。
  • 幾何学的整合性損失により、元の合成画像内の3D手関節位置が変換画像に対しても保持され、テクスチャの漏れを低減し、輪郭の鋭さを維持する。
  • 3D手モデルを用いて完全な3D真値を備えた合成手の画像を生成し、照明、視点、背景を変化させることで多様なトレーニングデータセットを構築する。
  • 変換された画像(以下、「GANerated」画像と呼ぶ)を用いて、RGB入力から2D関節ヒートマップとルート相対3D関節位置を同時に回帰するCNN(RegNet)を訓練する。
  • 運動学的フィッティングステップにより、2D予測と相対的3D関節位置を統合し、グローバルな3D手のポーズを回復することで、奥行きの曖昧さを解消し、時間的滑らかさを確保する。
  • 最終的なトラッキングパイプラインはリアルタイムで動作し、GTX 1080 Tiで1回の順伝播が13 msであるため、一般的なRGBウェブカメラへのデプロイが可能である。

実験結果

リサーチクエスチョン

  • RQ1ペアドされたリアル・合成データを必要とせずに、GANベースの画像間変換手法が、合成からリアルに近い画像への変換中に3D手のポーズを保持できるか。
  • RQ2GANerated画像(実世界の分布に近づけた合成画像)でトレーニングされたCNNは、生の合成データでトレーニングした場合と比較して、実際のRGB動画における3D手のトラッキング性能を向上させるか。
  • RQ3モノクロナルRGBのみのシステムが、オクルージョンや制約のないカメラの視点において、どれほどリアルタイムで頑健な3D手のトラッキングを達成できるか。
  • RQ4提案手法は、特にグローバルな手のルートポーズ推定において、最先端のRGB-DおよびRGBのみの手のトラッキング手法と比較して、どの程度の精度を示すか。

主な発見

  • 提案されたGeoConGANは、標準のCycleGANと比較して、ポーズの保持、テクスチャの漏れ低減、輪郭の鋭さ向上により、画像変換の質を顕著に向上させる。
  • GANeratedデータでトレーニングされたRegNetモデルは、RGBのみのDexterおよびEgoDexterベンチマークで最先端の性能を達成し、3D PCK(正しく特定されたキーポイントの割合)において、先行手法を上回る。
  • Dexter+Objectベンチマークでは、20mmの閾値で3D PCKが78.4%を達成し、RGB入力のみであるにもかかわらず、強力な性能を示している。
  • アブレーションスタディの結果、幾何学的整合性損失はポーズの保持に不可欠であることが確認され、その除去により顕著なポーズ歪みと性能低下が生じた。
  • システムは、一般のGPUで1インスタンスあたり13msの推論時間でリアルタイム動作を実現し、制約のない環境における一般的なRGBウェブカメラへのデプロイが可能である。
  • RGB-D手法との定量的比較から、主な性能差はルートポジション推定の不正確さに起因しており、モノクロナルRGBのみのトラッキングにおいても、ルートポーズの推定が依然として主な課題であると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。