Skip to main content
QUICK REVIEW

[論文レビュー] A Dual-Source Approach for 3D Human Pose Estimation from a Single Image

Umar Iqbal, Andreas Doering|arXiv (Cornell University)|May 8, 2017
Human Pose and Action Recognition参考文献 36被引用数 6
ひとこと要約

本論文は、2次元ポーズアノテーション付き画像と3次元モーショングラフデータの2つの独立したデータソースを組み合わせることで、ペアド2次元-3次元トレーニングデータを必要とせずに単一画像からの3次元人体ポーズ推定を実現する二重ソースアプローチを提案する。2次元ポーズ推定とモーショングラフからの最近傍3次元ポーズ検索を用い、監視の少ない環境でも最先端の性能を達成しており、2つのソース間のスケルトン構造の顕著な違いに対しても耐性を示す。

ABSTRACT

In this work we address the challenging problem of 3D human pose estimation from single images. Recent approaches learn deep neural networks to regress 3D pose directly from images. One major challenge for such methods, however, is the collection of training data. Specifically, collecting large amounts of training data containing unconstrained images annotated with accurate 3D poses is infeasible. We therefore propose to use two independent training sources. The first source consists of accurate 3D motion capture data, and the second source consists of unconstrained images with annotated 2D poses. To integrate both sources, we propose a dual-source approach that combines 2D pose estimation with efficient 3D pose retrieval. To this end, we first convert the motion capture data into a normalized 2D pose space, and separately learn a 2D pose estimation model from the image data. During inference, we estimate the 2D pose and efficiently retrieve the nearest 3D poses. We then jointly estimate a mapping from the 3D pose space to the image and reconstruct the 3D pose. We provide a comprehensive evaluation of the proposed method and experimentally demonstrate the effectiveness of our approach, even when the skeleton structures of the two sources differ substantially.

研究の動機と目的

  • 単一画像からの3次元人体ポーズ推定のため、大規模なペアド2次元画像と正確な3次元ポーズを備えたトレーニングデータを取得する課題に対処すること。
  • 3次元モーショングラフデータと2次元ポーズアノテーション付き画像という2つの独立したデータソースを活用することで、高価なペアド2次元-3次元データセットへの依存を低減すること。
  • 深度センサーやマルチビュー設定が不実用な実世界の制約のないシナリオにおいても、正確な3次元ポーズ推定を可能にすること。
  • 2つのデータソース間のスケルトン構造の不一致(例えば関節構成の相違)に対しても耐性を持つ手法を開発すること。

提案手法

  • 仮想カメラプロジェクションを用いて3次元モーショングラフデータを正規化された2次元ポーズ空間にマップし、3次元-2次元対応関係を生成する。
  • MPII、Leeds Sports、MSCOCOなどのデータセットを用いて、深層畳み込みニューラルネットワークを訓練し、制約のない画像からの2次元ポーズ推定を実行する。
  • 推論段階では、推定された2次元ポーズを基に、ロバストな類似度メトリクスを用いてモーショングラフデータベースから最近傍の3次元ポーズを検索する。
  • 2次元推定に基づいて、3次元ポーズ空間から画像空間へのジョイントプロジェクションマッピングを学習し、3次元ポーズ再構築を精緻化する。
  • 線形回帰を用いてスケルトンリターゲティングを実行し、モーショングラフと画像ベースポーズデータセット間の異なる関節構造を一致させる。
  • ペアド2次元-3次元データに対するエンドツーエンドのトレーニングを回避し、2つのデータソースを独立して扱う弱い監視を採用する。

実験結果

リサーチクエスチョン

  • RQ1ペアド2次元-3次元トレーニング例を一切必要とせず、3次元モーショングラフデータと2次元ポーズアノテーション付き画像のみを用いて、3次元人体ポーズ推定を効果的に行えるか?
  • RQ2モーショングラフデータと画像ベースポーズデータセットのスケルトン構造が異なる場合、この手法の性能はどのように変化するか?
  • RQ32次元ポーズ推定器の精度が、最終的な3次元ポーズ推定性能にどの程度影響を与えるか?
  • RQ4推論段階での2次元ポーズ推定の誤りに対して、この手法はどの程度耐性を示すか?
  • RQ5この手法は、トレーニング時に見られなかった制約のない実世界の画像にも十分に一般化できるか?

主な発見

  • HumanEva-Iデータセットにおいて、HumanEvaのモーショングラフデータを用いた場合、平均3次元ポーズ誤差は31.5 mmに達し、大多数の先行手法を上回る性能を示した。
  • CMUのモーショングラフデータを用いた場合、誤差は80.0 mmであったが、CMUスケルトンをHumanEvaにリターゲティングすることで50.5 mmに低下し、スケルトンの違いが及ぼす影響を明確に示した。
  • HumanEva-Iデータセットでは平均31.5 mmの誤差を達成し、ペアド2次元-3次元データを完全に使用する最新の深層学習手法を除き、すべての先行手法を上回った。
  • 2次元ポーズ推定器の性能が向上すれば、この手法は大幅に単純化されても高い性能を維持でき、最先端の2次元ポーズモデルと強い相乗効果を示した。
  • MPII Human Poseデータセットにおける定性的な結果から、この手法が複雑で制約のない実世界の画像に対しても良好に一般化できることを確認した。
  • アブレーションスタディにより、二重ソースアプローチが2次元ポーズ推定誤差の変動やスケルトン構造の不一致に対しても耐性を示すことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。