Skip to main content
QUICK REVIEW

[論文レビュー] An Integral Pose Regression System for the ECCV2018 PoseTrack Challenge

Xiao Sun, Chuankang Li|arXiv (Cornell University)|Sep 17, 2018
Human Pose and Action Recognition参考文献 9被引用数 9
ひとこと要約

本論文は、ECCV2018 PoseTrack Challengeにおいて3次元人体ポーズ推定のための統合的ポーズ回帰システムを提示する。2段階のトップダウンフレームワーク(人物ボックス検出とカメラ投影モデリング)を活用し、外部の2次元ポーズデータ(MPII、COCO)を統合し、エンド・トゥ・エンドで微分可能な統合回帰を用いることで、CHALL_H80Kテストセットで47mmのMPJPEを達成し、チャレンジで2位を獲得した。

ABSTRACT

For the ECCV 2018 PoseTrack Challenge, we present a 3D human pose estimation system based mainly on the integral human pose regression method. We show a comprehensive ablation study to examine the key performance factors of the proposed system. Our system obtains 47mm MPJPE on the CHALL_H80K test dataset, placing second in the ECCV2018 3D human pose estimation challenge. Code will be released to facilitate future work.

研究の動機と目的

  • モノクローラルRGB画像における制御環境下での頑健な3次元人体ポーズ推定システムの開発を目的とする。
  • トレーニングプロセスに外部の2次元ポーズデータセット(MPII、COCO)を統合することで性能を向上させることを目的とする。
  • エンド・トゥ・エンド3次元キーポイント予測に向けた統合回帰法の有効性を検証することを目的とする。
  • データ増強、モデルアーキテクチャの深さ、推論戦略がMPJPEに与える影響を評価することを目的とする。
  • 制限付きのチャレンジ環境下で、Human3.6MのCHALL_H80Kサブセットにおいて最先端のパフォーマンスを達成することを目的とする。

提案手法

  • 2段階のトップダウンアプローチを採用:まず、COCOオブジェクト検出データでトレーニングされた検出器を用いて人物のバウンディングボックスを検出する。
  • 検出されたボックスを用いて画像をクロップ・リサイズし、CNNの入力用に正規化された局所パッチを生成する。
  • トレーニング中の監視のため、弱いパースペクティブカメラモデルを用いて3次元真値を2次元画像座標に投影する。
  • argmax後処理を置き換えるために統合回帰を適用し、微分可能な操作を実現することでエンド・トゥ・エンド学習と連続出力を可能にする。
  • 2D/3Dデータの混合学習を用いてモデルをトレーニングし、MPIIおよびCOCOデータセットからの2D監視とCHALL_H80Kからの3D監視を併用する。
  • 一般化を向上させるために、ランダムなトランスレーション、スケーリング、回転、フリップを含むデータ増強を実装する。

実験結果

リサーチクエスチョン

  • RQ1外部の2次元ポーズデータ(MPII、COCO)の統合が、CHALL_H80Kにおける3次元ポーズ推定性能に与える影響は何か?
  • RQ2トップダウン3次元ポーズ推定パイプラインにおいて、人物ボックス検出がMPJPE低減に果たす貢献度は何か?
  • RQ3モデルの深さ(ResNet-50 対 ResNet-152)と入力解像度が最終パフォーマンスに与える影響は何か?
  • RQ4テスト時データ増強(フリップテスト)とモデルアンサンブルがMPJPEに与える影響は何か?
  • RQ5予測された3次元座標のスケーリングに用いる平均ボーン長さの選択が最終パフォーマンスに与える感度は何か?

主な発見

  • 人物ボックス検出の追加により、MPJPEは115.9mmから86.5mmに低下し、相対的に25.4%の改善が得られた。
  • MPIIの2次元ポーズデータを混合2D/3D学習に統合したことで、MPJPEは86.5mmから62.2mmに低下し、相対的に28.1%の改善が得られた。
  • より深いResNet-152バックボーンを用いることで、ResNet-50と比較してMPJPEは1.6%相対的に低下し、62.2mmから61.2mmに改善された。
  • 入力解像度を256×256から288×384に引き上げることで、MPJPEは相対的に4.4%低下し、61.2mmから58.5mmに改善された。
  • フリップテストとモデルアンサンブルにより、それぞれMPJPEは1.0%および2.8%低減され、バリデーションセットで55.3mmを達成した。
  • 最終的なシステムは、CHALL_H80Kテストセットで47mmのMPJPEを達成し、ECCV2018 3次元人体ポーズ推定チャレンジで2位を獲得した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。