Skip to main content
QUICK REVIEW

[論文レビュー] MetaFuse: A Pre-trained Fusion Model for Human Pose Estimation

Rongchang Xie, Chunyu Wang|arXiv (Cornell University)|Mar 30, 2020
Human Pose and Action Recognition参考文献 38被引用数 4
ひとこと要約

MetaFuseは、わずかなラベル付き画像のみを用いて新しいカメラ設定に迅速に適応できる、人間のポーズ推定向けの事前学習済みクロスビュー特徴融合モデルを提案する。特徴融合ネットワークを汎用的でメタラーニングされたモデルと軽量なカメラ固有変換に分解することにより、H36M、Total Capture、CMU Panopticデータセットで最小限のファインチューニングデータで最先端の性能を達成した。

ABSTRACT

Cross view feature fusion is the key to address the occlusion problem in human pose estimation. The current fusion methods need to train a separate model for every pair of cameras making them difficult to scale. In this work, we introduce MetaFuse, a pre-trained fusion model learned from a large number of cameras in the Panoptic dataset. The model can be efficiently adapted or finetuned for a new pair of cameras using a small number of labeled images. The strong adaptation power of MetaFuse is due in large part to the proposed factorization of the original fusion model into two parts (1) a generic fusion model shared by all cameras, and (2) lightweight camera-dependent transformations. Furthermore, the generic model is learned from many cameras by a meta-learning style algorithm to maximize its adaptation capability to various camera poses. We observe in experiments that MetaFuse finetuned on the public datasets outperforms the state-of-the-arts by a large margin which validates its value in practice.

研究の動機と目的

  • 新しいカメラペアごとに再トレーニングを要する従来のマルチビュー肢位推定手法のスケーラビリティと不柔軟性を解決すること。
  • 少数のラベル付き画像のみで、特徴融合モデルを新しいカメラ設定に効率的に適応できることを実現すること。
  • 複数のカメラ間でのクロスビュー特徴融合を活用することで、遮蔽に対する耐性を向上させること。
  • 多様なカメラ設定でのメタラーニングを通じて、汎用的な融合モデルを強力な一般化能力とともに開発すること。
  • 新しい環境にマルチビュー肢位推定を展開するためのデータおよびトレーニングコストを低減すること。

提案手法

  • NaiveFuseモデルを、すべてのカメラで共有される汎用的融合部と、軽量なカメラ固有アフィン変換に分解すること。
  • 多様なカメラポーズにおいて適応性能を最大化するように、メタラーニングアルゴリズムで汎用的融合モデルをトレーニングすること。
  • ターゲットドメインで少数のラベル付き画像に対して、カメラ依存のアフィン変換のみをファインチューニングすること。
  • 事前学習済みの汎用モデルを強力なインダクティブバイアスとして活用し、少サンプル適応性能を向上させること。
  • 任意の2Dポーズ推定ネットワークと統合することで、エンドツーエンドのマルチビュー3Dポーズ推定を実現すること。
  • 一般化を向上させるために、数千のカメラペアでCMU Panopticデータセットを用いて事前学習すること。

実験結果

リサーチクエスチョン

  • RQ1少数のラベル付きデータでのみ、事前学習済み融合モデルを新しいカメラペアに効果的に適応できるか?
  • RQ2メタラーニングは、多様なカメラ設定におけるクロスビュー特徴融合モデルの一般化能力をどのように向上させるか?
  • RQ3分解型の融合アーキテクチャは、モデルの複雑さを低減しつつ、性能を維持または向上させられるか?
  • RQ4ベンチマークデータセットにおいて、MetaFuseは従来の融合手法と比べて精度とデータ効率の両面で優れているか?
  • RQ5従来手法と比較して著しく少ないトレーニング画像で、MetaFuseは最先端の3Dポーズ推定性能を達成できるか?

主な発見

  • H36Mにおいて、50枚の画像でのファインチューニングで、MetaFuseはノーファッションベースライン(83.7%)を上回る2.6%の関節検出率(86.3%)を達成した。
  • H36Mでは、500枚のファインチューニング画像を用いたMetaFuseが3D MPJPE 32.7 mmを達成し、全データセットを用いた最先端手法を上回った。
  • Total Captureデータセットでは、MetaFuseが32.4 mmの最低の3D誤差を記録し、時間的モデリングを用いた最近の手法を上回った。
  • Panopticデータセットでは、200枚のファインチューニング画像でのみ、MetaFuseがノーファッションの3D誤差40.47 mmから31.78 mmに低減した。
  • Total Captureデータセットでは、500枚のファインチューニング画像を用いたMetaFuseが32.4 mmの3D誤差を達成し、時間情報を利用しないLSTM-AE(34.1 mm)を上回った。
  • Savitzky-Golayフィルタを適用することで、"Walking2"行動のMetaFuseの3D誤差が約5 mm低減し、後処理による向上の可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。