Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Refine Human Pose Estimation

Mihai Fieraru, Anna Khoreva|arXiv (Cornell University)|Apr 21, 2018
Human Pose and Action Recognition参考文献 40被引用数 9
ひとこと要約

この論文では、共通する誤り(関節の重複や左右の混同)を是正するために、画像の外観とポーズ構造を統合的にモデル化するpost-processingネットワークPoseRefinerを提案する。独自のデータ拡張スキームを用いることで、複数のベンチマークで最先端の性能を達成し、mAPは最大5.3ポイント、mMOTAは4.9ポイント向上する。

ABSTRACT

Multi-person pose estimation in images and videos is an important yet challenging task with many applications. Despite the large improvements in human pose estimation enabled by the development of convolutional neural networks, there still exist a lot of difficult cases where even the state-of-the-art models fail to correctly localize all body joints. This motivates the need for an additional refinement step that addresses these challenging cases and can be easily applied on top of any existing method. In this work, we introduce a pose refinement network (PoseRefiner) which takes as input both the image and a given pose estimate and learns to directly predict a refined pose by jointly reasoning about the input-output space. In order for the network to learn to refine incorrect body joint predictions, we employ a novel data augmentation scheme for training, where we model "hard" human pose cases. We evaluate our approach on four popular large-scale pose estimation benchmarks such as MPII Single- and Multi-Person Pose Estimation, PoseTrack Pose Estimation, and PoseTrack Pose Tracking, and report systematic improvement over the state of the art.

研究の動機と目的

  • 複数人における人間のポーズ推定で依然として生じる課題、例えば関節の重複、左右の混同、隠蔽状態を解決する。
  • 既存のポーズ推定手法のアーキテクチャを変更せずに適用可能な汎用的な精緻化フレームワークを開発する。
  • 密接な距離での人物同士、部分的隠蔽、レアポーズなどの困難な状況を改善するため、明示的に共通する予測誤りを是正するようにモデルを訓練する。
  • 画像とポーズの入力を活用してより正確で一貫性のある関節位置を生成する、エンドツーエンドで順方向の精緻化を実現する。

提案手法

  • RGB画像と初期のポーズ推定値を入力とし、精緻化されたポーズを出力する完全畳み込み型ResNetベースのアーキテクチャを提案する。
  • 真値ポーズを摂動させることで、関節の重複や左右入れ替えなどの共通誤りをシミュレートする、新たなデータ拡張スキームを設計する。
  • 精緻化された予測と真値の間のL2損失を最小化するようにネットワークを学習させることで、教師あり精緻化により誤り是正を学習可能にする。
  • 複数人状況では個々の人物ごとに精緻化ネットワークを独立して適用し、識別子を保持するとともに、トラッキングパイプラインへの適用を可能にする。
  • 単一人物および複数人物のポーズ推定・トラッキングタスクの両方で同じネットワークを用いることで、タスク間での汎用性を示す。
  • 精緻化ステップをpost-processingモジュールとして統合することで、再トレーニングなしに任意の既存のポーズ推定器と互換性を持つ。

実験結果

リサーチクエスチョン

  • RQ1学習された精緻化ネットワークは、深層学習ベースのポーズ推定における関節の重複や左右の混同といった一般的な失敗モードを効果的に是正できるか?
  • RQ2ハードなポーズケースを明示的にモデル化するデータ拡張スキームは、精緻化ネットワークの一般化性能とロバストネスを向上させるか?
  • RQ3post-processingの精緻化モジュールは、多様なベンチマークとタスクで最先端の性能をどの程度向上できるか?
  • RQ4予測を行わない関節(例:鼻)を、精緻化ネットワークが回復できるか、全体の性能向上に寄与するか?
  • RQ5精緻化フレームワークは、異なるポーズ推定・トラッキング手法に汎用的に適用可能か、複数人状況でも識別子の一貫性を維持できるか?

主な発見

  • MPII Multi-Person Pose Estimationベンチマークにおいて、PoseRefinerは最高報告mAPを71.9から73.8に向上させ、+1.9 mAPの向上を達成した。
  • PoseTrack Multi-Person Pose Trackingベンチマークでは、ML_Labベースラインに適用した際、mMOTAを48.6から53.5に向上させ、+4.9 mMOTAの向上を達成した。
  • 鼻関節を元来省略するArtTrackでは、精緻化により鼻関節が回復され、mAPが68.6から69.7に向上し、鼻関節を含めた場合のmAPは+1.1 mAPの向上を達成した。
  • BUTD や Detect-and-Track といったトップパフォーマーを含む、すべての評価対象手法において一貫した性能向上が見られ、mAPは最大+5.3、mMOTAは最大+5.3の向上を達成した。
  • トラッキング性能において顕著な向上を示し、異なるベースラインでmMOTAが2.4〜3.9ポイント向上し、時間的整合性の向上を実証した。
  • 定性的な結果から、特に混雑した場面や隠蔽状態の場面で、関節の混同や重複の問題が効果的に是正されていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。