Skip to main content
QUICK REVIEW

[論文レビュー] Articulated Pose Estimation Using Hierarchical Exemplar-Based Models

Jiongxin Liu, Yinxiao Li|arXiv (Cornell University)|Dec 13, 2015
Human Pose and Action Recognition被引用数 3
ひとこと要約

本論文は、階層的エキスプレイズベースモデルに深層畳み込みニューラルネットワーク(DCNN)を組み合わせた、関節部の姿勢推定のための手法を提案する。多層的な空間的制約と部分間の関係を、細分化されたスケールで活用することで、Leeds SportsおよびCUB-200-2011データセットで最先端の性能を達成し、部分の局所化精度において従来手法を上回る。

ABSTRACT

Exemplar-based models have achieved great success on localizing the parts of semi-rigid objects. However, their efficacy on highly articulated objects such as humans is yet to be explored. Inspired by hierarchical object representation and recent application of Deep Convolutional Neural Networks (DCNNs) on human pose estimation, we propose a novel formulation that incorporates both hierarchical exemplar-based models and DCNNs in the spatial terms. Specifically, we obtain more expressive spatial models by assuming independence between exemplars at different levels in the hierarchy; we also obtain stronger spatial constraints by inferring the spatial relations between parts at the same level. As our method strikes a good balance between expressiveness and strength of spatial models, it is both effective and generalizable, achieving state-of-the-art results on different benchmarks: Leeds Sports Dataset and CUB-200-2011.

研究の動機と目的

  • 人間や鳥のような高度に変形可能なオブジェクトにおける正確な関節部の姿勢推定の課題に対処すること。
  • 従来のエキスプレイズベースモデルは、訓練データが限られているため、高度に関節部を持つオブジェクトでは性能が劣ることがあるため、その表現力を向上させること。
  • 深層学習に基づく外観モデリング(DCNN)と階層的空間的制約を統合し、より強力で汎用性の高い姿勢推定を実現すること。
  • モデルの表現力と空間的一致性を複数のスケールの粒度でバランスさせる効率的な推論フレームワークを開発すること。

提案手法

  • 原子的部分(例:関節)が最も細かいレベルにあり、それらがグループ化されて上位レベルで複合的部分(例:四肢)が形成される階層的ツリー構造を用いる。
  • 同じレベルの部分間の空間的関係はDCNNを用いて相対的なオフセットを予測するが、異なるレベル間の関係はエキスプレイズベース推論によって親子の階層関係が強制される。
  • 各レベルで妥当な部分の配置をエキスプレイズがエンコードし、異なるレベルのエキスプレイズ同士は独立と仮定することで表現力を向上させる。
  • 外観スコア(DCNNから得られる)と階層的エキスプレイズによる空間的一致性スコアを組み合わせたスコア関数を用いて、部分の位置を同時に最適化することで空間的制約を強制する。
  • 階層を下位から上位へ向かって順方向推論を実施し、粗いスケールから細かいスケールへと制約を伝搬することで空間的一致性を維持する。
  • 個々の部分を独立に最適化する従来手法とは異なり、グループ化された部分最適化を用いて、部分の位置を同時に精緻化する。

実験結果

リサーチクエスチョン

  • RQ1人間のような高度に変形可能なオブジェクトに対して、階層的構造を導入することでエキスプレイズベースモデルの表現力を向上させることができるか?
  • RQ2深層畳み込みニューラルネットワーク(DCNN)を、関節部の姿勢推定における空間的モデリングに効果的に統合する方法は何か?
  • RQ3多層的な空間的制約とDCNNに基づく外観モデルを組み合わせることで、局所化精度と一般化性能が向上するか?
  • RQ4大規模な変形が生じる状況下でも、階層的エキスプレイズフレームワークは非階層的または木構造モデルを上回る部分局所化性能を示せるか?

主な発見

  • 本手法はLeeds Sportsデータセットで最先端の性能を達成し、ほとんどの身体部位において、検出された関節の割合(PDJ)が従来手法を上回った。
  • CUB-200-2011鳥類データセットでは、最高のPCP(Part Confidence Precision)スコアを達成し、Ours-fullはDCNN-CoEおよびPart-pairベースラインを上回った。
  • DCNNに基づく外観モデルのみを用いるOurs-baseバージョンでさえ、( ? ) よりも多くの関節で従来手法を上回った。これはDCNNが部分検出に非常に強力であることを示している。
  • Ours-baseに多層的な空間モデリングを組み込んだ本手法(Ours-full)は、特に変形しやすい部位(脚や翼)で顕著な性能向上を達成した。
  • 定性的な結果では、多様なポーズ、視点、変形に対してもロバストな局所化が可能であり、極端な隠蔽やノイズによる失敗はわずかに数例にとどまった。
  • 本手法は効率的であり、既存のDCNNモデルと互換性があるが、競合手法が要求するような複雑なアーキテクチャは不要である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。