Skip to main content
QUICK REVIEW

[論文レビュー] SPCNet:Spatial Preserve and Content-aware Network for Human Pose Estimation

Yabo Xiao, Dongdong Yu|arXiv (Cornell University)|Apr 13, 2020
Human Pose and Action Recognition参考文献 27被引用数 7
ひとこと要約

SPCNetは、人体ポーズ推定のための新しい空間的保存およびコンテンツに適応したネットワークを提案し、高解像度の空間的分解能を維持しながら広い受容 field を実現するための拡張時計モジュール(DHM)と、空間的コンテンツに適応した注釈を用いた多段階特徴の適応的融合を実現する選択的情報モジュール(SIM)を導入している。本手法はMPII、LSP、FLICベンチマークで最先端の性能を達成し、LSPでは96.4%の総PCKスコア、FLICでは98.8%を記録した。

ABSTRACT

Human pose estimation is a fundamental yet challenging task in computer vision. Although deep learning techniques have made great progress in this area, difficult scenarios (e.g., invisible keypoints, occlusions, complex multi-person scenarios, and abnormal poses) are still not well-handled. To alleviate these issues, we propose a novel Spatial Preserve and Content-aware Network(SPCNet), which includes two effective modules: Dilated Hourglass Module(DHM) and Selective Information Module(SIM). By using the Dilated Hourglass Module, we can preserve the spatial resolution along with large receptive field. Similar to Hourglass Network, we stack the DHMs to get the multi-stage and multi-scale information. Then, a Selective Information Module is designed to select relatively important features from different levels under a sufficient consideration of spatial content-aware mechanism and thus considerably improves the performance. Extensive experiments on MPII, LSP and FLIC human pose estimation benchmarks demonstrate the effectiveness of our network. In particular, we exceed previous methods and achieve the state-of-the-art performance on three aforementioned benchmark datasets.

研究の動機と目的

  • 遮られたり見えなくなったり、異常なポーズにあるキーポイントといった、人体ポーズ推定における継続的な課題に対処すること。
  • 正確なキーポイントの局所化を実現するため、広い受容 field を捉えながらも高解像度の空間的詳細を保持すること。
  • 複数の段階とスケールで得られる多段階特徴を、適応的かつコンテンツに適応した方法で統合すること。
  • 混雑したシーン、重なった肢、ぼやけたり歪められた身体のポーズといった複雑な状況下での性能向上を図ること。

提案手法

  • 拡張時計モジュール(DHM)は、標準的なダウンサンプリングの代わりに拡張畳み込みを用いることで、空間的分解能を維持しながら受容 field を拡大する。
  • DHMは複数の段階をスタックして、マルチスケールおよびマルチステージ特徴を捉える。拡張畳み込みによるボトルネックにより、空間的詳細が保持される。
  • 選択的情報モジュール(SIM)は、局所的なコンテンツに敏感な注釈機構を用いて、異なるレベルの特徴をピクセル単位の重み付き統合で行う。
  • SIMにおける注釈重みは空間的コンテンツに基づいて計算され、局所領域の複雑さに応じて動的に特徴選択が可能になる。
  • ネットワークは中間監視を用いてエンド・トゥ・エンドで訓練され、スタックされたDHMとSIMによる適応的統合を通じて、より良いキーポイントのヒートマップが得られる。
  • アーキテクチャはMPII、LSP、FLICベンチマークで評価され、アブレーションスタディによりモジュールの有効性が確認された。

実験結果

リサーチクエスチョン

  • RQ1キーポイントの局所化を向上させるために、高解像度の空間的分解能を維持しながら広い受容 field を達成できるネットワークアーキテクチャは構築可能か?
  • RQ2異なる段階とスケールから得られる多段階特徴を、どのように適応的に統合することで、困難なポーズでの性能を向上させられるか?
  • RQ3コンテンツに適応した注釈機構は、遮蔽や異常ポーズ下でも特徴選択を改善するか?
  • RQ4提案されたモジュールは、MPII、LSP、FLICといった標準ベンチマークで、既存の最先端手法を上回る性能を発揮するか?

主な発見

  • SPCNetはLSPテストセットで最先端の96.4%の総PCKスコアを達成し、以前の手法を上回った。
  • LSPデータセットでは、最近縁の競合手法と比較して、手首で4.4%、肘で2.7%のPCK向上を達成した。
  • FLICデータセットでは、肘のPCK@0.2が99.3%、手首が98.3%を記録し、ベースラインの時計ネットワークよりもそれぞれ0.3%、1.2%高いスコアを達成した。
  • 定性的な比較により、見えない肢、遮蔽、異常ポーズといった困難な状況でも、予測の質が顕著に向上していることが示された。
  • アブレーションスタディにより、拡張時計モジュールと選択的情報モジュールの両方が、性能向上に著しく寄与していることが確認された。
  • ぼやけた領域や重なった肢を含む複雑な状況でも、ネットワークは高い信頼性と正確なヒートマップ応答を示し、ロバストネスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。