Skip to main content
QUICK REVIEW

[論文レビュー] Anti-Confusing: Region-Aware Network for Human Pose Estimation

Xuan Cao, Yanhao Ge|arXiv (Cornell University)|May 3, 2019
Human Pose and Action Recognition参考文献 33被引用数 4
ひとこと要約

本稿では、人体ポーズ推定のための新規フレームワークであるRegion-Aware Network (RANet) を提案する。RANetは、重いオクルージョン、近隣の人物、対称的なボディパーツといった混乱要因となるテクスチャに対して、パーサーに基づくデータ拡張、低レベル特徴の向上を目的とした特徴ピラミッドスタム、ターゲット固有の特徴を効果的に抽出するための領域抽出、予測値を精緻化するためのカスケードボーティング統合によって、その耐障害性を向上させる。RANetはMPIIおよびLSPベンチマークで最先端の性能を達成しており、特に手首、足首、肘といった予測が難しい関節において顕著な向上を示している。

ABSTRACT

In this work, we propose a novel framework named Region-Aware Network (RANet), which learns the ability of anti-confusing in case of heavy occlusion, nearby person and symmetric appearance, for human pose estimation. Specifically, the proposed method addresses three key aspects, i.e., data augmentation, feature learning and prediction fusion, respectively. First, we propose Parsing-based Data Augmentation (PDA) to generate abundant data that synthesizes confusing textures. Second, we not only propose a Feature Pyramid Stem (FPS) to learn stronger low-level features in lower stage; but also incorporate an Effective Region Extraction (ERE) module to excavate better target-specific features. Third, we introduce Cascade Voting Fusion (CVF) to explicitly exclude the inferior predictions and fuse the rest effective predictions for the final pose estimation. Extensive experimental results on two popular benchmarks, i.e. MPII and LSP, demonstrate the effectiveness of our method against the state-of-the-art competitors. Especially on easily-confusable joints, our method makes significant improvement.

研究の動機と目的

  • 人体ポーズ推定における混乱要因、特に重いオクルージョン、近隣の人物、対称的な外見の影響を解消すること。
  • 対称的な外見が、従来のポーズ推定において十分に検討されていなかった混乱要因であることを特定すること。
  • 混乱要因に強い能力を有する統合的フレームワークを構築し、同時にデータ拡張、特徴学習、予測統合の改善を実現すること。
  • 手首、足首、膝、肘といった予測が難しい関節の性能向上を図ること。

提案手法

  • 人体関節周辺のボディパーツをセグメンテーションし、再配置することで、現実的で混乱を引き起こすようなテクスチャを合成する、パーサーに基づくデータ拡張(PDA)を提案する。
  • 異なる解像度でマルチスケールの低レベル特徴を学習する特徴ピラミッドスタム(FPS)を導入し、ネットワークの初期段階での特徴表現を強化する。
  • 中間段階でのボクシングボックス予測に基づいて人体領域をクロップする有効な領域抽出(ERE)モジュールを設計し、背景ノイズを低減するとともに、ターゲット固有の特徴を強化する。
  • 低信頼度の予測を除外し、重み付き平均を用いて高品質な候補を適応的に統合するカスケードボーティング統合(CVF)モジュールを開発する。
  • すべてのモジュールをスタックドアワーゲラスベースのアーキテクチャに統合し、エンドツーエンドの学習と推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1パーサーに基づくデータ拡張は、オクルージョンや対称的なボディパーツといった複雑な混乱要因を効果的に模擬できるか?
  • RQ2特徴ピラミッドスタムによる低レベル特徴の学習強化は、ポーズ推定の耐障害性を向上させるか?
  • RQ3予測されたボクシングボックスから得られる有効な領域抽出は、背景ノイズを低減させ、特徴の特異性を向上させるか?
  • RQ4劣悪な予測を除外するカスケードボーティング統合は、より正確な最終的なポーズ推定をもたらすか?

主な発見

  • RANetはMPII検証セットでPCKh@0.5スコア91.52%を達成し、先行する最先端手法を上回った。
  • アブレーションスタディの結果、PDA単体で精度が1.14%向上、FPSで0.35%、EREで0.23%、EREと組み合わせたCVFでは最大1.06%の向上が確認された。
  • 手首や足首といった難易度の高い関節において、RANetはベースラインおよび先行手法に比べ顕著な向上を示し、予測誤差の平均および分散が低減された。
  • CVFの最適なしきい値は、候補とその中心間の平均距離付近に位置しており、それからの逸脱は性能を低下させることを確認した。これは、選択的統合の重要性を裏付けている。
  • 統計的分析により、四肢関節(特に手首と足首)は体幹関節に比べて誤差の分散が大きいことが判明し、水平方向の予測は垂直方向の予測よりも一般的に困難であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。