Skip to main content
QUICK REVIEW

[論文レビュー] Joint Multi-Person Pose Estimation and Semantic Part Segmentation

Fangting Xia, Peng Wang|arXiv (Cornell University)|Aug 10, 2017
Human Pose and Action Recognition参考文献 30被引用数 10
ひとこと要約

本稿では、深層特徴と完全結合型CRFに新規のセグメント-ジョイント滑らかさ項を導入した、マルチペルソンポーズ推定とセマンティックパーツセグメンテーションのための統合フレームワークを提案する。ポーズがパーツセグメンテーションをガイドし、パーツがポーズを精緻化する反復的融合により、ポーズ推定で10.6%、セグメンテーションで1.5%の精度向上を達成するとともに、検出された人間ボックスに基づくインスタンスベースのCRF推論により、先行研究比40倍の高速化を実現した。

ABSTRACT

Human pose estimation and semantic part segmentation are two complementary tasks in computer vision. In this paper, we propose to solve the two tasks jointly for natural multi-person images, in which the estimated pose provides object-level shape prior to regularize part segments while the part-level segments constrain the variation of pose locations. Specifically, we first train two fully convolutional neural networks (FCNs), namely Pose FCN and Part FCN, to provide initial estimation of pose joint potential and semantic part potential. Then, to refine pose joint location, the two types of potentials are fused with a fully-connected conditional random field (FCRF), where a novel segment-joint smoothness term is used to encourage semantic and spatial consistency between parts and joints. To refine part segments, the refined pose and the original part potential are integrated through a Part FCN, where the skeleton feature from pose serves as additional regularization cues for part segments. Finally, to reduce the complexity of the FCRF, we induce human detection boxes and infer the graph inside each box, making the inference forty times faster. Since there's no dataset that contains both part segments and pose labels, we extend the PASCAL VOC part dataset with human pose joints and perform extensive experiments to compare our method against several most recent strategies. We show that on this dataset our algorithm surpasses competing methods by a large margin in both tasks.

研究の動機と目的

  • 弱い外見特徴の下で曖昧さや形状コンテキストの欠如に苦しむ独立したポーズ推定とパーツセグメンテーションの限界を解消すること。
  • ポーズがグローバルな形状事前分布を提供し、パーツが空間的一致性を提供するという、ポーズとパーツ情報の補完的性質を活用すること。
  • 人間検出ボックスを活用して局所的かつ効率的な推論を可能にすることで、フル画像CRF推論の計算コストを低減すること。
  • PASCAL VOC Partに14の人体関節アノテーションを追加して、統合学習用に新たなベンチマークデータセットを構築・公開すること。
  • 統合最適化が、精度と推論速度の両面で最先端性能を上回ることを実証すること。

提案手法

  • 2つの完全畳み込みネットワーク(FCN)を学習:ポーズFCNは関節スコアマップと関節近傍マップを出力し、パーツFCNはパーツスコアマップを出力する。
  • 関節スコア、近接スコア、パーツスコアの3種類の特徴を、新規のセグメント-ジョイント滑らかさ項を備えた完全結合型CRFで統合し、空間的および意味的整合性を強制する。
  • 精緻化されたポーズ関節を用いてスケルトン特徴を生成し、それを2段階目のパーツFCNに追加の正則化特徴として入力する。
  • 「オートズーム」戦略を適用:検出器で人間インスタンスを検出し、各インスタンスをリサイズした後、各バウンディングボックス内でCRF推論を実行することで、計算複雑性を低減する。
  • トレーニングおよび評価に使用するため、14の関節アノテーションを追加したPASCAL-Person-Partデータセットを活用する。
  • マルチステージ推論パイプラインを採用:初期FCN予測 → CRF精緻化 → ポーズ特徴を用いた2段階目のFCNでセグメンテーション精度を向上

実験結果

リサーチクエスチョン

  • RQ1ポーズ推定とセマンティックパーツセグメンテーションを統合的に最適化することで、独立学習に比べて両タスクの性能向上が達成可能か?
  • RQ2特に曇りや部分的遮蔽がある状況下でも、パーツレベルの意味的整合性を効果的にポーズ推定の正則化に活用できるか?
  • RQ3ポーズを形状事前分布として統合することで、特にコントラストが低く複雑な領域(例:四肢)において、セマンティックパーツセグメンテーションの精度と詳細度が向上するか?
  • RQ4人間検出ボックス内にCRF推論を局所化することで、計算コストが著しく低減するが、精度に悪影響を及げないか?
  • RQ5本手法は、小規模および大規模な人間インスタンスにどの程度一般化可能か?

主な発見

  • 本手法は、競合手法に比べてポーズ推定精度を10.6%向上させ、特に小規模または遮蔽された人物の困難なケースで顕著な向上を示した。
  • 統合推論フレームワークにより、ポーズ推定の局所化誤差が低減され、誤って配置された肘・手首や欠落した額関節の回復が可能になった。
  • セマンティックパーツセグメンテーションのmIOUが1.5%向上し、特に小規模インスタンスにおいて顕著な向上が見られた細分化領域(腕・脚)で顕著だった。
  • ResNet-101を用いた場合、PASCAL-Person-Partデータセットで64.39%のmIOUを達成し、小規模人間インスタンスにおいて、以前の最先端手法を5%以上上回った。
  • インスタンスレベルのCRF推論を採用したことで、フル画像CRFに比べて推論時間を40倍短縮し、1枚あたり8秒(DeeperCutの4分に比べ)を達成した。
  • 可視化結果から、弱い外見特徴の領域でも、ポーズとパーツの両方においてより一貫性があり詳細な予測が得られることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。