Skip to main content
QUICK REVIEW

[論文レビュー] Pose-Guided Human Parsing with Deep Learned Features

Fangting Xia, Jun Zhu|arXiv (Cornell University)|Aug 17, 2015
Human Pose and Action Recognition参考文献 33被引用数 10
ひとこと要約

本稿では、トップダウン型の人体ポーズ推定とディープラーニング特徴を統合することで、部位提案の生成・選択・最終的なパースングを向上させるポーズガイドド型の人体パースングフレームワークを提案する。ポーズの手がかりを全段階で活用することで(ポーズガイドド提案、ポーズベースの幾何特徴、AOGベースの構成)、Penn-FudanベンチマークにおいてSOTAを達成し、平均mIoUで前人を4%以上上回った。

ABSTRACT

Parsing human body into semantic regions is crucial to human-centric analysis. In this paper, we propose a segment-based parsing pipeline that explores human pose information, i.e. the joint location of a human model, which improves the part proposal, accelerates the inference and regularizes the parsing process at the same time. Specifically, we first generate part segment proposals with respect to human joints predicted by a deep model, then part- specific ranking models are trained for segment selection using both pose-based features and deep-learned part potential features. Finally, the best ensemble of the proposed part segments are inferred though an And-Or Graph. We evaluate our approach on the popular Penn-Fudan pedestrian parsing dataset, and demonstrate the effectiveness of using the pose information for each stage of the parsing pipeline. Finally, we show that our approach yields superior part segmentation accuracy comparing to the state-of-the-art methods.

研究の動機と目的

  • 大規模なポーズ変動、隠蔽、外観の曖昧性を伴う実世界のシナリオにおける正確な人体パースングの課題に取り組む。
  • ボトムアップなセグメンテーション生成にトップダウン型ポーズ情報を取り入れることで、部位提案の品質を向上させる。
  • ポーズベースの幾何特徴とディープラーニングされた外観表現を用いて、部位選択と最終的なパースングを強化する。
  • パースングパイプラインの全段階にわたり、ポーズガイドランスを体系的に統合し、効率性と正確性を向上させる。
  • Penn-Fudan歩行者パースングベンチマークで、既存のSOTA手法を上回る性能を発揮する。

提案手法

  • 深層ポーズ推定モデルを用いて、候補領域が予測された人体ポーズ関節の周辺に位置するように制約し、部位セグメントの提案を生成する。
  • 支持ベクターレグレッサー(SVR)を訓練し、ポーズベースの幾何特徴と畳み込みニューラルネットワーク(FCN)から得られるディープラーニング特徴を組み合わせて、提案の再ランク付けを行う。
  • 部位とポーズ関節の間の空間的関係を、局所的およびグローバルにモデル化する、新しいポーズベースの幾何特徴を設計し、識別性を向上させる。
  • アンド・オア・グラフ(AOG)を用いて、選択された部位提案を最適に構成し、ペアワイズのコンテキスト適合性を測る際にポーズの手がかりを統合する。
  • FCNから得られるディープラーニング特徴を活用し、形状と外観の手がかりを捉え、ノイズや隠蔽に強くする。
  • パイプライン全体にわたりトップダウン型ポーズガイドランスを統合する:提案生成、特徴のランク付け、最終的構成段階で一貫した正則化を実現する。

実験結果

リサーチクエスチョン

  • RQ1トップダウン型ポーズ情報は、人体パースングにおける部位セグメント提案の品質を顕著に向上させることができるか?
  • RQ2ポーズベースの幾何特徴とディープラーニングされた外観特徴を組み合わせることで、部位選択の正確性にどのような影響を与えるか?
  • RQ3パースングパイプラインの全段階にポーズの手がかりを統合することで、最終的なパースング性能がどの程度向上するか?
  • RQ4提案されたフレームワークは、標準評価プロトコルに従ってPenn-FudanのようなベンチマークデータセットでSOTA手法を上回ることができるか?
  • RQ5この手法の失敗モードは何か?また、それらはポーズ推定の誤差や視覚的曖昧性とどのように関連しているか?

主な発見

  • 提案手法はPenn-Fudanデータセットで平均mIoU 60.5%を達成し、前回SOTA手法(DDN)を4.3ポイント上回った。
  • FCN-16に比べて平均mIoUが10.3ポイント向上し、ポーズガイドドな最適化の有効性を示した。
  • 特に小さな細分化された部位(髪の毛:+13.0%、腕:+6.3%)で顕著な向上が見られ、ポーズガイドド提案による境界の正確な一致が裏付けられた。
  • 定性的な結果では、FCNに比べて四肢やアクセサリー(例:靴、腕)の局所的局所化が優れていることが示された。
  • 失敗事例は主に背景の物体との色の混同、複数人の隠蔽、照明の変動に起因しており、形状やコンテキストモデリングの改善が求められることが示された。
  • 1枚あたりの特徴抽出時間は6秒、AOGベースの構成時間は約1秒であり、妥当な推論効率を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。