Skip to main content
QUICK REVIEW

[論文レビュー] Attribute And-Or Grammar for Joint Parsing of Human Attributes, Part and Pose

Seyoung Park, Bruce Xiaohan Nie|arXiv (Cornell University)|May 6, 2016
Human Pose and Action Recognition参考文献 47被引用数 10
ひとこと要約

本稿では、階層的で解釈可能な解析グラフを用いて、人間のボディポーズ、パーツ位置特定、属性を同時に推論する属性および論理的構文木(A-AOG)モデルを提案する。フレーズ構造、従属構造、属性の文法を統合することで、パーツ、ポーズ、属性の間で一貫した同時推論が可能となり、複数人のいる複雑なシーンにおいても、ポーズ推定および属性予測の両タスクで最先端の性能を達成した。

ABSTRACT

This paper presents an attribute and-or grammar (A-AOG) model for jointly inferring human body pose and human attributes in a parse graph with attributes augmented to nodes in the hierarchical representation. In contrast to other popular methods in the current literature that train separate classifiers for poses and individual attributes, our method explicitly represents the decomposition and articulation of body parts, and account for the correlations between poses and attributes. The A-AOG model is an amalgamation of three traditional grammar formulations: (i) Phrase structure grammar representing the hierarchical decomposition of the human body from whole to parts; (ii) Dependency grammar modeling the geometric articulation by a kinematic graph of the body pose; and (iii) Attribute grammar accounting for the compatibility relations between different parts in the hierarchy so that their appearances follow a consistent style. The parse graph outputs human detection, pose estimation, and attribute prediction simultaneously, which are intuitive and interpretable. We conduct experiments on two tasks on two datasets, and experimental results demonstrate the advantage of joint modeling in comparison with computing poses and attributes independently. Furthermore, our model obtains better performance over existing methods for both pose estimation and attribute prediction tasks.

研究の動機と目的

  • ブラックボックス的で独立した分類器の限界を克服するため、人間のボディポーズ、パーツ、属性を明示的かつ解釈可能なモデルで同時に推論する手法の開発。
  • 順次パイプラインにおける誤差伝搬を解消するため、ポーズと属性の間で閉ループで繰り返し推論を行う仕組みの導入。
  • トップダウンおよびボトムアップの情報伝達を可能にする統一的なグラフィカル構造を用いて、属性とボディパーツの相関関係をモデル化。
  • パーツと属性の間の相互制約と一貫性を活用することで、ポーズ推定および属性予測の性能向上を図る。
  • 大規模なキーポイントアノテーションに依存するのを減らすため、より少ないが意味のあるパーツ表現を用いた同時推論を可能にする。

提案手法

  • A-AOGモデルは、フレーズ構造文法(階層的全体-部分分解用)、従属構造文法(ボディパーツの運動的接続構造用)、属性文法(パーツ間の外観の一貫性用)の3種類の文法を統合する。
  • 解析グラフは、青い辺で階層的分解、緑の辺でアーチクレーション(運動的構造)、赤い辺で属性(事後確率付き)を表す。
  • グローバル属性(例:性別、年齢)はノード間で共有され、複数のパーツから推論される。一方、ローカル属性(例:髪型)は特定のノードに束縛される。
  • 適合性項を介してパーツと属性の整合性を保つために、トップダウンおよびボトムアップのメッセージパッシングを用いたエネルギーに基づく推論を実施。
  • ORノードを介してパーツ提案と属性スコアを統合する確率的枠組みを用いて、解析グラフの尤度を最大化する形で同時推論を実行。
  • 部分検出のロバスト性を向上させるために、マルチスケールおよびマルチアスペクト比のアンカを用いた学習済みパーツ提案ネットワークを採用。

実験結果

リサーチクエスチョン

  • RQ1構成的文法を用いたポーズと属性の共同モデリングは、独立または逐次パイプラインと比較して性能向上をもたらすか?
  • RQ2属性の一貫性制約を組み込むことで、複数人のいる混雑なシーンにおけるポーズ推定性能はどのように向上するか?
  • RQ3属性文法を用いた階層的分解は、特にローカル属性に関して、予測精度をどの程度向上させるか?
  • RQ4繰り返しで閉ループな推論を可能にすることで、ポーズ推定の誤差が属性予測に伝搬されるのを防げるか?
  • RQ5属性を一貫性の事前知識として用いる場合、A-AOGは、大きなポーズ変化や隠蔽状態に対してもどの程度有効か?

主な発見

  • 共同A-AOGモデルは、ポーズ推定および属性予測の両タスクで最先端の性能を達成し、『People Attributes』および『Pedestrian Attribute』データセットにおいて、先行研究を上回った。
  • グランドトゥースのバウンディングボックスがなくても、ポーズに依存しない属性分類と比較して、平均平均精度(mAP)で2.6–2.7ポイントの向上を達成した。
  • 属性を除外した場合、ポーズ推定の精度が4.6ポイント低下した。これは、属性の一貫性がパーツの誤割り当てを低減する上で極めて重要であることを示している。
  • 属性の一貫性を活用することで、複数人のシーンにおける曖昧さを効果的に解消し、誤って異なる人物にパーツを割り当てるエラーを低減した。
  • 失敗事例の主な原因は、類似した属性を持つ複数人の人物であり、今後の研究ではより良いアイデンティティモデリングの必要性が浮き彫りになった。
  • 大規模なパーツ提案を多様なスケールとアスペクト比で用いることで、強力な一般化性能を示した。特に、200個のポーズレットのみを用いた手法と比較して優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。