Skip to main content
QUICK REVIEW

[論文レビュー] Differentiable Hierarchical Graph Grouping for Multi-Person Pose Estimation

Sheng Jin, Wentao Liu|arXiv (Cornell University)|Jul 23, 2020
Human Pose and Action Recognition参考文献 51被引用数 15
ひとこと要約

本稿では、下位互換の多人数ポーズ推定のための、エンドツーエンドで学習可能な新規フレームワークである微分可能な階層的グラフグループ化(HGG)を提案する。キーポイントグループ化を微分可能なグラフクラスタリング問題に再定式化することで、COCOおよびOCHumanデータセットにおいて非微分可能なベースラインよりも顕著に精度を向上させる。

ABSTRACT

Multi-person pose estimation is challenging because it localizes body keypoints for multiple persons simultaneously. Previous methods can be divided into two streams, i.e. top-down and bottom-up methods. The top-down methods localize keypoints after human detection, while the bottom-up methods localize keypoints directly and then cluster/group them for different persons, which are generally more efficient than top-down methods. However, in existing bottom-up methods, the keypoint grouping is usually solved independently from keypoint detection, making them not end-to-end trainable and have sub-optimal performance. In this paper, we investigate a new perspective of human part grouping and reformulate it as a graph clustering task. Especially, we propose a novel differentiable Hierarchical Graph Grouping (HGG) method to learn the graph grouping in bottom-up multi-person pose estimation task. Moreover, HGG is easily embedded into main-stream bottom-up methods. It takes human keypoint candidates as graph nodes and clusters keypoints in a multi-layer graph neural network model. The modules of HGG can be trained end-to-end with the keypoint detection network and is able to supervise the grouping process in a hierarchical manner. To improve the discrimination of the clustering, we add a set of edge discriminators and macro-node discriminators. Extensive experiments on both COCO and OCHuman datasets demonstrate that the proposed method improves the performance of bottom-up pose estimation methods.

研究の動機と目的

  • エンドツーエンド学習と最適な特徴学習を妨げる非微分可能なグループ化の制限を解消すること。
  • 学習可能な微分可能なグラフベースのフレームワークを通じて、クラスタリングプロセスへの直接的監視によりグループ化精度を向上させること。
  • 適応的グラフ構造を通じて、人物数やキーポイントインスタンス数の可変性を柔軟に処理できること。
  • エッジおよびマクロノード識別器を導入することで、ボディパーツ間の関係性をより良く識別し、関係特徴の学習を強化すること。
  • アーキテクチャの大幅な見直しが不要なため、主流の下位互換ポーズ推定パイプラインにスムーズに統合できること。

提案手法

  • キーポイント候補をノードとし、同じ人物のキーポイント間の潜在的関連性をエッジとするグラフクラスタリングタスクにキーポイントグループ化を再定式化する。
  • 最も信頼性の高いキーポイントペアを段階的にマージすることでクラスタを形成する、オンライン階層的グラフクラスタリング(OHGC)アルゴリズムを提案する。これにより、部品から全身までのポーズ階層が構築される。
  • ノード表現およびクラスタ割り当てを精緻化するための階層的メッセージパッシングを実行する多層グラフニューラルネットワーク(GNN)を設計する。
  • 局所的キーポイント関係性を強化するためのエッジ識別器と、クラスタ間のグローバル一貫性を強制するためのマクロノード識別器を導入する。
  • グループ化プロセス全体を微分可能にすることで、グループ化損失のバックプロパゲーションがキーポイント検出ネットワークにまで伝搬され、共同最適化が可能になる。
  • 最大の接続性とパフォーマンスを実現するため、完全結合グラフ構造を採用し、グラフ構成に関するアブレーションで妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1下位互換ポーズ推定におけるキーポイントグループ化を、完全に微分可能かつエンドツーエンドで学習可能にできるか?
  • RQ2グラフベースのフレームワークにおける階層的メッセージパッシングは、標準的なGNNや後処理クラスタリングと比較して、グループ化精度をどのように向上させるか?
  • RQ3エッジおよびマクロノード識別器の導入が、関係特徴学習およびグループ化パフォーマンスに与える影響は何か?
  • RQ4学習可能なグラフクラスタリング機構は、非微分可能なヒューリスティックベースのグループ化を、実世界のベンチマークで上回ることができるか?
  • RQ5提案手法は、遮蔽や小規模な人物インスタンスなどの困難なシナリオにも一般化可能か?

主な発見

  • HGGはCOCOテストデブセットで67.6のAPを達成し、非エンドツーエンド手法を上回り、特に高いIoU閾値(AP 75)での性能が優れていることから、精度の向上が確認された。
  • より挑戦的なOCHumanデータセットでは、バリデーションセットで41.8%のmAP、テストセットで36.0%のmAPを達成し、新たなSOTAを樹立した。
  • OCHumanテストセットにおいて、トップダウン手法SBLを2.7 AP上回り、困難なシナリオでも高いロバスト性を示した。
  • 完全結合グラフ構成が最良のパフォーマンス(60.4% mAP)を示し、木構造、バイパス構造、拡張構造を上回ったが、実行時間のオーバーヘッドは最小限であった。
  • グループ化モジュールは総推論時間のわずかな割合にとどまり、複雑さにもかかわらず効率的であることが確認された。
  • 可視化結果から、OHGCアルゴリズムが段階的にボディパーツを統合して全身ポーズを形成するポーズ階層を構築していることが確認され、グローバル一貫性学習を支援することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。