[論文レビュー] Group Pose: A Simple Baseline for End-to-End Multi-person Pose Estimation
Group Pose は、複雑なデコーダーの代わりに、インスタンス内および同種のインスタンス間の相互作用を分離する二重グループ自己注意メカニズムを用いた、シンプルで効果的なトランスフォーマー基盤フレームワークを提案する。これは、人間のボックス監視なしで MS COCO で 72.0 の SOTA AP を達成し、より複雑な設計を用いた先行手法を上回る性能を発揮する。
In this paper, we study the problem of end-to-end multi-person pose estimation. State-of-the-art solutions adopt the DETR-like framework, and mainly develop the complex decoder, e.g., regarding pose estimation as keypoint box detection and combining with human detection in ED-Pose, hierarchically predicting with pose decoder and joint (keypoint) decoder in PETR. We present a simple yet effective transformer approach, named Group Pose. We simply regard $K$-keypoint pose estimation as predicting a set of $N imes K$ keypoint positions, each from a keypoint query, as well as representing each pose with an instance query for scoring $N$ pose predictions. Motivated by the intuition that the interaction, among across-instance queries of different types, is not directly helpful, we make a simple modification to decoder self-attention. We replace single self-attention over all the $N imes(K+1)$ queries with two subsequent group self-attentions: (i) $N$ within-instance self-attention, with each over $K$ keypoint queries and one instance query, and (ii) $(K+1)$ same-type across-instance self-attention, each over $N$ queries of the same type. The resulting decoder removes the interaction among across-instance type-different queries, easing the optimization and thus improving the performance. Experimental results on MS COCO and CrowdPose show that our approach without human box supervision is superior to previous methods with complex decoders, and even is slightly better than ED-Pose that uses human box supervision. $\href{https://github.com/Michel-liu/GroupPose-Paddle}{ m Paddle}$ and $\href{https://github.com/Michel-liu/GroupPose}{ m PyTorch}$ code are available.
研究の動機と目的
- 複雑なデコーダーを軽量でクエリベースのトランスフォーマー設計に置き換えることで、エンドツーエンドの多人数ポーズ推定を単純化すること。
- 標準的な自己注意のうち、役に立たない異種間クエリ相互作用を排除することで、最適化と性能を向上させること。
- 人間検出の監視なしでも高い推論速度を維持しながら、強力な精度を達成すること。
- 単体で使用可能であるか、人間検出ヘッドと統合可能な柔軟で拡張可能なベースラインを提供すること。
提案手法
- 本手法は、$N \times K$ 個のキーポイントクエリと $N$ 個のインスタンスクエリを用い、各 $N$ 個の人体ポーズを $K$ 個のキーポイントで予測する。
- 標準的なデコーダー自己注意を、二段階のグループ自己注意に置き換える:(i) $K$ 個のキーポイントクエリと1つのインスタンスクエリを用いた $N$ 個のインスタンス内自己注意、および (ii) 同じ種類の $N$ 個のクエリを用いた $(K+1)$ 個のインスタンス間自己注意。
- この設計により、各人物内の運動学的関係を明示的にモデル化し、インスタンス間で重複する予測を集約するが、生産性の低い異種間相互作用を回避する。
- 非微分可能な後処理を必要とせず、標準的なトランスフォーマー損失を用いてエンドツーエンドで学習する。
- 単体学習と、初期化の向上を目的とした人間検出デコーダーとの統合の両方をサポートする。
- Paddle および PyTorch での実装が可能であり、コードは公開済み。
実験結果
リサーチクエスチョン
- RQ1エンドツーエンドの多人数ポーズ推定において、より単純なトランスフォーマー・デコーダー設計が、複雑なマルチヘッドデコーダーを上回ることができるか?
- RQ2自己注意における異種間クエリ相互作用を排除することで、最適化と性能が向上するか?
- RQ3クエリベースのアプローチが、人間のボックス監視なしで SOTA の結果を達成できるか?
- RQ4本モデルの推論速度は、既存のエンドツーエンドフレームワークと比較してどうか?
- RQ5インスタンスクエリの初期化が収束性と精度に与える影響は何か?
主な発見
- Group Pose は、ResNet-50 を用いて MS COCO val2017 で 72.0 AP を達成し、人間のボックス監視を用いる ED-Pose を上回った。
- Swin-Large バックボーンを用いることで、Group Pose は MS COCO で 74.8 AP を達成し、大規模モデルでも優れた性能を示した。
- 1枚の A100 GPU で、480×800 解像度では 68.6 FPS、800×1333 解像度では 31.3 FPS のリアルタイム推論速度を達成した。
- アブレーションスタディの結果、異種間相互作用を排除することで最適化が向上し、人間検出デコーダーを搭載しない状態でも、ED-Pose よりも収束が早く、より高い精度を達成した。
- 人間検出の初期化により収束性が向上し、60エポックで 72.2 AP まで性能が向上した。
- 100個の人体インスタンスで十分であり、200個に増やしても顕著な向上が得られなかったため、インスタンス数の点で本モデルの効率性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。