Skip to main content
QUICK REVIEW

[論文レビュー] QueryPose: Sparse Multi-Person Pose Regression via Spatial-Aware Part-Level Query

Yabo Xiao, Kai Su|arXiv (Cornell University)|Dec 15, 2022
Human Pose and Action Recognition被引用数 9
ひとこと要約

QueryPoseは、画像からキーポイント座標を直接回帰する空間的留意型パーツレベルクエリを用いたスパースでエンドツーエンドの多人数ポーズ推定フレームワークを提案する。ヒートマップの密度を排除し、手作業による後処理を不要にする。空間的パーツ埋め込み生成モジュール(SPEGM)と選択的イテレーションモジュール(SIM)を導入することで、MS COCO mini-valで73.6 AP、CrowdPoseで72.7 APという最先端の性能を達成した。

ABSTRACT

We propose a sparse end-to-end multi-person pose regression framework, termed QueryPose, which can directly predict multi-person keypoint sequences from the input image. The existing end-to-end methods rely on dense representations to preserve the spatial detail and structure for precise keypoint localization. However, the dense paradigm introduces complex and redundant post-processes during inference. In our framework, each human instance is encoded by several learnable spatial-aware part-level queries associated with an instance-level query. First, we propose the Spatial Part Embedding Generation Module (SPEGM) that considers the local spatial attention mechanism to generate several spatial-sensitive part embeddings, which contain spatial details and structural information for enhancing the part-level queries. Second, we introduce the Selective Iteration Module (SIM) to adaptively update the sparse part-level queries via the generated spatial-sensitive part embeddings stage-by-stage. Based on the two proposed modules, the part-level queries are able to fully encode the spatial details and structural information for precise keypoint regression. With the bipartite matching, QueryPose avoids the hand-designed post-processes and surpasses the existing dense end-to-end methods with 73.6 AP on MS COCO mini-val set and 72.7 AP on CrowdPose test set. Code is available at https://github.com/buptxyb666/QueryPose.

研究の動機と目的

  • 密度的なエンドツーエンド多人数ポーズ推定における複雑で微分不能な後処理手順を排除すること。
  • インスタンスレベルクエリの限界を是正し、キーポイント回帰における局所的空間的特徴と構造的情報を捉えること。
  • 空間的構造と局所的特徴を保持するスパースで学習可能なクエリベースのフレームワークを構築し、キーポイントの局所化精度を向上させること。
  • スパースクエリベースの回帰が、密度的ヒートマップベースの手法を上回ることを示すこと。
  • 補助的ヒートマップ監視に依存せずに、混雑したシーンや複雑な状況においても空間的留意型パーツレベルクエリの有効性を検証すること。

提案手法

  • 局所的空間的特徴と構造的コンテキストを符号化できるように、反復的に学習・更新される空間的留意型パーツレベルクエリを導入する。
  • 特徴マップから空間的感受性のあるパーツ埋め込みを生成するため、局所的空間的アテンションを用いる空間的パーツ埋め込み生成モジュール(SPEGM)を提案する。
  • 生成された空間的感受性のある埋め込みを用いて、段階的にパーツレベルクエリを適応的に精緻化する選択的イテレーションモジュール(SIM)を採用する。
  • 非微分可能な後処理(例:NMS)を回避するため、エンドツーエンドの学習と推論に二部マッチングを用いる。
  • クエリの精緻化と回帰に特化したトランスフォーマーベースのバックボーン(例:Swin-Large または HRNet-W48)を活用する。
  • 中間のヒートマップを経由せずに、完全に微分可能な形でモデルを学習し、キーポイント座標を直接回帰可能にする。

実験結果

リサーチクエスチョン

  • RQ1スパースで学習可能なクエリベースのフレームワークは、多人数ポーズ推定における密度的ヒートマップ表現を効果的に置き換えられるか?
  • RQ2空間的留意型のパーツレベルクエリは、インスタンスレベルクエリに比べて局所的詳細や構造的関係をよりよく捉えられるか?
  • RQ3提案されたSPEGMとSIMモジュールの組み合わせは、既存のエンドツーエンド手法と比較してキーポイント局所化精度を向上させるか?
  • RQ4補助的ヒートマップ監視なしに、スパース回帰フレームワークは密度的エンドツーエンド手法を上回るか?
  • RQ5NMSベースの密度的手法と比較して、スパースクエリアプローチは混雑したシーンでどのように性能を発揮するか?

主な発見

  • QueryPoseはMS COCO mini-valセットで73.6 APを達成し、既存のすべての密度的エンドツーエンド手法を上回った。
  • CrowdPoseテストセットでは72.7 APを達成し、現在の最先端エンドツーエンド手法を上回った。
  • HRNet-W48を用いた場合72.1 AP、Swin-Largeを用いた場合72.7 APを達成し、混雑したシーンにおける優れた汎化性能を示した。
  • 他の回帰ベース手法とは異なり、学習中にオンラインで補助的ヒートマップ学習を実施しないが、依然として高い性能を発揮した。
  • アブレーションスタディにより、SPEGMとSIMモジュールが空間的詳細の捉え込みとキーポイント精度の向上に不可欠であることが確認された。
  • スパースパラダイムにより、NMSによる重複キーポイントやインスタンスの削除といった問題が回避された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。