Skip to main content
QUICK REVIEW

[論文レビュー] Pose Recognition with Cascade Transformers

Ke Li, Shijie Wang|arXiv (Cornell University)|Apr 14, 2021
Human Pose and Action Recognition参考文献 39被引用数 7
ひとこと要約

本稿では、段階的トランスフォーマーを用いたエンドツーエンドの回帰ベースの2次元人体ポーズ推定手法であるPose Regression Transformers (PRTR) を提案する。マルチスケール特徴とクエリベースの精錬をデコーダ層全体に渡って適用することで、ヒートマップベースの手法に比べて最小限のヒューリスティック設計で、COCOデータセット上で回帰ベース手法の最先端性能を達成し、クエリ可視化による解釈性の向上も図った。

ABSTRACT

In this paper, we present a regression-based pose recognition method using cascade Transformers. One way to categorize the existing approaches in this domain is to separate them into 1). heatmap-based and 2). regression-based. In general, heatmap-based methods achieve higher accuracy but are subject to various heuristic designs (not end-to-end mostly), whereas regression-based approaches attain relatively lower accuracy but they have less intermediate non-differentiable steps. Here we utilize the encoder-decoder structure in Transformers to perform regression-based person and keypoint detection that is general-purpose and requires less heuristic design compared with the existing approaches. We demonstrate the keypoint hypothesis (query) refinement process across different self-attention layers to reveal the recursive self-attention mechanism in Transformers. In the experiments, we report competitive results for pose recognition when compared with the competing regression-based methods.

研究の動機と目的

  • ヒートマップベースのポーズ推定手法が非微分可能でヒューリスティックな前処理・後処理に依存するという限界を是正すること。
  • アーキテクチャの複雑さを低減しつつ、一般化可能なエンドツーエンドの回帰ベース手法として、多人数の2次元人体ポーズ推定を実現すること。
  • デコーダ層全体にわたるクエリの精錬を可視化することで、トランスフォーマーの内部メカニズムがキーポoinト検出にどのように寄与するかを解明すること。
  • トレーニング目的や損失関数の計算の透明性を保ちながら、既存の回帰ベース手法と同等以上の性能を達成すること。

提案手法

  • DETRフレームワークに基づく2段階の段階的トランスフォーマー構造を提案:人物検出用トランスフォーマーとキーポイント検出用トランスフォーマーの2段階。
  • 空間変換ネットワーク(STN)を用いたエンドツーエンドの逐次的バージョンを導入し、バウンディングボックスの予測とキーポイントクエリの精錬を同時に実行。
  • キーポイント検出用トランスフォーマーで学習可能なオブジェクトクエリを採用し、17個のキーポイント座標を直接予測。アテンション層ではクラス固有のクエリ特化が観察された。
  • キーポイント検出ヘッドでマルチスケール特徴の統合を実施し、異なるオブジェクトサイズにおける局所化精度の向上を図った。
  • ハンガリアンマッチャーを用い、信頼度ベースのマッチングを実施。推論時には背景クラスのログティスを除外することで、候補の多様性を向上。
  • デコーダ層全体にわたるクエリ分布と精錬軌跡を可視化し、再帰的自己アテンションメカニズムと空間的精錬の進行を明らかにした。

実験結果

リサーチクエスチョン

  • RQ1段階的トランスフォーマー構造は、複雑なヒートマップベースの後処理ヒューリスティクスを排除しつつ、競争力のあるポーズ推定精度を達成できるか?
  • RQ2トランスフォーマーのデコーダでオブジェクトクエリはどのようにならびに進化し、ランダム初期化から正確な局所化へとどのように精錬されるか?
  • RQ3直接座標回帰を用いたエンドツーエンド学習は、既存の回帰ベース手法と比較して、精度および一般化性能において優れているか、同等か?
  • RQ4Flip増強の導入は、ヒートマップベースのパラダイムと比較して、回帰ベースのトランスフォーマー枠組みにおいて性能にどのように影響を与えるか?
  • RQ5デコーダにおけるクエリベースのアテンションメカニズムは、特定のキーポイントクラスに自然に特化することができ、その特化は空間的アテンションパターンとどのように関連するか?

主な発見

  • PRTRは2段階の段階的設計を用いてCOCO val2017で73.2%のAPを達成し、他の回帰ベース手法を上回り、ヒートマップベースの最先端手法に近づいた。
  • 推論時に背景クラスのログティスを除外することでAPが0.9–1.5ポイント向上した。これは背景干渉がマッチング品質を低下させることを示唆している。
  • Flipテストは一貫して性能向上をもたらし、ヒートマップベースモデルとは異なり、連続的な座標空間のためアライメントエラーが生じない。
  • オラクル結果では、予測された人物バウンディングボックスを真値に置き換えることでAPが2.0–2.5ポイント向上した。これは人物検出部分に改善の余地があることを示している。
  • 可視化により、89番目のクエリの92.3%が鼻キーポイントを予測しており、特定のキーポイントクラスに対する強いクエリ特化が確認された。
  • クエリ予測はデコーダ層を経るごとにランダム初期位置から徐々に正確な位置へと進化し、すでに真値に近い場合は変化が最小限に抑えられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。