[論文レビュー] TokenPose: Learning Keypoint Tokens for Human Pose Estimation
TokenPoseは、人間のキーポイントを学習可能なトークンとして表現する、トランスフォーマーに基づく新規フレームワークを導入し、視覚的外観と解剖学的制約関係を明示的にモデル化する。視覚的トークンとキーポイントトークンの両方に同時に注目することで、従来のCNNベースのモデルと比較して80.6%少ないパラメータと75.3%少ないFLOPsでCOCOで最先端の精度を達成した。
Human pose estimation deeply relies on visual clues and anatomical constraints between parts to locate keypoints. Most existing CNN-based methods do well in visual representation, however, lacking in the ability to explicitly learn the constraint relationships between keypoints. In this paper, we propose a novel approach based on Token representation for human Pose estimation~(TokenPose). In detail, each keypoint is explicitly embedded as a token to simultaneously learn constraint relationships and appearance cues from images. Extensive experiments show that the small and large TokenPose models are on par with state-of-the-art CNN-based counterparts while being more lightweight. Specifically, our TokenPose-S and TokenPose-L achieve $72.5$ AP and $75.8$ AP on COCO validation dataset respectively, with significant reduction in parameters ($\downarrow80.6\%$; $\downarrow$ $56.8\%$) and GFLOPs ($\downarrow$ $75.3\%$; $\downarrow$ $24.7\%$). Code is publicly available.
研究の動機と目的
- キーポイント間の解剖学的制約関係を明示的にモデル化できないCNNベースのポーズ推定器の限界を解決すること。
- 視覚的外観と構造的制約学習を、1つの微分可能フレームワーク内で統合すること。
- 事前学習を伴わない純粋なトランスフォーマーアーキテクチャが2次元人体ポーズ推定に適用可能かどうかを検証すること。
- パフォーマンスを維持または向上させながら、モデルの複雑さと計算コストを低減すること。
提案手法
- 各キーポイントは、自己注意およびクロス注意を介して視覚的トークンと他のキーポイントトークンに注目する、学習可能なクラス固有のトークンとして表現される。
- 視覚的トークンは、入力画像をパッチに分割し、それらを固定次元の埋め込みに変換することで生成される。
- モデルは、視覚的トークンとキーポイントトークンの間の相互作用を処理するために、ハイブリッドまたは純粋なトランスフォーマーエンコーダアーキテクチャを使用する。
- キーポイントトークンはランダムなパラメータとして初期化され、トレーニング中に同時に最適化され、関節間の統計的関係を符号化する。
- 最終的なキーポイント位置は、キーポイントトークンの最終的表現に基づいて視覚的トークンに注目することで予測される。
- 最終的な自己注意層からの注目重みを可視化し、隣接関係や対称性などの制約がどのように学習されたかを分析した。
実験結果
リサーチクエスチョン
- RQ1学習可能なキーポイントトークンは、自己教師ありの方法で関節間の解剖学的制約関係を効果的にモデル化できるか?
- RQ2キーポイントトークンと視覚的トークンの相互作用は、ポーズ推定の精度をどのように向上させるか?
- RQ3事前学習を伴わない純粋なトランスフォーマーアーキテクチャは、2次元人体ポーズ推定で競争力のある性能を達成できるか?
- RQ4モデルは、SOTAの精度を維持しつつ、どの程度パラメータ数とFLOPsを削減できるか?
主な発見
- TokenPose-Sは、最先端のCNNモデルと比較して80.6%少ないパラメータと75.3%少ないFLOPsで、COCO検証セットで72.5 APを達成した。
- TokenPose-Lは、COCOで75.8 APを達成し、多くのより大きなCNNベースのモデルを上回ったが、パラメータを56.8%、FLOPsを24.7%削減した。
- モデルは意味のある事前知識を学習している:キーポイントトークンは、隣接する関節や対称的な関節と高い類似性を示しており、注目スコアと内積行列によって確認された。
- 可視化結果から、キーポイントトークンが段階的に関連する体部(例:足首に対しては膝)に注目し、遮蔽されたキーポイントの予測に対称的な関節をヒントとして使用していることがわかった。
- 事前学習を伴わない純粋なトランスフォーマーに基づくTokenPose-Tは、競争力ある性能を達成しており、トークンベースの設計の有効性を示した。
- 注目メカニズムの分析から、制約学習がキーポイントトークンに暗黙的に符号化されており、上位2つの注目ヘッドの多くが隣接関節や対称関節に対応していることがわかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。