Skip to main content
QUICK REVIEW

[論文レビュー] ViTPose++: Vision Transformer for Generic Body Pose Estimation

Yufei Xu, Jing Zhang|arXiv (Cornell University)|Dec 7, 2022
Human Pose and Action Recognition被引用数 6
ひとこと要約

本稿では、汎用的なボディポーズ推定のためのシンプルでありながら強力なビジョントランスフォーマーベースのモデル、ViTPoseおよびViTPose++を提案する。平滑で階層的でないビジョントランスフォーマーベースと軽量なデコーダーを活用することで、ViTPoseはMS COCOおよび複数のベンチマークで最先端の性能を達成する。一方、ViTPose++は知識因子化を用いて多様なボディタイプ間でのマルチタスク学習を可能にし、速度を犠牲にせずに新たな記録を樹立した。

ABSTRACT

In this paper, we show the surprisingly good properties of plain vision transformers for body pose estimation from various aspects, namely simplicity in model structure, scalability in model size, flexibility in training paradigm, and transferability of knowledge between models, through a simple baseline model dubbed ViTPose. Specifically, ViTPose employs the plain and non-hierarchical vision transformer as an encoder to encode features and a lightweight decoder to decode body keypoints in either a top-down or a bottom-up manner. It can be scaled up from about 20M to 1B parameters by taking advantage of the scalable model capacity and high parallelism of the vision transformer, setting a new Pareto front for throughput and performance. Besides, ViTPose is very flexible regarding the attention type, input resolution, and pre-training and fine-tuning strategy. Based on the flexibility, a novel ViTPose+ model is proposed to deal with heterogeneous body keypoint categories in different types of body pose estimation tasks via knowledge factorization, i.e., adopting task-agnostic and task-specific feed-forward networks in the transformer. We also empirically demonstrate that the knowledge of large ViTPose models can be easily transferred to small ones via a simple knowledge token. Experimental results show that our ViTPose model outperforms representative methods on the challenging MS COCO Human Keypoint Detection benchmark at both top-down and bottom-up settings. Furthermore, our ViTPose+ model achieves state-of-the-art performance simultaneously on a series of body pose estimation tasks, including MS COCO, AI Challenger, OCHuman, MPII for human keypoint detection, COCO-Wholebody for whole-body keypoint detection, as well as AP-10K and APT-36K for animal keypoint detection, without sacrificing inference speed.

研究の動機と目的

  • タスク固有のアーキテクチャ設計を施さずに、平滑なビジョントランスフォーマーベースが汎用的なボディポーズ推定にどの程度の可能性を秘めているかを調査すること。
  • トップダウンおよびボトムアップのポーズ推定の両方に対応できるスケーラブルで柔軟かつ転送可能なベースラインモデルを構築すること。
  • 統一されたトランスフォーマーアーキテクチャ内での知識因子化を用いて、人間や動物など多様なボディキーポイントカテゴリ間のマルチタスク学習を可能にすること。
  • シンプルな知識トークンを用いて、大規模モデルから小規模モデルへの知識蒸留の有効性を実証すること。
  • 20Mから1Bパラメータにまでモデル容量をスケーリングすることで、スループットと精度の新しいパレートフロントを確立すること。

提案手法

  • ViTPoseは、トップダウンまたはボトムアップのポーズ推定において、ヒートマップ回帰のための軽量なデコーダー(2層のデコンボリューションと予測ヘッドを備えた)と、平滑で階層的でないビジョントランスフォーマーベースをエンコーダーとして採用する。
  • ビジョントランスフォーマーベースは、マスク画像モデリング(例:MAE)を用いた事前学習により、強力な特徴初期化を提供する。
  • ViTPose++は、トランスフォーマーブロック内にタスク固有およびタスクに依存しない全結合ネットワーク(FFN)を導入し、異なるボディキーポイント検出タスク間での知識因子化を実現する。
  • ViTPose++における知識因子化は、混合エキスパート(MoE)にインspiredされており、異なるボディタイプに適した共有および固有の表現を学習可能である。
  • 知識トークンを用いて、大規模なViTPoseモデルから小規模なモデルへの知識転送を効率的に行う。
  • モデルは柔軟な入力解像度、アテンションタイプ、事前学習/微調整戦略をサポートしており、データセット間での適応性が向上する。

実験結果

リサーチクエスチョン

  • RQ1タスク固有のアーキテクチャ設計なしに、平滑なビジョントランスフォーマーベースがボディポーズ推定で最先端の性能を達成できるか?
  • RQ2ビジョントランスフォーマーのスケーラビリティが、ポーズ推定におけるモデルサイズ、スループット、精度のトレードオフに与える影響はいかほどか?
  • RQ3知識因子化を用いた統一されたトランスフォーマーベースモデルが、人間や動物など多様なボディキーポイントカテゴリを効果的に処理できるか?
  • RQ4シンプルな知識トークンを用いて、大規模なViTPoseモデルから小規模なモデルへの知識転送はどの程度可能か?
  • RQ5ViTPoseにおけるアテンションメカニズムおよび特徴表現は、遮蔽されたまたは極端なポーズに対応してどのように適応するか?

主な発見

  • 10億パラメータを有するViTPose-Gは、アンサンブルを用いない状態で、MS COCOテストデブセットにおいて80.9 APの新たな最先端の精度を達成した。
  • ViTPose++は、MS COCO、AI Challenger、OCHuman、MPII、COCO-Wholebody、AP-10K、APT-36Kなど、複数のベンチマークで最先端の性能を達成したが、推論速度に影響を与えない。
  • モデルは重度の遮蔽がかかる画像に対しても高い性能を維持し、ViTPose++-Bは可視部分に基づいて見えないキーポイントの位置を正しく推定した。
  • 可視化結果から、ターゲットキーポイントがマスクされても、ViTPose++はキーポイント位置に一貫した注目パターンを維持しており、関係性モデリングの強靭性を示している。
  • コサイン類似度解析により、より深い層におけるタスク固有のFFN重みは、タスク(例:人間対動物)間でより顕著に異なることが判明し、深い層がよりタスク固有の性質を持つことが示唆された。
  • スキーなど極端なポーズにおける失敗事例は、バックボーンの拡大と拡張データセットでの学習により緩和され、このアプローチのスケーラビリティが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。