Skip to main content
QUICK REVIEW

[論文レビュー] Seeing the Pose in the Pixels: Learning Pose-Aware Representations in Vision Transformers

Dominick Reilly, Aman Chadha|arXiv (Cornell University)|Jun 15, 2023
Human Pose and Action Recognition被引用数 4
ひとこと要約

本稿では、ビデオ理解のためのビジョントランスフォーマーにおけるポーズに配慮した表現を学習する2つの新規手法—Pose-aware Attention Block (PAAB) および Pose-Aware Auxiliary Task (PAAT)—を提案する。2次元ポーズキーポイントをViTアーキテクチャに統合することで、両手法はアクション認識およびマルチビュー動画アライメントの性能を向上させ、PAATは7つのデータセットでSOTAを達成し、ロボットビデオアライメントでベースラインモデルを最大21.8%、実世界のアクション認識で9.8%向上させる。

ABSTRACT

Human perception of surroundings is often guided by the various poses present within the environment. Many computer vision tasks, such as human action recognition and robot imitation learning, rely on pose-based entities like human skeletons or robotic arms. However, conventional Vision Transformer (ViT) models uniformly process all patches, neglecting valuable pose priors in input videos. We argue that incorporating poses into RGB data is advantageous for learning fine-grained and viewpoint-agnostic representations. Consequently, we introduce two strategies for learning pose-aware representations in ViTs. The first method, called Pose-aware Attention Block (PAAB), is a plug-and-play ViT block that performs localized attention on pose regions within videos. The second method, dubbed Pose-Aware Auxiliary Task (PAAT), presents an auxiliary pose prediction task optimized jointly with the primary ViT task. Although their functionalities differ, both methods succeed in learning pose-aware representations, enhancing performance in multiple diverse downstream tasks. Our experiments, conducted across seven datasets, reveal the efficacy of both pose-aware methods on three video analysis tasks, with PAAT holding a slight edge over PAAB. Both PAAT and PAAB surpass their respective backbone Transformers by up to 9.8% in real-world action recognition and 21.8% in multi-view robotic video alignment. Code is available at https://github.com/dominickrei/PoseAwareVT.

研究の動機と目的

  • 日常の動画における微細な、ビューポイントに依存する動きを処理する従来のビジョントランスフォーマーの限界を、ポーズの事前知識を組み込むことで克服すること。
  • 標準的なViTが人間の骨格やロボットアームなどのポーズベースのエンティティを無視する均一なパッチ処理に起因する欠点を是正すること。
  • 深度センサーや複雑な3次元ポーズ推定を必要とせず、2次元キーポイント情報を取り込む効率的で即挿し可能な手法を開発すること。
  • トレーニング中にポーズ情報を活用することで、ビューポイントに依存しない、細分化された動画表現学習を可能にすること。
  • アクション認識、動画検索、マルチビューのロボットビデオアライメントを含む多様な下流タスクへの一般化を実証すること。

提案手法

  • 2次元キーポイントのヒートマップを用いて特定されたポーズ関連パッチに局所的自己注意を適用する、即挿し可能なViTブロックであるPose-aware Attention Block (PAAB) を導入する。
  • トレーニング中に別個のヘッドが2次元キーポイントの位置を予測する多タスク学習戦略であるPose-Aware Auxiliary Task (PAAT) を設計し、主タスク(動画分類やアライメント)と同時に最適化する。
  • MediaPipeなどの容易に入手可能な2次元ポーズ推定モデルを活用し、PAABおよびPAATの両者に正確で低コストのキーポイント監視を提供する。
  • 元のViTアーキテクチャおよびトレーニングパイプラインを維持し、わずかな変更のみを加える:PAABではポーズに配慮した注意メカニズムを追加し、PAATでは補助損失を追加する。
  • ポーズ監視をパッチレベルで適用することで、ポーズ特徴と非ポーズ特徴の間の分離された表現学習を可能にする。
  • アブレーションスタディにより、注意分布の変化が最小限であることが示されたことから、フィードフォワード層がポーズに配慮した表現学習の主な担い手であると判明した。

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマーに2次元ポーズキーポイント情報を統合することで、微細な動きやビューポイントに依存する動きを含む動画理解タスクの性能が向上するか?
  • RQ2ViTにポーズの事前知識を組み込むことで、標準的なViTと比較して、より分離され、ビューポイントに依存しない特徴表現が得られるか?
  • RQ3注意機構とフィードフォワード層のどちらが、ViTにおけるポーズに配慮した表現学習に寄与しているか?
  • RQ4ポーズに配慮したViTの性能は、アクション認識やマルチビュー動画アライメントなどの多様なデータセットおよび下流タスクにどのように一般化されるか?
  • RQ5アーキテクチャ的変更(PAAB)と比較して、補助的ポーズ予測タスク(PAAT)は、ViTにおけるポーズに配慮した特徴学習に効果的か?

主な発見

  • PAATは7つのデータセットでSOTAを達成し、マルチビューのロボットビデオアライメントでベースラインViTを最大21.8%、実世界のアクション認識で9.8%上回る。
  • PAABおよびPAATの両方とも、特徴空間におけるポーズトークンと非ポーズトークンの分離性を顕著に向上させ、PAATはキーポイントに特化した予測目的のおかげで優れた分離性を示す。
  • PAABおよびPAATの注意分布は、ベースラインのTimeSformerと比較してほとんど変化していないことから、ポーズに配慮した表現は主にフィードフォワード層で学習されていることが示された。
  • PAATはネットワークの初期層でより高い有効性を示しており、初期の特徴抽象化段階でポーズの事前知識が最も有益であることが示唆された。
  • PAATはメインViTに追加のパラメータや推論計算を必要としないため、専用の注意ブロックを追加するPAABよりも効率的である。
  • 提案手法はタスクおよびデータセットの多様性にわたって良好に一般化され、動画検索のクロスデータ評価においても確認されたことから、その頑健性と転送可能性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。