Skip to main content
QUICK REVIEW

[論文レビュー] Not All Tokens Are Equal: Human-centric Visual Analysis via Token Clustering Transformer

Wang Zeng, Sheng Jin|arXiv (Cornell University)|Apr 19, 2022
Human Pose and Action Recognition被引用数 9
ひとこと要約

本論文では、段階的なクラスタリングを通じて形状・サイズが可変なトークンを動的に生成するビジョントランスフォーマー、Token Clustering Transformer (TCFormer) を提案する。本手法は、人体領域に対しては細かい解像度を、背景に対しては粗い解像度を焦点化することで、細部を保持する。本研究は、新たな Clustering Token Merge (CTM) ブロックと Multi-stage Token Aggregation (MTA) ヘッドを用いることで、全身ポーズ推定や3次元メッシュ再構築といった人間中心のタスクで最先端の性能を達成する。

ABSTRACT

Vision transformers have achieved great successes in many computer vision tasks. Most methods generate vision tokens by splitting an image into a regular and fixed grid and treating each cell as a token. However, not all regions are equally important in human-centric vision tasks, e.g., the human body needs a fine representation with many tokens, while the image background can be modeled by a few tokens. To address this problem, we propose a novel Vision Transformer, called Token Clustering Transformer (TCFormer), which merges tokens by progressive clustering, where the tokens can be merged from different locations with flexible shapes and sizes. The tokens in TCFormer can not only focus on important areas but also adjust the token shapes to fit the semantic concept and adopt a fine resolution for regions containing critical details, which is beneficial to capturing detailed information. Extensive experiments show that TCFormer consistently outperforms its counterparts on different challenging human-centric tasks and datasets, including whole-body pose estimation on COCO-WholeBody and 3D human mesh reconstruction on 3DPW. Code is available at https://github.com/zengwang430521/TCFormer.git

研究の動機と目的

  • 固定グリッドのビジョントランスフォーマーが、意味的重みに関係なく画像領域を均等に扱うという制限を解消すること。
  • 顔や手などの重要な人体領域に多くのトークンを割り当てると同時に、背景には少ないトークンを割り当てることを可能にすること。
  • 意味的コンテンツおよびタスク要件に基づいて、トークンの形状・サイズ・位置を動的に調整するトークン生成メカニズムを開発すること。
  • マルチスケール特徴統合中に空間的忠実性を損なわず、高解像度の細部を保持すること。
  • COCO-WholeBody や 3DPW といった人間中心のビジョンベンチマークで優れた性能を達成すること。

提案手法

  • TCFormer は最初の段階で、各ピクセルをビジョントークンとして初期化し、それぞれが1ピクセルの領域を表す。
  • 特徴に基づいて類似したトークンをグループ化する、k近傍法に基づく密度ピーククラスタリング(KNN-DPC)を適用する。
  • 同じクラスタに属するトークンは特徴の平均化により統合され、統合トークンの領域は入力領域の和集合となる。
  • 統合されたトークンはトランスフォーマーブロックを経て処理され、非長方形かつ不規則な形状の領域間でも長距離の注意を可能にする。
  • マルチスケールの特徴を統合し、ピクセルに一致する特徴マップを再構築するために、マルチステージ・トークンアグリゲーション(MTA)ヘッドが段階的にトークンをアップサンプリングし、全段階の特徴を統合する。
  • MTA ヘッドにより、各ピクセルが一意のトークンに対応し、固定グリッド変換における重複トークンによる特徴損失を回避する。

実験結果

リサーチクエスチョン

  • RQ1固定グリッドのトークン化と比較して、動的かつ非一様なトークン生成は、人間中心のビジョンタスクの性能向上に寄与するか?
  • RQ2ビジョントークンの段階的クラスタリングは、顔や手のような重要な身体部位における細粒度の細部の保持にどのように影響するか?
  • RQ3提案された Clustering Token Merge (CTM) ブロックは、標準の平均プーリングや固定グリッド手法と比較して、特徴表現をどの程度向上させるか?
  • RQ4マルチスケール特徴統合中に、マルチステージ・トークンアグリゲーション(MTA)ヘッドは空間的細部を効果的に保持しているか?
  • RQ5TCFormer は、顔と手のキーポイント検出といったタスク固有の優先順位に応じて、トークンの分布を適応的に調整できるか?

主な発見

  • COCO-WholeBody において、TCFormer は全身ポーズ推定で 58.7 AP を達成し、ベースラインより 2.1 AP 高い性能を示した。
  • 3DPW では、3次元人体メッシュ再構築で 28.6 の平均 MPJPE を達成し、ベースラインより 1.8 の改善を示した。
  • CTM ブロックにより、細部の保持が向上:粗いトークンを使用した場合でも、手のAPはたったの 5.6% 減少し、顔のAPは 13.6% 減少にとどまった。
  • MTA ヘッドをデコンボリューションヘッドに置き換えると、足のキーポイント検出で 4.0% のAP低下が生じ、MTA の細部保持能力を示している。
  • 定性的な分析から、TCFormer は顔や手のような高細部領域に細かいトークンを割り当てており、顔 vs 手キーポイント検出のための訓練済みモデルでは、タスクに応じた適応的なトークン分布が得られていることが確認された。
  • 本手法は、ビジョントランスフォーマーにおける動的ビジョントークン生成にクラスタリングを初めて適用し、柔軟で意味的認識型のトークン形状・サイズを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。