Skip to main content
QUICK REVIEW

[論文レビュー] HAP: Structure-Aware Masked Image Modeling for Human-Centric Perception

Junkun Yuan, Xinyu Zhang|arXiv (Cornell University)|Oct 31, 2023
Video Surveillance and Tracking Methods被引用数 5
ひとこと要約

HAPは、人体部位の事前知識を用いてマスクのサンプリングを誘導し、構造的整合性を保証する構造不変アライメント損失を用いる、人間中心の認識のための構造に配慮したマスク画像モデリングフレームワークを導入する。シンプルなビジョントランスフォーマーを用いて、11の人体中心ベンチマークで最先端の性能を達成し、人物再識別のMSMT17では78.1%のmAP、歩行者属性認識のPA-100Kでは86.54%のmAを達成する。

ABSTRACT

Model pre-training is essential in human-centric perception. In this paper, we first introduce masked image modeling (MIM) as a pre-training approach for this task. Upon revisiting the MIM training strategy, we reveal that human structure priors offer significant potential. Motivated by this insight, we further incorporate an intuitive human structure prior - human parts - into pre-training. Specifically, we employ this prior to guide the mask sampling process. Image patches, corresponding to human part regions, have high priority to be masked out. This encourages the model to concentrate more on body structure information during pre-training, yielding substantial benefits across a range of human-centric perception tasks. To further capture human characteristics, we propose a structure-invariant alignment loss that enforces different masked views, guided by the human part prior, to be closely aligned for the same image. We term the entire method as HAP. HAP simply uses a plain ViT as the encoder yet establishes new state-of-the-art performance on 11 human-centric benchmarks, and on-par result on one dataset. For example, HAP achieves 78.1% mAP on MSMT17 for person re-identification, 86.54% mA on PA-100K for pedestrian attribute recognition, 78.2% AP on MS COCO for 2D pose estimation, and 56.0 PA-MPJPE on 3DPW for 3D pose and shape estimation.

研究の動機と目的

  • マスク画像モデリング(MIM)が人間中心の認識タスクの事前学習パラダイムとして有効であるかを調査すること。
  • 標準的なMIMが人間中心の文脈で示す限界を特定し、人体構造の事前知識が性能向上に果たす役割を理解すること。
  • 人体部位の事前知識をマスクサンプリングプロセスに統合することで、事前学習中の構造的理解を向上させる、シンプルだが効果的な手法を開発すること。
  • 同じ画像の異なるマスクビュー間の一貫性を保つことで特徴の識別性を向上させる、構造不変アライメント損失を設計すること。
  • 単一の統一されたデータセットとシンプルなViTアーキテクチャを用いて、多様な人間中心のビジョンタスクに適応可能でスケーラブルかつ効率的な事前学習フレームワークを確立すること。

提案手法

  • 既存のキーポイント検出器を用いて抽出した人体部位の事前知識を、マスクサンプリングプロセスを誘導する。特に、人体部位領域内の画像パッチをマスクの優先対象とする。
  • 標準的なマスク画像モデリングの目的関数を採用し、可視なコンテキストを用いてマスクされたパッチを再構築する。再構築は意味的に意味のある人体部位に集中する。
  • 同じ画像の2つのランダムにマスクされたビュー間の一貫性を促進する構造不変アライメント損失を提案。両方のビューは人体部位の事前知識に基づいて誘導される。
  • エンコーダとしてシンプルなビジョントランスフォーマー(ViT)を採用し、アーキテクチャの複雑さを抑えながら、下流タスクへの容易な移行を可能にする。
  • LUPersonという単一の事前学習データセット内で画像とキーポイントのモダリティを統合し、推論時にマルチモodalデータを必要とせずに共同学習を可能にする。
  • 2段階の訓練戦略を採用:まずLUPerson上でMIMと人体部位誘導マスクを用いた事前学習を行い、次に下流タスクで標準的な教師あり学習による微調整を行う。

実験結果

リサーチクエスチョン

  • RQ1マスク画像モデリング(MIM)は人間中心の認識タスクに効果的に適応可能か。もし可能であれば、初期段階での性能が低かった場合の修正は何か?
  • RQ2人体構造の事前知識、特に人体部位領域が、人間中心の事前学習におけるMIMの有効性をどのように向上させるか?
  • RQ3マスクサンプリング戦略、スケーリング比、中間マスク率が、人間中心の文脈におけるMIM性能に与える影響は何か?
  • RQ4構造不変アライメント損失は、同じ画像の異なるマスクビュー間の一貫性を強制することで、特徴の識別性を向上させられるか?
  • RQ5人体部位のガイド付きシンプルなViTベースアーキテクチャは、多様な人間中心のベンチマークで最先端の性能を達成できるか、その範囲はどの程度か?

主な発見

  • 人物再識別のMSMT17では78.1%のmAPを達成し、このベンチマークで新たな最先端性能を樹立した。
  • 歩行者属性認識のPA-100Kでは86.54%の平均正答率を達成し、従来手法を上回った。
  • MS COCOにおける2次元人体キーポイント推定では78.2%のAPを達成し、キーポイントベースのタスクへの強力な一般化能力を示した。
  • 3DPWにおける3次元ポーズおよび形状推定では56.0のPA-MPJPEを達成し、3次元人体ボディモデリングにおいて優れた性能を示した。
  • テキストから画像への人物再識別のCUHK-PEDESでは68.05%のRank-1正答率を達成し、競争力のある性能を示した。
  • 僅か100エポックの事前学習でも満足のいく性能が得られ、HAPの効率性と低コストな訓練を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。