Skip to main content
QUICK REVIEW

[論文レビュー] Beyond Appearance: a Semantic Controllable Self-Supervised Learning Framework for Human-Centric Visual Tasks

Weihua Chen, Xianzhe Xu|arXiv (Cornell University)|Mar 30, 2023
Human Pose and Action Recognition被引用数 4
ひとこと要約

SOLIDER は、人間の画像から得られる事前知識を活用して仮の意味的ラベルを生成し、一般化された意味情報を豊富に含む人間の表現を学習する意味的制御可能な自己教師あり学習フレームワークである。意味的コントローラーを備えた条件付きネットワークを導入することで、意味的・外見的特徴の比率を調整可能な表現を生成でき、6つの人間中心の視覚的タスクにおいて最先端の手法を上回り、評価されたすべてのベンチマークで新たなベースラインを確立した。

ABSTRACT

Human-centric visual tasks have attracted increasing research attention due to their widespread applications. In this paper, we aim to learn a general human representation from massive unlabeled human images which can benefit downstream human-centric tasks to the maximum extent. We call this method SOLIDER, a Semantic cOntrollable seLf-supervIseD lEaRning framework. Unlike the existing self-supervised learning methods, prior knowledge from human images is utilized in SOLIDER to build pseudo semantic labels and import more semantic information into the learned representation. Meanwhile, we note that different downstream tasks always require different ratios of semantic information and appearance information. For example, human parsing requires more semantic information, while person re-identification needs more appearance information for identification purpose. So a single learned representation cannot fit for all requirements. To solve this problem, SOLIDER introduces a conditional network with a semantic controller. After the model is trained, users can send values to the controller to produce representations with different ratios of semantic information, which can fit different needs of downstream tasks. Finally, SOLIDER is verified on six downstream human-centric visual tasks. It outperforms state of the arts and builds new baselines for these tasks. The code is released in https://github.com/tinyvision/SOLIDER.

研究の動機と目的

  • 多数のラベルなし人間画像から、多様な下流の人間中心の視覚的タスクに有益な一般化可能な人間表現を学習すること。
  • 特にパースリングや属性認識のような高レベルの理解を要するタスクにおいて、意味的情報が十分に捉えられていない既存の自己教師あり手法の限界を解消すること。
  • 学習済み表現における意味的情報と外見的情報の比率を、下流タスクの要件に応じて動的に調整できることを実現すること。
  • 人間中心の視覚タスクのための新しい強力なベースラインとなる事前学習モデルを開発すること。

提案手法

  • SOLIDER は、人体部品(例:上半身、靴)など、人間の画像に内在する事前知識を用いて生成された仮の意味的ラベルを用いた、トークンレベルの意味的分類の事前学習タスクを導入する。
  • 視覚変換器バックボーンに加え、特徴を意味的空間にマップする学習可能なプロジェクションヘッドを活用し、仮のラベルによって監視されることで意味的認識能力を向上させる。
  • 意味的コントローラーを条件付きネットワークアーキテクチャに統合し、ユーザーがスカラ値を入力することで、最終的表現における意味的情報と外見的情報の比率を制御できる。
  • 推論時に特徴空間を調整することで、再訓練なしにリアルタイムで表現の構成を適応可能にする。
  • 対照的学習とマスク自己符号化に加え、新たな意味的事前学習タスクを用いて、LUPerson データセット(418万枚)で事前学習を行う。
  • 最終的な表現は、標準的なヘッドアーキテクチャを用いて下流タスクで微調整され、6つの人間中心のタスクで性能が評価される。
Figure 1 : A representation space learned by DINO [ 6 ] . Seven human images are represented in seven different colors. Each image is split into four parts according to their semantic regions, i.e . , upper body (as $\blacktriangle$ ), lower body (as + ), shoes (as $\star$ ) and background (as $\tim
Figure 1 : A representation space learned by DINO [ 6 ] . Seven human images are represented in seven different colors. Each image is split into four parts according to their semantic regions, i.e . , upper body (as $\blacktriangle$ ), lower body (as + ), shoes (as $\star$ ) and background (as $\tim

実験結果

リサーチクエスチョン

  • RQ1人間の画像からの事前知識を効果的に活用して、自己教師あり表現学習のための仮の意味的ラベルを生成できるか?
  • RQ2標準的な対照的学習やマスク自己符号化手法と比較して、意味的コンテンツが強化された表現を学習できるか?
  • RQ31つの事前学習モデルが、多様な下流の人間中心のタスクに適した調整可能な意味的・外見的比率の表現を生成できるか?
  • RQ4提案された意味的コントローラーは、固定表現ベースラインと比較して、複数の人間中心の視覚的タスクでより優れた性能を発揮できるか?

主な発見

  • SOLIDER は、人物再識別、属性認識、人物検索、歩行者検出、人体パース、ポーズ推定の6つの人間中心の視覚的タスクで、新たな最先端性能を達成した。
  • PETA のゼロショット属性認識ベンチマークにおいて、Swin-B を用いた SOLIDER は 76.43% の精度を達成し、前回の SOTA よりも 2.12 パーセンテージポイント高い。
  • PRW における人物検索タスクでは、SOLIDER が 59.8% の mAP を達成し、以前の SOTA 手法と比較して相対的に 12% の向上を示した。
  • Cityscapes における歩行者検出タスクでは、Swin-S を用いた SOLIDER が 9.7% の MR-2 と 39.4% の H-O を達成し、類似設定下で以前の手法を上回った。
  • LIP における人体パースタスクでは、Swin-S を用いた SOLIDER が 60.21% の mIOU を達成し、前回の SOTA よりも 2.69% の向上を示した。
  • 非再識別タスク5つの平均性能は、DINO-LUP1M の 72.6 から SOLIDER では 74.9 に向上し、強化された意味的学習の一貫した利点を示した。
Figure 2 : The pipeline of the proposed SOLIDER.
Figure 2 : The pipeline of the proposed SOLIDER.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。