Skip to main content
QUICK REVIEW

[論文レビュー] Unified Contrastive Learning in Image-Text-Label Space

Jianwei Yang, Chunyuan Li|arXiv (Cornell University)|Apr 7, 2022
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

本論文は、単一の学習目的を用いて画像-ラベルおよび画像-テキストデータを統合的に統一する画像-テキスト-ラベル空間にマップする、新しい対照的学習フレームワークであるUnified Contrastive Learning (UniCL)を提案する。教師ありおよびウェブクロールドデータを活用することで、ゼロショット、線形プローブ、ファインチューニング、トランスファーラーニングのベンチマークにおいて、CLIP や教師あり手法と比較して平均で14.5%および9.2%の性能向上を達成する。

ABSTRACT

Visual recognition is recently learned via either supervised learning on human-annotated image-label data or language-image contrastive learning with webly-crawled image-text pairs. While supervised learning may result in a more discriminative representation, language-image pretraining shows unprecedented zero-shot recognition capability, largely due to the different properties of data sources and learning objectives. In this work, we introduce a new formulation by combining the two data sources into a common image-text-label space. In this space, we propose a new learning paradigm, called Unified Contrastive Learning (UniCL) with a single learning objective to seamlessly prompt the synergy of two data types. Extensive experiments show that our UniCL is an effective way of learning semantically rich yet discriminative representations, universally for image recognition in zero-shot, linear-probe, fully finetuning and transfer learning scenarios. Particularly, it attains gains up to 9.2% and 14.5% in average on zero-shot recognition benchmarks over the language-image contrastive learning and supervised learning methods, respectively. In linear probe setting, it also boosts the performance over the two methods by 7.3% and 3.4%, respectively. Our study also indicates that UniCL stand-alone is a good learner on pure image-label data, rivaling the supervised learning methods across three image classification datasets and two types of vision backbones, ResNet and Swin Transformer. Code is available at https://github.com/microsoft/UniCL.

研究の動機と目的

  • 既存手法が画像-ラベルおよび画像-テキストデータを別々に扱うという限界に対処する。これにより、強力な識別性能や広範な概念カバレッジの両方を同時に達成できない。
  • 共通の画像-テキスト-ラベル空間を導入することで、教師あり学習と言語-画像対照的学習を単一の目的関数で統合する。
  • 両方のデータタイプをシームレスに統合する統一された学習パラダイムを構築し、意味的に豊かで識別力のある視覚表現を学習する。
  • UniCLが多様な下流ビジョンタスクにおいて、教師あり学習および対照的学習手法を上回ることを実証する。
  • UniCLが画像-ラベルデータのみで学習された場合でも、複数のデータセットおよびバックボーンで教師ありベースラインと同等の性能を発揮することを示す。

提案手法

  • 本手法は、各画像がラベルおよびその対応するテキスト記述と関連付けられる統一された画像-テキスト-ラベル空間を導入し、両方のデータタイプからの統合的学習を可能にする。
  • 視覚エンコーダーとテキストエンコーダーは、共有ラベルから導出された緩められたターゲットを用いた対照的損失により、画像特徴とテキスト特徴を整列させる。
  • 統一された対照的学習目的は、画像-ラベルペアからの監督と画像-テキストペアからのアライメントを、温度スケーリング付きのクロスアテンションを用いた単一の損失関数で統合する。
  • アーキテクチャやトレーニングパイプラインの変更なしに、純粋な画像-ラベルデータ、純粋な画像-テキストデータ、または両方のデータで学習が可能である。
  • データオーグメンテーションと温度依存の対照的損失を用いることで、特徴の識別性能と意味的整合性を向上させる。
  • エンドツーエンドのトレーニングを可能にし、両方のデータタイプの強みを活かして特徴品質を相乗的に改善する。

実験結果

リサーチクエスチョン

  • RQ1統一された学習フレームワークは、画像-ラベルおよび画像-テキストデータを効果的に統合して視覚表現学習を向上させることができるか?
  • RQ2教師あり学習と対照的学習を統一された空間で統合することで、ゼロショット、線形プローブ、ファインチューニングの設定において性能が向上するか?
  • RQ3UniCLは画像-ラベルデータのみで学習された場合でも、強力な性能を発揮することができ、教師ありベースラインと同等の性能を達成できるか?
  • RQ4画像-ラベルデータの導入は、画像-テキストペアで事前学習されたモデルの識別力にどのように影響を与えるか?
  • RQ5データ統合は、特にクラス分離性の観点から、特徴空間の品質にどのような影響を与えるか?

主な発見

  • ゼロショット認識ベンチマークにおいて、UniCLは言語-画像対照的学習手法よりも平均9.2%、教師あり学習手法よりも平均14.5%の向上を達成する。
  • 線形プローブ設定では、CLIP より7.3%、教師ありベースラインより3.4%の性能向上を達成する。
  • YFCC-14M の半分と ImageNet-21K の半分で学習した場合、UniCLは CLIP より ImageNet-1K のゼロショット精度で6%の絶対的向上を達成する。
  • 両方のデータタイプを組み合わせた場合、14の下流データセットのうち11つで勝利を収め、7%の絶対的向上を達成する。
  • t-SNE ビジュアライゼーションにより、UniCLはより識別力のある特徴空間を生成することが確認され、犬の品種など細分化されたクラスが明確に分離されている(明示的な監視なしに)。
  • 画像-ラベルデータのみで学習したUniCLは、3つの画像分類データセットおよび2つのバックボーンアーキテクチャ(ResNet および Swin Transformer)において、教師あり学習手法と同等の性能を発揮する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。