Skip to main content
QUICK REVIEW

[論文レビュー] CoCa: Contrastive Captioners are Image-Text Foundation Models

Jiahui Yu, Zirui Wang|arXiv (Cornell University)|May 4, 2022
Multimodal Machine Learning Applications被引用数 515
ひとこと要約

CoCaは対照学習と生成的キャプショニングを統合し、単一のエンコーダ-デコーダモデルで、視覚認識、クロスメディア検索、マルチモーダル理解におけるゼロショットおよび転移性能を強力に発揮する。

ABSTRACT

Exploring large-scale pretrained foundation models is of significant interest in computer vision because these models can be quickly transferred to many downstream tasks. This paper presents Contrastive Captioner (CoCa), a minimalist design to pretrain an image-text encoder-decoder foundation model jointly with contrastive loss and captioning loss, thereby subsuming model capabilities from contrastive approaches like CLIP and generative methods like SimVLM. In contrast to standard encoder-decoder transformers where all decoder layers attend to encoder outputs, CoCa omits cross-attention in the first half of decoder layers to encode unimodal text representations, and cascades the remaining decoder layers which cross-attend to the image encoder for multimodal image-text representations. We apply a contrastive loss between unimodal image and text embeddings, in addition to a captioning loss on the multimodal decoder outputs which predicts text tokens autoregressively. By sharing the same computational graph, the two training objectives are computed efficiently with minimal overhead. CoCa is pretrained end-to-end and from scratch on both web-scale alt-text data and annotated images by treating all labels simply as text, seamlessly unifying natural language supervision for representation learning. Empirically, CoCa achieves state-of-the-art performance with zero-shot transfer or minimal task-specific adaptation on a broad range of downstream tasks, spanning visual recognition (ImageNet, Kinetics-400/600/700, Moments-in-Time), crossmodal retrieval (MSCOCO, Flickr30K, MSR-VTT), multimodal understanding (VQA, SNLI-VE, NLVR2), and image captioning (MSCOCO, NoCaps). Notably on ImageNet classification, CoCa obtains 86.3% zero-shot top-1 accuracy, 90.6% with a frozen encoder and learned classification head, and new state-of-the-art 91.0% top-1 accuracy on ImageNet with a finetuned encoder.

研究の動機と目的

  • 単一の画像-テキスト基盤モデルを動機づけ開発し、単一エンコーダ、デュアルエンコーダ、エンコーダ-デコーダのパラダイムを包摂する。
  • クロスアテンションを用いないユニモーダル文本デコーダと、画像エンコーダへクロスアテンションを行うマルチモーダルデコーダを備えたデカップルドデコーダアーキテクチャを導入する。
  • ウェブ規模の代替テキストと注釈付き画像を用いたスクラッチからの単一エンドツーエンド事前学習段階で、対照学習損失とキャプショニング損失の両方で jointly 学習する。
  • 統合モデルがゼロショット転移または最小限のタスク固有適応で、広範な下流タスクにおいて最先端または競合的な性能を達成することを示す。

提案手法

  • CoCaを2部構成デコーダを持つ提案: ユニモーダルテキストデコーダ(クロスアテンションなし)とマルチモーダルデコーダ(画像エンコーダへクロスアテンション)。
  • L_CoCa = lambda_Con * L_Con + lambda_Cap * L_Cap というジョイント損失を用いて学習し、ユニモーダル画像とテキスト埋め込み間の対照損失と、マルチモーダルデコーダ出力に対するキャプショニング損失を組み合わせる。
  • 両方の目的のための共有フォワードパスを可能にするデカップルトレーニンググラフを使用。対照学習には単一のCLS埋め込み画像トークンを活用し、テキスト生成には自己回帰キャプショニングストリームを活用。
  • ウェブ規模データ(JFT-3Bラベルをテキストとして + ALIGNの代替テキスト)をスクラッチから事前学習させ、65,536ペアのバッチサイズと統一された事前学習 regimeを適用する。
  • タスク固有のアテンショナルプーリングを採用し、グローバル(対照)および領域レベル(キャプショニング/マルチモーダル)の視覚表現を生成する。
  • モデルバリアント(CoCa-Base、CoCa-Large、CoCa)を詳細なエンコーダ/デコーダ仕様とパラメータ数とともに提供し、ゼロショット、フローズンエンコーダ、ファインチューニング設定を評価する。

実験結果

リサーチクエスチョン

  • RQ1単一の画像-テキスト基盤モデルが、対照学習とキャプショニングの目的の両方を学習することで、視覚認識、クロスメディア検索、マルチモーダル理解タスクにおいて最先端の性能を達成できるか。
  • RQ2デコーダをユニモーダルとマルチモーダルの部品に分離することは、効率的なジョイント学習と多様な下流転移を可能にするのか。
  • RQ3ゼロショット転移、フローズン機能評価、ファインチューニングを、さまざまなベンチマークに対して統一されたCoCaモデルで比較するとどうなるのか。
  • RQ4タスク固有のアテンショナルプーリングが、異なる下流タスクに対する視覚特徴のプーリングにどのような影響を与えるのか。
  • RQ5注釈付き画像とノイズの多い画像-テキストデータの両方で学習することにより、タスク固有の事前学習段階を必要とせず、堅牢なクロスモーダル整合と生成能力を得られるか。

主な発見

  • CoCaは、視覚認識、クロスメディア検索、マルチモーダル理解、画像キャプショニングを含む広範なタスクで最先端または競合的な結果を達成する。
  • ImageNetでは、CoCaはゼロショットTop-1精度86.3%、フローズンエンコーダで90.6%、ファインチューニングで91.0%を達成する。
  • ゼロショットのクロスモーダル検索において、CoCaはMSCOCOおよびFlickr30Kで従来手法を上回り、強力な検索指標を示す。
  • 動画検索とアクション認識では、CoCaはゼロショットおよびフローズンエンコーダ設定で競争力があり、ファインチューニングで改善する。
  • マルチモーダル理解ベンチマーク(VQA、SNLI-VE、NLVR2)では、CoCaは強力なビジョン-言語ベースラインを上回る。
  • 画像キャプショニング(MSCOCO、NoCaps)では、CoCaはCIDEr固有の最適化なしで強力なBLEU/METEOR/CIDEr/SPICEスコアを達成し、NoCapsの生成キャプションの結果は新たな最先端を樹立。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。