Skip to main content
QUICK REVIEW

[論文レビュー] CoBIT: A Contrastive Bi-directional Image-Text Generation Model

Haoxuan You, Mandy Guo|arXiv (Cornell University)|Mar 23, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

CoBITは、共通のユニコーダ・デコーダアーキテクチャを用いて、対照的学習、画像からテキストへの生成、テキストから画像への生成を統合的に事前学習する統一されたビジョン・言語基盤モデルを提案する。画像とテキストのユニコーダがエンコーディングモードとデコーディングモードを切り替えることで、CoBITは、ImageNetにおける82.7%のトップ1精度、テキストから画像生成における9.37 FID、画像キャプションにおける44.8 CIDErを含む、最先端のゼロショット性能を達成する。

ABSTRACT

The field of vision and language has witnessed a proliferation of pre-trained foundation models. Most existing methods are independently pre-trained with contrastive objective like CLIP, image-to-text generative objective like PaLI, or text-to-image generative objective like Parti. However, the three objectives can be pre-trained on the same data, image-text pairs, and intuitively they complement each other as contrasting provides global alignment capacity and generation grants fine-grained understanding. In this work, we present a Contrastive Bi-directional Image-Text generation model (CoBIT), which attempts to unify the three pre-training objectives in one framework. Specifically, CoBIT employs a novel unicoder-decoder structure, consisting of an image unicoder, a text unicoder and a cross-modal decoder. The image/text unicoders can switch between encoding and decoding in different tasks, enabling flexibility and shared knowledge that benefits both image-to-text and text-to-image generations. CoBIT achieves superior performance in image understanding, image-text understanding (Retrieval, Captioning, VQA, SNLI-VE) and text-based content creation, particularly in zero-shot scenarios. For instance, 82.7% in zero-shot ImageNet classification, 9.37 FID score in zero-shot text-to-image generation and 44.8 CIDEr in zero-shot captioning.

研究の動機と目的

  • 対照的学習、画像からテキストへの生成、テキストから画像への生成という3つの主要な事前学習目的を、1つの整合的なフレームワークに統合すること。
  • 同じ画像・テキストペアデータを用いても、1つまたは2つの目的でのみ事前学習を行う既存モデルの限界を克服すること。
  • 画像理解、リtrieval、VQA、コンテンツ生成を含む、視覚と言語のタスクにおけるゼロショットおよびファインチューニング性能の向上を図ること。
  • 共通のユニコーダ構造を介して、単一モodalなエンコーディングとデコーディング間でのパラメータ効率の良い知識共有を可能にすること。
  • 1つのモデルに3つの目的を統合することで、相互に補い合う効果が得られ、目的間の著しい矛盾が生じないことを実証すること。

提案手法

  • 共通の画像ユニコーダとテキストユニコーダを備えた、パラメータを共有する新しいユニコーダ・デコーダアーキテクチャを採用。エンコーディングとデコーディングモードの切り替えが可能である。
  • 生成タスクでは、エンコーディッドされた画像とテキスト表現からの特徴を統合するために、クロスアテンションデコーダを用いる。
  • 対照的事前学習では、両ユニコーダがエンコーダとして機能し、対照的損失を用いて画像とテキストの埋め込みを一致させる。
  • 画像からテキストへの生成では、画像ユニコーダが画像をエンコードし、テキストユニコーダが自己回帰的にキャプションをデコードする。この際、クロスアテンションはエンコーディッドされた画像に注目する。
  • テキストから画像への生成では、テキストユニコーダがプロンプトをエンコードし、画像ユニコーダが自己回帰的に画像トークンをデコードする。この際、クロスアテンションはエンコーディッドされたテキストに注目する。
  • 大規模なノイズの多いウェブクロールドされた画像・テキストデータおよび画像アノテーションデータを用い、対照的損失、I2T損失、T2I損失を共同で最適化することで事前学習を行う。

実験結果

リサーチクエスチョン

  • RQ1共通のパラメータを用いて、1つのモデルが対照的学習、画像からテキストへの生成、テキストから画像への生成を効果的に統合できるか?
  • RQ23つの目的を同時に事前学習することで、ゼロショットおよびファインチューニングタスクにおける性能にどのような影響を与えるか?
  • RQ3画像からテキストへの生成とテキストから画像への生成という2つの目的が、どの程度衝突するか。また、それらは統一フレームワーク内で調和させられるか?
  • RQ4エンコーディングとデコーディングの間でパラメータを共有する本研究のユニコーダ機構は、別個のエンコーダと比較して、性能およびパラメータ効率を向上させるか?
  • RQ5CoBITはファインチューニングなしで強力なゼロショット能力を発揮できるか。特に画像分類、キャプション生成、テキストから画像への生成においては?

主な発見

  • CoBITはImageNet分類タスクで82.7%のゼロショットトップ1精度を達成し、強力な視覚表現学習能力を示した。
  • ゼロショットテキストから画像生成では、FIDスコアが9.37に達し、プロンプトからの高品質で多様な画像生成が可能であることを示した。
  • ゼロショット画像キャプション生成では、CIDErスコアが44.8に達し、生成されたキャプションと参照記述との間の高い整合性を示した。
  • ファインチューニング後、CoBITはImageNetで86.44%の線形プローブ精度、テキストから画像生成で4.62 FID、VQAで78.3スコアを達成し、優れた汎化能力を示した。
  • アブレーションスタディの結果、T2IとI2Tの目的にはわずかな衝突があることが判明(例:T2I損失を追加するとVQAスコアが2.6ポイント低下)、しかし全体のフレームワークは安定しており効果的である。
  • 事前初期化なしでCoBITをスクラッチから訓練しても、ゼロショットImageNet精度は0.3%低下、FIDは0.2上昇に留まり、モデルのスクラッチからの訓練可能性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。