[論文レビュー] Three Towers: Flexible Contrastive Learning with Pretrained Image Models
Three Towers (3T) は、対照的学習のフレームワークを柔軟に拡張し、固定された事前学習済み画像分類器の埋め込みを第三者のタワーとして統合することで、視覚言語モデルの性能を向上させる。主な画像タワーとテキストタワーは、対照的損失を介して共同で学習可能であり、この手法は、ImageNet-21k や Places365 などの多様な事前学習データセットにおいて、リtrieval および分類タスクで LiT やスクラッチからのベースラインを常に上回る。
We introduce Three Towers (3T), a flexible method to improve the contrastive learning of vision-language models by incorporating pretrained image classifiers. While contrastive models are usually trained from scratch, LiT (Zhai et al., 2022) has recently shown performance gains from using pretrained classifier embeddings. However, LiT directly replaces the image tower with the frozen embeddings, excluding any potential benefits from training the image tower contrastively. With 3T, we propose a more flexible strategy that allows the image tower to benefit from both pretrained embeddings and contrastive training. To achieve this, we introduce a third tower that contains the frozen pretrained embeddings, and we encourage alignment between this third tower and the main image-text towers. Empirically, 3T consistently improves over LiT and the CLIP-style from-scratch baseline for retrieval tasks. For classification, 3T reliably improves over the from-scratch baseline, and while it underperforms relative to LiT for JFT-pretrained models, it outperforms LiT for ImageNet-21k and Places365 pretraining.
研究の動機と目的
- LiT の制限を解消するため、事前学習済み画像埋め込みを固定し、画像タワーが対照的学習の恩恵を受けることができない点を是正する。
- 事前学習済み画像表現と対照的信号の両方から共同で学習可能な柔軟な手法を開発する。
- 特に事前学習モデルが不適切であるか、ダウンストリームデータと不一致である場合に、多様なダウンストリームタスクにおけるロバスト性と性能を向上させる。
- モジュラーな三タワーアーキテクチャを用いて、事前知識と対照的学習からのインダクティブバイアスの間でトレードオフを可能にする。
- 事前学習済み埋め込みに頼るか、スクラッチからの学習に頼るのではなく、両者を組み合わせることで一般化性能が向上することを実証的に検証する。
提案手法
- 主な画像タワーとテキストタワーとは別に、分類器(例:ImageNet-21k や Places365)から得た固定された事前学習済み画像埋め込みを含む第三のタワーを導入する。
- Web スクレイピングで得た画像キャプションペアを用いて、主な画像タワーとテキストタワーをスクラッチから対照的学習で訓練する。
- 主な画像タワーを第三のタワー(事前学習済み埋め込み)と一致させる追加の対照的損失項を適用し、知識の転送を可能にする。
- マルチヘッドアテンションプーリングを用いて、主な画像タワーと第三のタワーの両方でパッチ埋め込みを1つの表現に集約する。
- Adafactor を用いて全モデルを最適化し、学習率のウォームアップ、コサイン減衰、勾配クリッピング、重み減衰を適用する。
- 推論効率を維持するため、テスト時には第三のタワーを破棄し、ダウンストリームタスクには主な画像タワーとテキストタワーのみを用いる。
実験結果
リサーチクエスチョン
- RQ1固定された事前学習済み画像埋め込みと学習可能な画像タワーを組み合わせることで、対照的視覚言語学習を向上させられるか?
- RQ2提案された Three Towers フレームワークは、LiT やスクラッチからのベースラインを上回り、リtrieval およびゼロショット分類で優れた性能を示すか?
- RQ3事前学習モデルがダウンストリームタスクと不一致である場合(例:Places365 での事前学習)、3T はどのように性能を発揮するか?
- RQ4事前学習モデルが特定の画像カテゴリーやドメインをカバーしていない場合、この手法は依然としてロバストか?
- RQ5ImageNet-21k や JFT といった多様な事前学習データセットにおいて、3T は LiT を上回る性能を発揮できるか?
主な発見
- 3T は、Flickr30k および COCO のリtrieval ベンチマークにおいて、LiT やスクラッチからのベースラインを上回り、それぞれ img2txt で 87.3%、txt2img で 48.5% のトップ1リCALLを達成した。
- ImageNet-1k のゼロショット分類では、3T はスクラッチからのベースラインを上回り、ImageNet-21k で事前学習されたモデルを用いる場合、LiT と同等またはそれを上回った。
- Places365 で事前学習されたモデルを用いる場合、3T は LiT を顕著に上回った。LiT は ImageNet-1k や CIFAR-100 といったダウンストリームタスクへの一般化に失敗した。
- 3T は、事前学習データセットの制限に対してより高いロバスト性を示し、特に事前学習モデルのラベルや分布がダウンストリームタスクと一致しない状況で顕著に優れた性能を発揮した。
- モデルスケールが大きく、訓練期間が長いほど、3T の利点が顕著に現れ、Lスケールモデルでは 256 TPU チップで約 3 日で収束が確認された。
- gスケールモデルでは、512 TPU チップで約 5 日で収束が確認され、$eta_2$ を 0.95 に調整することで訓練の安定性が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。