Skip to main content
QUICK REVIEW

[論文レビュー] Retrieval-Enhanced Contrastive Vision-Text Models

Ahmet İşcen, Mathilde Caron|arXiv (Cornell University)|Jun 12, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

この論文では、外部メモリからクロスモodalな知識を取得することで、CLIP埋め込みと統合することにより、微調整なしのゼロショット細分化視覚言語理解を向上させるリtrieval強化対照的(RECO)モデルを提案する。単一モーダルのリtrieval(画像対画像またはテキスト対テキスト)を経てクロスモーダル統合を行うことで、Stanford Cars(+10.9)、CUB-2011(+10.2)、OVEN(+7.3)といった困難なベンチマークで性能が向上する。

ABSTRACT

Contrastive image-text models such as CLIP form the building blocks of many state-of-the-art systems. While they excel at recognizing common generic concepts, they still struggle on fine-grained entities which are rare, or even absent from the pre-training dataset. Hence, a key ingredient to their success has been the use of large-scale curated pre-training data aiming at expanding the set of concepts that they can memorize during the pre-training stage. In this work, we explore an alternative to encoding fine-grained knowledge directly into the model's parameters: we instead train the model to retrieve this knowledge from an external memory. Specifically, we propose to equip existing vision-text models with the ability to refine their embedding with cross-modal retrieved information from a memory at inference time, which greatly improves their zero-shot predictions. Remarkably, we show that this can be done with a light-weight, single-layer, fusion transformer on top of a frozen CLIP. Our experiments validate that our retrieval-enhanced contrastive (RECO) training improves CLIP performance substantially on several challenging fine-grained tasks: for example +10.9 on Stanford Cars, +10.2 on CUB-2011 and +7.3 on the recent OVEN benchmark, where we even outperform the fine-tuned models on unseen classes.

研究の動機と目的

  • 標準の対照的視覚言語モデル(例:CLIP)を超えて、ゼロショットでの細分化画像およびテキスト分類を向上させること。
  • 再トレーニングや微調整なしに、外部知識のリtrievalがモデルの一般化性能を向上させられるかどうかを検証すること。
  • 事前学習データのカバレッジが不十分なため、CLIPがレアまたは細分化されたエンティティを認識できないという限界を是正すること。
  • 大規模な外部メモリを用いて推論時にモデル表現を強化できる、軽量で汎用的かつ実装可能な手法を設計すること。

提案手法

  • 凍結されたCLIPモデルに、取得した知識を用いて画像およびテキスト埋め込みを精緻化する軽量な1層の統合トランスフォーマーを装備する。
  • 単一モーダルのリtrievalを用いる:画像表現をクエリとして類似画像上位k件を検索し、テキスト表現をクエリとして類似テキスト上位k件を検索する。
  • 取得したアイテム(画像またはテキスト)を元のクエリと統合し、拡張されたマルチモーダル表現を形成する。
  • 強化された表現を整列させるために、WebLIのキュレートされたサブセット(6100万例)を用いて対照的学習の設定で統合モジュールを訓練する。
  • 大規模なメモリ(例:10億エントリを有するWebLI)上で効率的な推論を実現するため、近似k-NN検索を活用する。
  • デプロイ後、タスク固有の適応や再トレーニングを必要としないように、汎用性を確保する。

実験結果

リサーチクエスチョン

  • RQ1標準の対照的事前学習を超えて、外部知識のリtrievalが細分化視覚言語タスクにおけるゼロショット性能を向上させられるか?
  • RQ2この文脈において、画像対画像またはテキスト対テキストの単一モーダルリtrievalが、クロスモーダルリtrievalを上回るか?
  • RQ3取得するアイテム数が性能および推論効率に与える影響はいかほどか?
  • RQ4再トレーニングなしに、更新されたまたはより大きなメモリに対してもモデルが一般化可能か?

主な発見

  • RECOは、CLIPに比べてStanford Carsで+10.9、CUB-2011で+10.2、OVENベンチマークで+7.3の絶対的向上を達成する。
  • 1つの取得アイテムのみを用いてもCLIPを上回る性能を示し、k=10の取得数で性能の向上が飽和する。
  • モデルはより大きな、未学習のメモリに対しても一般化可能である:1%のWebLIで学習した後、全WebLIで評価した際、性能が顕著に向上する。
  • 同じデータを用いてCLIPの上に別個のMLPヘッドを訓練しても性能向上が得られず、リtrieval補強学習の優位性が裏付けられる。
  • 単一モーダルリtrieval(画像対画像またはテキスト対テキスト)はクロスモーダルリtrievalよりも関連性の高いマッチングを生み出し、より優れた統合表現をもたらす。
  • 取得数を減らしても強力な性能を維持でき、最小限の計算オーバーヘッドで効率的な推論を実現できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。