Skip to main content
QUICK REVIEW

[論文レビュー] Collaboration of Pre-trained Models Makes Better Few-shot Learner

Renrui Zhang, Bohao Li|arXiv (Cornell University)|Sep 25, 2022
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、CLIP(言語対照的)、DINO(視覚対照的)、DALL-E(言語生成的)という3つの事前学習モデルを協調させることで、少数のラベル付きデータでも分類性能を向上させる、CoMoと呼ばれる少サンプル学習フレームワークを提案する。DALL-Eを用いて合成画像を生成し、学習可能なマルチ・ナレッジ・アダプタを介して予測を適応的にアンサンブルすることで、追加のアノテーションデータが不要な状態で11のデータセットで最先端の性能を達成した。

ABSTRACT

Few-shot classification requires deep neural networks to learn generalized representations only from limited training images, which is challenging but significant in low-data regimes. Recently, CLIP-based methods have shown promising few-shot performance benefited from the contrastive language-image pre-training. Based on this point, we question if the large-scale pre-training can alleviate the few-shot data deficiency and also assist the representation learning by the pre-learned knowledge. In this paper, we propose CoMo, a Collaboration of pre-trained Models that incorporates diverse prior knowledge from various pre-training paradigms for better few-shot learning. Our CoMo includes: CLIP's language-contrastive knowledge, DINO's vision-contrastive knowledge, and DALL-E's language-generative knowledge. Specifically, CoMo works in two aspects: few-shot data expansion and diverse knowledge ensemble. For one, we generate synthetic images via zero-shot DALL-E to enrich the few-shot training data without any manpower. For the other, we introduce a learnable Multi-Knowledge Adapter (MK-Adapter) to adaptively blend the predictions from CLIP and DINO. By such collaboration, CoMo can fully unleash the potential of different pre-training methods and unify them to perform state-of-the-art for few-shot classification. We conduct extensive experiments on 11 datasets to demonstrate the superiority and generalization ability of our approach.

研究の動機と目的

  • 異なる事前学習パラダイムを統合することで、少サンプル学習におけるデータ不足の問題を緩和できるかどうかを調査すること。
  • CLIP、DINO、DALL-Eの補完的知識を活用することで、少サンプル分類性能を向上させること。
  • 限られたアノテーションデータと事前学習モデルのみを用いて表現学習を強化する手法を開発すること。
  • 複数の事前学習モデルからの予測を適応的に統合できる学習可能なアダプタを設計すること。

提案手法

  • CoMoは、クラス固有のテキストプロンプトを条件としてゼロショットDALL-Eを用いて合成画像を生成し、少サンプル学習データを拡張する。
  • MK-Adapter(マルチ・ナレッジ・アダプタ)を採用し、二重キー・キャッシュを用いてCLIPとDINOのログ確率を生成・適応的に統合する。
  • MK-Adapterは、事前学習モデルの出力とCLIPのゼロショットログ確率との間の分布類似度を用いて、予測を再重み付けする。
  • 最終的な予測は、CLIPのゼロショットログ確率、DINOの視覚対照的ログ確率、およびMK-Adapterによる統合出力のアンサンブルである。
  • 事前学習モデルの重みはすべて固定されたまま、軽量なMK-Adapterのみを拡張された少サンプルデータ上で微調整する。
  • フレームワークは、拡張データ上でクロスエントロピー損失を用いてエンドツーエンドに訓練され、効果的な知識蒸留が可能になる。

実験結果

リサーチクエスチョン

  • RQ1異なる事前学習目的を持つ事前学習モデルを統合することで、単一モデルベースラインを上回る少サンプル分類性能が達成可能か?
  • RQ2DALL-Eによるゼロショット画像生成は、手動アノテーションなしで少サンプル学習データを効果的に拡張できるか?
  • RQ3多様な事前学習モデルの予測を適応的に統合することで、固定アンサンブル戦略に比べてより良い一般化性能が得られるか?
  • RQ4CLIP、DINO、DALL-Eの協調は、多様なデータセット上で既存の少サンプル学習手法と比較してどのように優れているか?

主な発見

  • CoMoは11の少サンプル分類データセットで最先端の性能を達成し、CLIP-Adapter や Tip-Adapter-F といった既存手法を上回った。
  • 16ショット ImageNet において、ViT-B/16を用いてトップ1正解率74.48%を達成し、2番目に良い手法(Tip-Adapter-F)を0.79ポイント上回った。
  • 1クラスあたりの合成画像の最適な数は4枚であり、それ以上に増やすと低品質なサンプルが含まれるようになり、性能が低下した。
  • 適応的アンサンブルの基準としてCLIPのゼロショットログ確率を用いることで最も高い性能が得られ、平均または最大プーリング戦略を上回った。
  • t-SNE可視化では、CoMoがTip-Adapter-Fよりも分離性が高く対照的なクラスクラスタを生成しており、クラスの混同(aliasing)が低減していることが示された。
  • 学習曲線では、20エポックの学習において、CoMoが単一モデルベースラインよりも高速に収束し、より高い正解率に到達した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。