[論文レビュー] LaFTer: Label-Free Tuning of Zero-shot Classifier using Language and Unlabeled Image Collections
LaFTerは、大規模言語モデル(LLM)が生成するテキスト記述とラベルなし画像コレクションのみを用いて、ラベルフリーでパラメータ効率の良いゼロショット視覚言語モデルのファインチューニング手法を提案する。LLMが生成した記述に基づいてテキスト専用分類器を訓練し、それを用いて画像を擬似ラベル付けすることで、ベースのCLIPよりも最大11.7%の絶対的精度向上を達成し、ラベルデータを一切使用せずに、少サンプルベースラインに匹敵またはそれを上回る性能を実現する。
Recently, large-scale pre-trained Vision and Language (VL) models have set a new state-of-the-art (SOTA) in zero-shot visual classification enabling open-vocabulary recognition of potentially unlimited set of categories defined as simple language prompts. However, despite these great advances, the performance of these zeroshot classifiers still falls short of the results of dedicated (closed category set) classifiers trained with supervised fine tuning. In this paper we show, for the first time, how to reduce this gap without any labels and without any paired VL data, using an unlabeled image collection and a set of texts auto-generated using a Large Language Model (LLM) describing the categories of interest and effectively substituting labeled visual instances of those categories. Using our label-free approach, we are able to attain significant performance improvements over the zero-shot performance of the base VL model and other contemporary methods and baselines on a wide variety of datasets, demonstrating absolute improvement of up to 11.7% (3.8% on average) in the label-free setting. Moreover, despite our approach being label-free, we observe 1.3% average gains over leading few-shot prompting baselines that do use 5-shot supervision.
研究の動機と目的
- ラベルデータを一切使用せずに、ゼロショット視覚言語モデルと教師あり分類器の性能差を埋める。
- テキスト埋め込みとラベルなし画像のみを用いて、視覚言語モデルのパラメータ効率の良いファインチューニングを可能にする。
- テキストのみの学習から得られるクロスモodalな転移が、視覚分類性能を効果的に向上させられることを示す。
- 12の多様なベンチマークにおいて、ラベルフリーなファインチューニングで最先端の結果を達成する。
- 1つのクラスあたり5つのラベル付きサンプルに依存する少サンプルプロンプティングベースラインを上回ることすら可能である。
提案手法
- 大規模言語モデル(LLM)と手動で作成したテンプレートを用いて、ターゲットクラスの多様なテキスト記述を生成し、テキスト専用データセットを構築する。
- 生成されたテキストデータセット上で軽量なテキスト分類器を訓練し、VLモデルの共有テキスト・画像埋め込み空間を活用して、元のクラスラベルを予測する。
- 事前に訓練されたテキスト分類器を用いて、ラベルなし画像コレクションに擬似ラベルを割り当てる。
- 視覚的プロンプトチューニングと適応的正規化層(スケール/シフト)を用いて、パラメータ効率の良い方法でCLIPの視覚エンコーダーをファインチューニングする。
- FixMatchにインspiredされた擬似ラベル付けパイプラインを適用し、ラベルなし適応中におけるロバストネスと過学習の低減を図る。
- 適応済みの視覚エンコーダーとテキスト分類器を組み合わせて最終的な推論を実行し、新しいカテゴリへのゼロショット一般化を可能にする。

実験結果
リサーチクエスチョン
- RQ1LLMが生成した記述に基づくテキスト専用分類器を、ラベルなし画像を一切使用せずに視覚分類性能に効果的に転送できるか?
- RQ2ラベルなし画像と合成テキストのみを用いた非教師ありファインチューニングは、ゼロショット視覚言語モデルの性能をどの程度向上させられるか?
- RQ3LLMが生成する記述の多様性が、ラベルフリー設定における最終的な分類精度に与える影響は何か?
- RQ4ラベルフリーなアプローチが、1クラスあたり5つのラベル付きサンプルに依存する少サンプルプロンプティング手法を上回れるか?
- RQ5視覚的プロンプトや正規化適応などの異なるアーキテクチャ的要素が、ラベルフリーなファインチューニングパイプライン全体の性能に与える影響は何か?
主な発見
- LaFTerは、ラベルフリー設定においてベースのCLIPモデルよりも最大11.7%の絶対的向上を達成し、平均で3.8%の向上を示し、先行する最先端手法を上回る。
- LaFTerは、ゼロショット性能を平均で6.7%向上させ、EuroSATのような個々のベンチマークでは最大28%向上する。
- LaFTerは、ラベルデータを一切使用せずに、5ショット少サンプルプロンプティングベースラインの平均性能に匹敵またはそれを上回る。
- テキスト専用事前学習コンponentが顕著な貢献を示し、擬似ラベル付けと組み合わせることで、EuroSATでは最大4.2%の絶対的向上が得られる。
- テキスト分類器や視覚的プロンプトといった重要なコンponentを削除すると、顕著な性能低下(例:視覚的プロンプトなしでは-4.2ポイント)が生じる。
- TSNE可視化により、LaFTerがクラス間分離性を向上させ、共有埋め込み空間内でのテキスト埋め込みを視覚クラスタによりよく一致させていることが示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。