Skip to main content
QUICK REVIEW

[論文レビュー] What does a platypus look like? Generating customized prompts for zero-shot image classification

Sarah I. Pratt, Covert, Ian|arXiv (Cornell University)|Sep 7, 2022
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

本論文では、大規模言語モデル(LLMs)を用いてオープンボックス画像分類のための豊富でカテゴリ固有のプロンプトを生成するゼロショット手法、CuPL(Customized Prompts via Language models)を提案する。一般的なテンプレートの代わりに、『大きな目を持つツキノミドリアリ』のような記述的で特徴的なキャプションを用いることで、ベンチマーク全体でゼロショット精度が向上し、ImageNetではトップ1精度が1.1%向上、Describable Texturesデータセットでは6%以上向上した。微調整やラベル付きデータを一切使用しない。

ABSTRACT

Open-vocabulary models are a promising new paradigm for image classification. Unlike traditional classification models, open-vocabulary models classify among any arbitrary set of categories specified with natural language during inference. This natural language, called "prompts", typically consists of a set of hand-written templates (e.g., "a photo of a {}") which are completed with each of the category names. This work introduces a simple method to generate higher accuracy prompts, without relying on any explicit knowledge of the task domain and with far fewer hand-constructed sentences. To achieve this, we combine open-vocabulary models with large language models (LLMs) to create Customized Prompts via Language models (CuPL, pronounced "couple"). In particular, we leverage the knowledge contained in LLMs in order to generate many descriptive sentences that contain important discriminating characteristics of the image categories. This allows the model to place a greater importance on these regions in the image when making predictions. We find that this straightforward and general approach improves accuracy on a range of zero-shot image classification benchmarks, including over one percentage point gain on ImageNet. Finally, this simple baseline requires no additional training and remains completely zero-shot. Code available at https://github.com/sarahpratt/CuPL.

研究の動機と目的

  • ゼロショットオープンボックス画像分類における手作業で作成された汎用的で限定的なプロンプトテンプレートの限界を解決すること。
  • 分類精度、特に細分化されたカテゴリや視覚的に類似したカテゴリの分類精度を向上させることを目的とし、プロンプトに特徴的な視覚的属性を組み込むこと。
  • タスク固有のプロンプト設計を必要としないように、大規模言語モデルを活用して高品質でカテゴリ固有のプロンプトを自動生成することで、その必要性を排除すること。
  • 微調整やラベル付きデータを用いたプロンプト生成を一切行わないことで、完全なゼロショット設定を維持すること。
  • データセット固有の表現に関する事前知識を必要とせず、多様なデータセットに一般化可能でスケーラブルな手法を構築すること。

提案手法

  • 各画像カテゴリに対して、区別可能な視覚的特徴に焦点を当てて、複数の記述的キャプションを大規模言語モデル(LLM)が生成する。
  • 各LLMが生成したキャプションを、カテゴリのプレースホルダを実際のクラス名に置き換えることでプロンプトに変換する。
  • これらのカスタマイズされたプロンプトを、事前に訓練されたオープンボックス画像分類器(例:CLIP)に供給し、画像とテキストの類似度スコアを計算する。
  • 類似度スコアが最も高いプロンプトを用いて入力画像を分類し、ゼロショット推論パイプラインを維持する。
  • LLMの世界知識を活用して、『大きな目』のような特徴的な属性を含むプロンプトを生成し、データセット固有のテンプレートを必要とせずに作成する。
  • ビジョンモデルの再訓練や適応を一切行わず、LLMによるプロンプト生成のみを用いることで、完全にゼロショットの状態を保つ。

実験結果

リサーチクエスチョン

  • RQ1標準的な手作業によるテンプレートと比較して、LLMが生成するカテゴリ固有のプロンプトは、ゼロショット画像分類の精度を向上させることができるか?
  • RQ2『ツキノミドリアリの大きな目』のような特徴的な視覚的属性をプロンプトに組み込むことで、細分化分類タスクにおけるモデル性能が向上するか?
  • RQ3事前にデータセットの内容を知らない状態で、一貫したLLMのプロンプト指示セットが多様なデータセットに一般化可能か?
  • RQ4プロンプトの質と多様性は、視覚的に曖昧または類似したカテゴリにおいて、ゼロショット精度にどのような影響を与えるか?
  • RQ5ImageNet や Describable Textures のような標準ベンチマークにおいて、LLMが生成するプロンプトの性能は、手作業でカスタマイズされたプロンプトと比較してどうか?

主な発見

  • CuPLは、標準的な手作業によるプロンプトテンプレートと比較して、ImageNetでトップ1精度が1.1%の絶対的向上を達成した。
  • Describable Texturesデータセットでは、ゼロショット精度が6ポイント以上向上し、細分化された視覚認識タスクにおいて顕著な向上を示した。
  • 15の多様なゼロショット画像分類ベンチマーク全体で、標準的なプロンプトテンプレートを上回る性能を示し、広範な一般化性を示した。
  • LLMが生成したプロンプトには、『コcker Spanielsの長いふわふわの耳』のようなより多くの特徴的な視覚的属性が含まれており、ビジョンモデルが関連領域に注目しやすくなった。
  • 追加のトレーニングは一切不要で、完全なゼロショット能力を維持し、人為的作業を最小限に抑えながら効率的にスケーリング可能である—数個のプロンプト指示で数千ものカテゴリ固有のプロンプトを生成可能である。
  • 定性的な分析から、CuPLのプロンプトは『南米の黒いクモの赤い砂時計型の模様』のような区別可能な特徴をよりよく捉えており、モデルの注目が重要な特徴領域に適切に向けられていることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。