[論文レビュー] LLMs as Visual Explainers: Advancing Image Classification with Evolving Visual Descriptions
本稿では、視覚言語モデル(VLM)の分類指標によって誘導される大規模言語モデル(LLM)エージェントを用いて、画像分類のためのクラス記述を段階的に最適化する手法、反復的最適化と視覚フィードバックを提案する。遺伝的アルゴリズムに類似した進化とCLIPからの視覚フィードバックを組み合わせることで、最先端の手法よりも平均で3.47%の精度向上を達成し、解釈可能で頑健かつ転送可能なテキストプロンプトを生成する。
Vision-language models (VLMs) offer a promising paradigm for image classification by comparing the similarity between images and class embeddings. A critical challenge lies in crafting precise textual representations for class names. While previous studies have leveraged recent advancements in large language models (LLMs) to enhance these descriptors, their outputs often suffer from ambiguity and inaccuracy. We attribute this to two primary factors: 1) the reliance on single-turn textual interactions with LLMs, leading to a mismatch between generated text and visual concepts for VLMs; 2) the oversight of the inter-class relationships, resulting in descriptors that fail to differentiate similar classes effectively. In this paper, we propose a novel framework that integrates LLMs and VLMs to find the optimal class descriptors. Our training-free approach develops an LLM-based agent with an evolutionary optimization strategy to iteratively refine class descriptors. We demonstrate our optimized descriptors are of high quality which effectively improves classification accuracy on a wide range of benchmarks. Additionally, these descriptors offer explainable and robust features, boosting performance across various backbone models and complementing fine-tuning-based methods.
研究の動機と目的
- 視覚的根拠の欠如により、LLMが誤った視覚的記述を生成する『見ずに説明する』ジレンマに対処すること。
- 現在の手法が、過度に一般的で最適化されていない記述により、類似クラスを区別できないという問題を克服すること。
- VLMからの視覚フィードバックを用いて、クラス記述を自動的かつ反復的に進化させるパイプラインを開発すること。
- 異なるバックボーンモデルに一般化可能な解釈可能で頑健かつ転送可能なテキストプロンプトを生成すること。
- 視覚フィードバックがLLMベースのプロンプト生成における最適化の安定性を著しく向上させ、ばらつきを低減することを示すこと。
提案手法
- クラス記述最適化を組み合わせ最適化問題として定式化し、VLM分類精度を最大化する最良のテキスト記述を求める。
- 突然変異とクロスオーバー操作を用いて、候補記述を探索・精錬するLLMベースのエージェントが反復的進化を実行する。
- CLIPの誤分類行列とトップ1精度から得られる視覚フィードバックが、報酬関数および記憶メカニズムとして機能し、LLMがより良い解へと導かれる。
- 過去の高精度記述を格納するメモリバンクが、訓練の安定化と最適化結果のばらつき低減に寄与する。
- フィードバックループにより、LLMが実際の視覚的性能に基づいてテキスト生成を行うようになり、ランダムまたは不適切な記述を回避する。
- このフレームワークは複数のデータセットおよびバックボーンに適用可能であり、最適化されたプロンプトの転送性と頑健性を示している。
![Figure 1 : Schematic of the method. (a) Previous methods use an LLM to generate descriptive prompts for each class directly. (b) Our method optimizes class descriptions through an evolutionary process. We utilize a VLM (such as CLIP [ 29 ] ) to obtain visual feedback, e.g. , the confusion matrix, as](https://ar5iv.labs.arxiv.org/html/2311.11904/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ1VLMからの視覚フィードバックを用いて、LLMが生成するクラス記述を体系的に改善し、画像分類精度を向上させることができるか?
- RQ2クラス間の関係性と視覚的性能指標を組み込むことで、LLMが生成する記述の質と識別性はどのように向上するか?
- RQ3視覚フィードバックが最適化プロセスの安定性をどの程度向上させ、LLMベースのプロンプト生成におけるばらつきを低減するか?
- RQ4最適化された記述は、異なるビジョンバックボーンモデルやデータセットに一般化できるか?
- RQ5既存のLLMベース手法と比較して、進化した記述は解釈性および意味的関連性においてどの程度優れているか?
主な発見
- 本手法は、9つの画像分類ベンチマークで、最先端のLLMベース手法よりも平均で3.47%の精度向上を達成した。
- Flowers102データセットでは、最適化されたプロンプトがResNet-101およびViT-B/16バックボーンに転送された際、9%以上の精度向上を示した。
- 視覚フィードバックやメモリバンクを除去すると、顕著な性能低下と高いばらつきが生じ、視覚フィードバックが最適化の安定性において極めて重要な役割を果たしていることを確認した。
- 最終的な最適化済み記述は非常に解釈可能であり、上位ランクの記述はクラス固有の視覚的特徴と強く意味的に整合しており、曖昧さが低減されている。
- 従来の手法とは異なり、本手法は視覚的根拠により、抽象的または曖昧なクラスを誤って分類するのを回避した—例として、「プリンス・オブ・ウェールズ・フェザーズ」を、紋章的象徴ではなく植物として正しく識別した。
- 最適化されたプロンプトは、多様なバックボーンで、vanilla CLIPおよび既存のLLMベース手法を常に上回り、強力な転送性と頑健性を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。