Skip to main content
QUICK REVIEW

[論文レビュー] LICO: Explainable Models with Language-Image Consistency

Yiming Lei, Zilong Li|arXiv (Cornell University)|Oct 15, 2023
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

LICOは、粗いから細かいマニフォールドと最適輸送による視覚的特徴と学習可能なクラス固有の言語プロンプトを整列させることで、説明可能な画像分類を向上させる画期的なフレームワークを提案する。推論のオーバーヘッドなしに、類似度マップの説明可能性と分類精度を向上させ、8つのベンチマークデータセットで既存手法を上回り、Grad-CAMのような後処理解釈技術とも互換性を保つ。

ABSTRACT

Interpreting the decisions of deep learning models has been actively studied since the explosion of deep neural networks. One of the most convincing interpretation approaches is salience-based visual interpretation, such as Grad-CAM, where the generation of attention maps depends merely on categorical labels. Although existing interpretation methods can provide explainable decision clues, they often yield partial correspondence between image and saliency maps due to the limited discriminative information from one-hot labels. This paper develops a Language-Image COnsistency model for explainable image classification, termed LICO, by correlating learnable linguistic prompts with corresponding visual features in a coarse-to-fine manner. Specifically, we first establish a coarse global manifold structure alignment by minimizing the distance between the distributions of image and language features. We then achieve fine-grained saliency maps by applying optimal transport (OT) theory to assign local feature maps with class-specific prompts. Extensive experimental results on eight benchmark datasets demonstrate that the proposed LICO achieves a significant improvement in generating more explainable attention maps in conjunction with existing interpretation methods such as Grad-CAM. Remarkably, LICO improves the classification performance of existing models without introducing any computational overhead during inference. Source code is made available at https://github.com/ymLeiFDU/LICO.

研究の動機と目的

  • 後処理解釈手法におけるワンホットラベルの意味的豊かさの不足により、画像領域と類似度マップの間の対応が弱いため、これを是正すること。
  • CLIPのような大規模なビジョン・ランゲージモデル(VLM)から得られる現実世界の意味的知識を統合することで、ディープラーニングモデルの解釈性を向上させること。
  • 学習可能なプロンプト機構を通じて、視覚的特徴マニフォールドとクラスに依存する言語表現との一貫性ある整列を実現すること。
  • 最適輸送理論を用いて、局所的特徴マップとクラス固有のプロンプトを整列させることで、細粒度の類似度マップ生成を達成すること。
  • 推論時に計算オーバーヘッドをゼロに保ちながら、分類性能を向上させること。

提案手法

  • 事前学習済みのCLIPテキストエンコーダーを用いて、連続空間に埋め込まれた学習可能なクラス固有のプロンプトを導入し、言語と視覚の橋渡しを実現する。
  • 対照的損失を用いて、画像とテキストの特徴分布間のグローバルなマニフォールド整列を確立し、意味的整合性を保証する。
  • 最適輸送(OT)理論を適用して、局所的特徴マップと対応するクラス固有のプロンプトをマッチングさせ、細粒度の注目領域の局所化を可能にする。
  • 交差エントロピー、マニフォールドマッチング、OT整列を組み合わせたマルチタスク損失を用い、分類と解釈性を同時に最適化する。
  • トレーニング可能なMLPを介して、CLIPで埋め込まれたプロンプトを画像特徴空間に投影し、共有されたメトリクス空間での整列を可能にする。
  • 類似度マップの精錬を可能とするプラグインモジュールとして、Grad-CAMのような既存の後処理手法と互換性を維持する。

実験結果

リサーチクエスチョン

  • RQ1大規模なVLMから得られる言語誘導型プロンプトを統合することで、ディープラーニングモデルにおける類似度マップの整合性と解釈性が向上するか?
  • RQ2視覚的特徴マニフォールドとクラスに依存する言語表現を整列させることで、分類性能の向上とより正確な注目領域の局所化が達成されるか?
  • RQ3最適輸送が、クラス固有のプロンプトに局所的特徴マップの割り当てを精緻化するために効果的に使用できるか?
  • RQ4提案手法は、モデル性能と解釈性の向上を維持しながら、推論効率を保っているか?
  • RQ5LICOは、少データ学習(few-shot)およびフルラベル設定において、既存のプロンプトベースおよび後処理解釈手法と比較してどのように性能を発揮するか?

主な発見

  • フル設定下でCUB-200においてLICOはトップ1正解率82.7%を達成し、ベースライン(80.1%)および+CGCベースライン(81.5%)を上回った。
  • Stanford Carsでは、フル設定下でLICOが91.5%のトップ1正解率を記録し、ベースライン(89.7%)および+CGC(90.3%)を上回った。
  • 1ショット学習では、CUB-200でベースライン比3.2%、Stanford Carsで1.0%の正解率向上を達成した。
  • アブレーションスタディにより、マニフォールドマッチング(L_MM)とOT整列(L_OT)の両方が不可欠であることが確認され、併用した場合に最高の性能(トップ1正解率76.27%)を示した。
  • マニフォールドマッチングにおいて、コサイン類似度よりもユークリッド距離を用いる方が優れた結果を示し、CIFAR-100で0.32%の向上を達成した。
  • CUB-200では、挿入スコア57.1および削除スコア15.1という最高水準のスコアを達成し、類似度マップの質と耐性の優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。