Skip to main content
QUICK REVIEW

[論文レビュー] Interpreting CLIP's Image Representation via Text-Based Decomposition

Yossi Gandelsman, Alexei A. Efros|arXiv (Cornell University)|Oct 9, 2023
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本稿では、CLIPの画像表現を、個々の注目ヘッドと画像パッチへの寄与を割り当てるテキストベースの分解手法を提案する。CLIPの統合視覚言語空間を活用することで、解釈可能な性質固有の注目ヘッドの役割(例:形状、位置)を特定し、54.50 mIoUを達成するゼロショット画像セグメンテーションを実現。従来手法を上回る性能を発揮する。

ABSTRACT

We investigate the CLIP image encoder by analyzing how individual model components affect the final representation. We decompose the image representation as a sum across individual image patches, model layers, and attention heads, and use CLIP's text representation to interpret the summands. Interpreting the attention heads, we characterize each head's role by automatically finding text representations that span its output space, which reveals property-specific roles for many heads (e.g. location or shape). Next, interpreting the image patches, we uncover an emergent spatial localization within CLIP. Finally, we use this understanding to remove spurious features from CLIP and to create a strong zero-shot image segmenter. Our results indicate that a scalable understanding of transformer models is attainable and can be used to repair and improve models.

研究の動機と目的

  • CLIPのビジョントランスフォーマーの個々の構成要素が最終的な画像表現にどのように寄与しているかを理解すること。
  • CLIPのテキストエンコーダーからの自然言語記述を用いて、注目ヘッドと画像パッチを解釈すること。
  • 誤った手がかりに関連するヘッドをアブレーションすることで、下流タスクにおける誤った相関を低減すること。
  • 解釈可能で性質固有の表現に基づく強力なゼロショット画像セグメンテーション手法を開発すること。
  • スケーラブルなトランスフォーマー・モデルの解釈が、モデルの修復と性能向上に繋がることを示すこと。

提案手法

  • 残留接続を用いて、画像パッチ、注目ヘッド、モデルレイヤーごとにCLIPの画像表現を和に分解する。
  • TextSpanアルゴリズムを適用し、各注目ヘッドの出力空間に自然言語記述による解釈可能な基底を特定する。
  • 空間的注目メカニズムを用いて、各基底方向に対して特定の画像位置への寄与を割り当てる。
  • ヘッドと画像トークンの両方を同時に分解することで、各テキストラベル付き方向に寄与する領域を可視化する。
  • 誤った手がかりに関連するヘッドをアブレーションし、Waterbirdsデータセットで検証する。
  • 空間的分解と性質固有のヘッド表現を組み合わせることで、ゼロショット画像セグメンテーション器を構築する。

実験結果

リサーチクエスチョン

  • RQ1CLIP-ViTのどの注目ヘッドが、形状、色、位置などの特定の視覚的属性をエンコードしているか?
  • RQ2個々の注目ヘッドの出力空間をカバーする自然言語記述を自動で発見できるか?
  • RQ3CLIPの表現に、出現する空間的局在化は存在するか? また、それはゼロショットセグメンテーションに活用可能か?
  • RQ4誤った手がかりに関連するヘッドを除去することで、バイアスのかかっているデータセットにおける最悪グループの正確性が向上するか?
  • RQ5ヘッドと画像トークンの共同分解により、発見されたテキストベースの方向の解釈可能性が検証できるか?

主な発見

  • 最後の4つのレイヤーを除くすべての注目ヘッドをアブレーションしても、ゼロショット分類精度にほとんど影響がないため、画像表現は主に後段のレイヤーが構築していることが示された。
  • TextSpanは、注目ヘッドに解釈可能な性質固有の役割を特定した。例として、「二等辺三角形」や「楕円」のような形状に特化したヘッドが存在した。
  • 誤った手がかりに関連するヘッドを除去することで、Waterbirdsデータセットにおける最悪グループの正確性が48%から73%に向上した。
  • ヘッドと画像トークンの共同分解により、テキスト記述(例:エッフェル塔)と一致する領域が、対応する基底方向に主に寄与していることが明らかになった。
  • 提案手法のゼロショット画像セグメンテーション器は、ImageNet-segmentationで54.50 mIoUを達成し、LRP、GradCAM、Rolloutなどの既存手法を上回った。
  • 本手法により、色、位置、テクスチャといった発見された意味的類似性に基づくリtrievalが可能となり、分類を超えた実用性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。