Skip to main content
QUICK REVIEW

[論文レビュー] Visual Explanations of Image-Text Representations via Multi-Modal Information Bottleneck Attribution

Ying Wang, Tim G. J. Rudner|arXiv (Cornell University)|Dec 28, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、不要な特徴を圧縮しながら関連する視覚的および言語的情報を保持する情報理論的アプローチであるマルチモーダル情報ボトルネック(M2IB)アトリビューションを提案する。M2IBは、自己教師あり学習やアトリビューションの基準ラベルを必要とせず、医療など安全が重要な分野においても、勾配ベース、摂動ベース、アテンションベースの手法を上回るアトリビューション精度と解釈可能性を達成する。

ABSTRACT

Vision-language pretrained models have seen remarkable success, but their application to safety-critical settings is limited by their lack of interpretability. To improve the interpretability of vision-language models such as CLIP, we propose a multi-modal information bottleneck (M2IB) approach that learns latent representations that compress irrelevant information while preserving relevant visual and textual features. We demonstrate how M2IB can be applied to attribution analysis of vision-language pretrained models, increasing attribution accuracy and improving the interpretability of such models when applied to safety-critical domains such as healthcare. Crucially, unlike commonly used unimodal attribution methods, M2IB does not require ground truth labels, making it possible to audit representations of vision-language pretrained models when multiple modalities but no ground-truth data is available. Using CLIP as an example, we demonstrate the effectiveness of M2IB attribution and show that it outperforms gradient-based, perturbation-based, and attention-based attribution methods both qualitatively and quantitatively.

研究の動機と目的

  • 医療など安全が重要な分野における、CLIPのようなビジョン・ランゲージ事前学習モデル(VLPM)の解釈性を向上させること。
  • 基準ラベルに依存しないマルチモーダルアトリビューション手法を開発し、ラベルが入手不可な状況でも表現の監査可能性を可能にすること。
  • 情報ボトルネックの原則を応用し、視覚的および言語的モダリティの両方で不要な特徴を統合的に圧縮しながら、タスク関連の情報を保持すること。
  • 定性的および定量的評価を通じて、M2IBが勾配ベース、摂動ベース、アテンションベースのアトリビューション手法を上回ることを実証的に検証すること。

提案手法

  • 一方のモダリティの特徴が他方のモダリティの特徴から与えられたときの尤度を最大化するマルチモーダル情報ボトルネックの原則を定式化する。
  • 情報ボトルネックの原則から、計算可能な最適化目的関数を導出するために変分近似を用いる。
  • アトリビューションパラメータに関して最適化を行い、不要な特徴を特定・抑制し、画像およびテキスト用のサリエンシーマップを生成する。
  • モデル内の特定のレイヤー(例:レイヤー9)の直後に情報ボトルネックを挿入することで、モダリティ固有のアトリビューションを可能にする。
  • CLIPに本手法を適用し、ImageBindなどの他のモデルにも拡張することで、多様なマルチモーダルアーキテクチャとの互換性を示す。
  • 最適なハイパーパrameterを体系的に選択し、耐性を評価するためにROAR+スコアを用いる。

実験結果

リサーチクエスチョン

  • RQ1情報理論的アプローチのアトリビューション手法は、基準ラベルを必要とせずにビジョン・ランゲージモデルの解釈性を向上させることができるか?
  • RQ2M2IBは、勾配ベース、摂動ベース、アテンションベースの手法と比較して、関連する画像およびテキスト特徴をどれほど正確に局所化できるか?
  • RQ3M2IBは、モデル重みの変更に敏感なサリエンシーマップを生成するか?これは、信頼できるアトリビューションを示唆する。
  • RQ4M2IBは、音声、深度、赤外データなどの視覚および言語以外のモダリティを含むマルチモーダルモデルへも一般化可能か?
  • RQ5ハイパーパrameterの選択が、M2IBアトリビューションマップの品質および一貫性にどのように影響するか?

主な発見

  • M2IBは、画像・テキストアトリビューションタスクにおいて、定性的および定量的評価の両面で、勾長ベース、摂動ベース、アテンションベースの手法を顕著に上回る。
  • ベースライン手法と比較して、M2IBはより正確で局所化されたサリエンシーマップを生成し、特に画像内の関連する物体全体を識別する点で優れている。
  • 本手法は「健全性のチェック」に合格している:モデル重みの摂動に伴いアトリビューションスコアが意味的に変化しており、モデル挙動に敏感であることが確認された。
  • 微調整されたモデルに対しては、事前学習モデルよりも高品質なアトリビューションマップが生成される。これは、下流タスクの特徴とより良好に一致していることを示している。
  • M2IBは視覚および言語を越えたマルチモーダルモデルに対しても有効であり、音声や赤外データを含む6つの異なるモダリティを備えたImageBindでも有効であることが実証された。
  • ハイパーパrameterの選択はアトリビューション品質に顕著な影響を及ぼし、ROAR+スコアは最適な設定を特定するのに有効である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。