[論文レビュー] LVLM-Interpret: An Interpretability Tool for Large Vision-Language Models
LVLM-Interpret は、画像パッチと生成トークンの間の注目度、関連性、因果関係を可視化する、大規模なビジョン・ランゲージ モデル (LVLM) のためのインタラクティブな解釈ツールである。LLaVA で実証されたように、ユーザーが幻覚やモデルの失敗を診断できる。出力に最も影響を与える画像領域とテキストトークンを特定することで、モデルが視覚的入力よりもフレーズに依存しているケースを明らかにする。
In the rapidly evolving landscape of artificial intelligence, multi-modal large language models are emerging as a significant area of interest. These models, which combine various forms of data input, are becoming increasingly popular. However, understanding their internal mechanisms remains a complex task. Numerous advancements have been made in the field of explainability tools and mechanisms, yet there is still much to explore. In this work, we present a novel interactive application aimed towards understanding the internal mechanisms of large vision-language models. Our interface is designed to enhance the interpretability of the image patches, which are instrumental in generating an answer, and assess the efficacy of the language model in grounding its output in the image. With our application, a user can systematically investigate the model and uncover system limitations, paving the way for enhancements in system capabilities. Finally, we present a case study of how our application can aid in understanding failure mechanisms in a popular large multi-modal model: LLaVA.
研究の動機と目的
- 大規模ビジョン・ランゲージ モデル (LVLM) の複雑な推論を解釈する課題、特に視覚的入力との不一致や幻覚に関する課題に対処すること。
- LVLM が出力をどのように画像およびテキスト入力に根ざしているかを体系的に調査できるインタラクティブなインターフェースの開発。
- 注目度と関連性分析を用いて、テキストのフレーズに過度に依存するなど、LVLM の失敗メカニズムを同定すること。
- 実世界の失敗事例、たとえば同じ画像に対して質問の言い回しによって矛盾する応答を示すケースにおけるモデル行動の診断に、本ツールの有効性を実証すること。
- ビジョンエンコーダーと凍結された言語モデル フロントエンドを備えた任意のトランスフォーマー基盤 LVLM に適用可能な汎用的な解釈フレームワークを提供すること。
提案手法
- 本ツールは、すべてのトランスフォーマー層とヘッドにおける画像パッチとテキストトークン間の原始的注目度重みを可視化し、特定の出力トークンに影響を与える画像領域をユーザーが検査できるようにする。
- 勾配に基づく属性付け手法を用いて、トークンレベルの関連性スコアを計算し、モデルの出力に最も影響を与える入力特徴(画像またはテキスト)を強調表示する。
- 因果的発見アルゴリズムにより、最終層の注目度行列から部分的祖先グラフを構築し、特定の出力トークンに条件的に影響を与える最小の画像およびテキストトークンの集合を同定する。
- インターフェースは、画像編集によるインタラクティブなプローブをサポートしており、ユーザーが入力画像を変更し、注目度と出力の変化を観察できる。
- システムは、原始的注目度、関連性マップ、因果グラフの複数の解釈技術を、Gradio を用いて構築された統合的かつ使いやすいダッシュボードに統合する。
- 本フレームワークは、LLaVA-v1.5-7b に適用され、視覚的曖昧性やテキスト操作による失敗事例を分析するために MMVP ベンチマークが使用された。

実験結果
リサーチクエスチョン
- RQ1LVLM における注目度パターンは、視覚的入力が曖昧または誤解を招く場合に、モデルの幻覚とどのように相関するか?
- RQ2LVLM が回答を生成する際、どの程度テキストのフレーズに依存しているか、視覚的コンテンツに比べて、その依存度はどのように定量的に測定できるか?
- RQ3因果的解釈手法は、特定の出力トークンに影響を与える最小の画像パッチおよびテキストトークンの集合を同定できるか? これにより、モデルの失敗の診断が可能になるか?
- RQ4敵対的画像編集は注目度と出力にどのように影響するか? また、モデルの耐性について何が明らかになるか?
- RQ5LVLM-Interpret のような解釈ツールは、視覚的特徴よりもプロンプトの言い回しに過剰に適合するなど、LVLM に系統的なバイアスが存在するのを明らかにできるか?
主な発見
- LLaVA は、質問の言い回しによって同じ画像に対して一貫性のない応答を示す—例として、ゴミ収集車のドアが開いているか閉じているかを異なるように述べる—これは、テキスト的ヒントに過度に依存していることを示している。
- 関連性マップは、このような失敗事例において、テキストトークンの関連性スコアが画像トークンよりも顕著に高いことを示しており、モデルが視覚的入力に根ざした出力を生成していないことを確認している。
- 一方で、LLaVA が正しく物体の属性(例:シャツの色)を特定する場合、関連性スコアは画像トークンの方がテキストトークンよりも高くなる。これは視覚的一致性を示している。
- 因果グラフ解析により、特定の出力トークン(例:色「イエロー」)に影響を与える最小の画像パッチの集合を効果的に同定でき、モデルの推論を標的的にプローブ可能である。
- 本ツールは、MMVP データセットの CLIP 盲点ペアにおいて、画像が視覚的に明確に区別できる場合でも、視覚的特徴とテキスト的質問の間で注目度が不一致になるため、LLaVA がしばしば失敗することを明らかにした。
- 画像編集実験により、視覚的特徴が変更されるとモデルの出力が予測可能に変化することが確認されたが、その変化はモデルが正しい画像領域に注目している場合に限られ、注目度可視化が失敗の診断においていかに重要であるかを強調している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。