[論文レビュー] NLX-GPT: A Model for Natural Language Explanations in Vision and Vision-Language Tasks
NLX-GPTは、視覚および視覚言語タスクにおける答えの予測と自然言語による説明の生成を統合的に処理するコンactな言語モデルを提案する。答えの予測をテキスト生成タスクとして定式化することで、別個のタスクモデルを不要にし、VQA-X、ACT-X、e-SNLI-VEで最先端の性能を達成。推論速度は15倍速く、メモリ使用量も削減された。また、説明の質を評価する2つの新しい自己評価フレームワークを導入した。
Natural language explanation (NLE) models aim at explaining the decision-making process of a black box system via generating natural language sentences which are human-friendly, high-level and fine-grained. Current NLE models explain the decision-making process of a vision or vision-language model (a.k.a., task model), e.g., a VQA model, via a language model (a.k.a., explanation model), e.g., GPT. Other than the additional memory resources and inference time required by the task model, the task and explanation models are completely independent, which disassociates the explanation from the reasoning process made to predict the answer. We introduce NLX-GPT, a general, compact and faithful language model that can simultaneously predict an answer and explain it. We first conduct pre-training on large scale data of image-caption pairs for general understanding of images, and then formulate the answer as a text prediction task along with the explanation. Without region proposals nor a task model, our resulting overall framework attains better evaluation scores, contains much less parameters and is 15$ imes$ faster than the current SoA model. We then address the problem of evaluating the explanations which can be in many times generic, data-biased and can come in several forms. We therefore design 2 new evaluation measures: (1) explain-predict and (2) retrieval-based attack, a self-evaluation framework that requires no labels. Code is at: https://github.com/fawazsammani/nlxgpt.
研究の動機と目的
- 既存のNLEモデルが別個のタスクモデルと説明モデルに依存するため、推論と説明の間の断絶を是正すること。
- 専用の視覚言語タスクモデルを不要にすることで、メモリと推論のオーバーヘッドを削減すること。
- 答えの生成と説明生成を同時に学習することで、説明の忠実性と一貫性を向上させること。
- 人間がアノテートした説明なしで、説明の正しさ、推論、バイアスを評価可能なラベルフリーの評価フレームワークを開発すること。
- 単一でコンactなモデルが、マルチステージの最先端手法に比べて速度と性能の両面で優れていることを実証すること。
提案手法
- 言語モデルを用いて、答えの予測と説明生成を1つのテキスト生成タスクとして定式化する。
- 大規模な画像キャプションペアで事前学習することで、一般の視覚的・言語的理解を学習する。
- 画像をエンコードするための視覚エンコーダ(例:CLIP ViT)を用い、言語モデルをエンコードされた視覚特徴に条件づける。
- 視覚特徴と答えおよび説明のトークンをアライメントさせるために、エンドツーエンドでクロスアテンション機構を用いて学習する。
- 2つの自己評価フレームワークを導入する:(1) explain-predictは、答えの予測性能を用いて説明の質を測定する。そして(2) リトリーブベースの攻撃は、正解の説明との類似性を用いて説明の忠実性を評価する。
- 答えと説明生成の両方の交差エントロピー損失を統合したユニフィード損失を用い、共同最適化を可能にする。

実験結果
リサーチクエスチョン
- RQ1別個のタスクモデルに依存せずに、単一でコンactな言語モデルが正確な答えと忠実な自然言語の説明を同時に生成できるか?
- RQ2答えの生成と説明生成を同時に学習することで、分離されたアプローチと比較して説明の忠実性と推論の一貫性がどのように向上するか?
- RQ3explain-predict やリトリーブベースの攻撃といった自己評価フレームワークは、人間のアノテーションなしで説明の質を効果的に測定できるか?
- RQ4画像キャプションデータでの事前学習は、下流のNLEタスクでの性能向上にどの程度寄与するか?
- RQ5異なる視覚エンコーダ(例:ViT、ResNet、DeiT)は、統合されたNLX-GPTフレームワークの性能にどのように影響を与えるか?
主な発見
- NLX-GPTは、VQA-X、ACT-X、e-SNLI-VEベンチマークで最先端の性能を達成し、ほとんどの指標で先行するSoAモデルを上回った。
- 従来のマルチステージNLEモデルが別個のタスクモデルと説明モデルに依存するのに対し、NLX-GPTは15倍高速で、顕著に少ないメモリ使用量を実現した。
- 画像キャプションデータでの事前学習が性能向上に顕著に寄与し、CLIP視覚変換器がすべてのタスクで最良の結果を達成した。
- explain-predict 評価フレームワークは、高品質な説明がより良い答えの予測をもたらすことを示し、モデルの内部整合性を裏付けた。
- リトリーブベースの攻撃フレームワークは、NLX-GPTが内挿距離スコアが低くなるような説明を生成することを示し、忠実性が高くバイアスが少ないことを裏付けた。
- アブレーションスタディにより、事前学習と視覚エンコーダの選択が最終的な性能に顕著な影響を与えることが確認され、CLIP ViTがResNet-101 やボトムアップ特徴量を上回った。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。