Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting the Role of Language Priors in Vision-Language Models

Zhiqiu Lin, Xinyue Chen|arXiv (Cornell University)|Jun 2, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本稿では、視覚言語モデルが与えられた画像から特定のテキストを生成する条件付き確率を用いて、画像-テキスト検索をスコア化する、ゼロショットで訓練を要しないVisualGPTScoreを提案する。テスト時のテキスト分布推定を用いたベイズ再重み付けにより言語の先行確率を是正することで、Winoground や EqBen といった困難なベンチマークで最先端の性能を達成し、複雑なLLM拡張ベースラインでさえも上回る。単一の視覚言語モデルのチェックポイントのみを用いている。

ABSTRACT

Vision-language models (VLMs) are impactful in part because they can be applied to a variety of visual understanding tasks in a zero-shot fashion, without any fine-tuning. We study $ extit{generative VLMs}$ that are trained for next-word generation given an image. We explore their zero-shot performance on the illustrative task of image-text retrieval across 8 popular vision-language benchmarks. Our first observation is that they can be repurposed for discriminative tasks (such as image-text retrieval) by simply computing the match score of generating a particular text string given an image. We call this probabilistic score the $ extit{Visual Generative Pre-Training Score}$ (VisualGPTScore). While the VisualGPTScore produces near-perfect accuracy on some retrieval benchmarks, it yields poor accuracy on others. We analyze this behavior through a probabilistic lens, pointing out that some benchmarks inadvertently capture unnatural language distributions by creating adversarial but unlikely text captions. In fact, we demonstrate that even a "blind" language model that ignores any image evidence can sometimes outperform all prior art, reminiscent of similar challenges faced by the visual-question answering (VQA) community many years ago. We derive a probabilistic post-processing scheme that controls for the amount of linguistic bias in generative VLMs at test time without having to retrain or fine-tune the model. We show that the VisualGPTScore, when appropriately debiased, is a strong zero-shot baseline for vision-language understanding, oftentimes producing state-of-the-art accuracy.

研究の動機と目的

  • 生成的視覚言語モデルが、画像-テキスト検索のような判別的タスクの強力なゼロショットベースラインとして機能できるかどうかを調査すること。
  • 既存の視覚言語ベンチマークが、特に言語の先行確率バイアスのため、モデル間で一貫性のない性能を示す理由を分析すること。
  • 事前学習時とテスト時のテキスト分布のズレを是正する、訓練不要でテスト時に行うバイアス除去手法を開発すること。
  • VisualGPTScoreが是正された場合、複数のベンチマークで最先端のゼロショット性能を達成し、複雑なLLM拡張手法を上回ることを実証すること。

提案手法

  • 本手法は、生成的VLMが特定のテキストを画像から生成する確率P(テキスト|画像)としてVisualGPTScoreを計算し、ゼロショットでの画像-テキストマッチングを可能にする。
  • テスト時におけるテキスト分布推定を用いたベイズ因子Ptest(テキスト)/Ptrain(テキスト)を用いた確率的バイアス除去方式を導入し、推論時に言語の先行確率バイアスを軽減する。
  • バイアス除去プロセスは、1つのノイズ画像を用いてサンプリングによりPtest(テキスト)を推定することで、再訓練なしに効率的なテスト時適応を実現する。
  • 微調整を必要とせず、LLaVA-1.5のような最先端のVLMに適用可能であり、任意の自己回帰的VLMと互換性を持つ。
  • 公開モデルチェックポイントを用いた公平な条件で、Winoground や EqBen を含む9つのベンチマークで評価されている。

実験結果

リサーチクエスチョン

  • RQ1生成的VLMの次トークン予測確率が、画像-テキスト検索の有効なゼロショットスコアとして機能できるか?
  • RQ2強力な生成的VLMを備えても、一部の視覚言語ベンチマークで性能が低いのはなぜか?
  • RQ3事前学習データに含まれる言語の先行確率が、特定のベンチマークでの検索性能をどれほど誤魔化すか?
  • RQ4再訓練や微調整なしに、テスト時に言語の先行確率バイアスを是正できるか?
  • RQ5VisualGPTScoreの是正が、多様なベンチマークで一貫した改善をもたらすか?

主な発見

  • VisualGPTScoreは、不適切なネガティブキャプションを含むARO-Flickrでほぼ完璧な正確度を達成し、実装されたゼロショット性能を示している。
  • Winoground および EqBen では、是正されていないVisualGPTScore(α=0)がそれぞれ36.3%および25.7%のテキスト検索正確度を達成し、CLIPScore や LLM拡張ベースラインを上回った。
  • α=1(1つのノイズ画像を用いて)の是正により、Winoground では44.3%、EqBen では42.9%に性能が向上し、最先端の結果を達成した。
  • 画像入力を無視する「目が見えない」言語モデルですら、不自然なキャプションを含むベンチマークではVLMを上回る性能を示しており、言語バイアスの存在を示している。
  • 是正されたVisualGPTScoreは、ベンチマーク全体で一貫してグループスコアを向上させ、分布シフトに対して堅牢であることを示している。
  • 複雑なLLM拡張手法(VPEval や LLMScore)を上回り、追加の微調整なしに単一のVLMチェックポイントのみを用いている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。