Skip to main content
QUICK REVIEW

[論文レビュー] TouchStone: Evaluating Vision-Language Models by Language Models

Shuai Bai, Shusheng Yang|arXiv (Cornell University)|Aug 31, 2023
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本稿では、視覚言語モデル(LVLM)の多様な能力を評価するために、大規模言語モデル(LLM)をジャッジとして用いる自動評価フレームワーク「TouchStone」を提案する。複数モodal入力を詳細な画像アノテーションを通じてテキストに変換することで、GPT-4が人間の好みと高い整合性を保ったまま対話の質をスコア化できるようになり、現在のLVLMに顕著な幻覚(hallucination)が存在することを明らかにするとともに、改善の鍵となる分野を同定する。

ABSTRACT

Large vision-language models (LVLMs) have recently witnessed rapid advancements, exhibiting a remarkable capacity for perceiving, understanding, and processing visual information by connecting visual receptor with large language models (LLMs). However, current assessments mainly focus on recognizing and reasoning abilities, lacking direct evaluation of conversational skills and neglecting visual storytelling abilities. In this paper, we propose an evaluation method that uses strong LLMs as judges to comprehensively evaluate the various abilities of LVLMs. Firstly, we construct a comprehensive visual dialogue dataset TouchStone, consisting of open-world images and questions, covering five major categories of abilities and 27 subtasks. This dataset not only covers fundamental recognition and comprehension but also extends to literary creation. Secondly, by integrating detailed image annotations we effectively transform the multimodal input content into a form understandable by LLMs. This enables us to employ advanced LLMs for directly evaluating the quality of the multimodal dialogue without requiring human intervention. Through validation, we demonstrate that powerful LVLMs, such as GPT-4, can effectively score dialogue quality by leveraging their textual capabilities alone, aligning with human preferences. We hope our work can serve as a touchstone for LVLMs' evaluation and pave the way for building stronger LVLMs. The evaluation code is available at https://github.com/OFA-Sys/TouchStone.

研究の動機と目的

  • 視覚言語モデル(LVLM)の包括的で自動化された評価の不足に応えること、特に会話的および創造的能力に関する評価を目的とする。
  • 人間による評価の限界を克服し、強力なLLMをジャッジとして用いたスケーラブルな自動化手法を開発すること。
  • 細かく分類された人間のアノテーションと比較することで、LVLMにおける幻覚を体系的かつ定量的に評価すること。
  • 認識、理解、文学的創作をカバーする多様でオープンワールドな視覚対話データセットを構築すること。
  • 人間のアノテーターや視覚拡張モデルを介さずに、直接的かつ効率的で信頼性の高いLVLMの性能評価を可能にすること。

提案手法

  • 記述的、認識的、理解的、物語作成的、複数画像分析の5つの能力カテゴリーにわたり27のサブタスクを含むTouchStoneデータセットを構築する。
  • 視覚的入力をLLMが理解可能なテキスト形式に変換するため、詳細な画像アノテーションと記述を生成する。
  • GPT-4をジャッジモデルとして用い、正しさ、関連性、有用性に基づくペアワイズ比較を通じて対話の質を評価する。
  • GPT-4-HA(人間補助)の出力をリファレンス出力として用い、細かく分類された画像アノテーションと質問から導出する。
  • ペアワイズ比較における位置バイアスを軽減するため、位置バランススコアリングを実装する。
  • モデルが出力した記述と人間のアノテーションをGPT-4に投入し、幻覚の深刻度を予測することで幻覚を測定する。

実験結果

リサーチクエスチョン

  • RQ1GPT-4のような強力なLLMは、人間の干渉なしに、マルチモーダル対話の質を信頼できるジャッジとして機能できるか?
  • RQ2現在のLVLMはどの程度幻覚を示しており、LLMベースの評価によってその幻覚は定量的に測定可能か?
  • RQ3LVLMは、視覚的物語作成や複数画像の推論を含む多様な能力において、人間の好みと比べてどの程度の性能を示すか?
  • RQ4入力画像の解像度とプロンプト設計は、LVLMにおける幻覚を軽減する役割を果たすか?
  • RQ5LLMジャッジを用いた自動評価は、人間の好み順位付けと強い整合性を示せるか?

主な発見

  • GPT-4をジャッジとして用いることで、対話の質評価において人間の好みと強い整合性を示し、LLMベースの自動評価の実現可能性を裏付けた。
  • PandaGPTは最高の幻覚スコア(835.5)を示し、これは視覚的入力が限られている(例:ImageBindのcls埋め込みのみ)ため、深刻な幻覚を示している可能性が高い。
  • InstructBLIPとQwen-VLは最低の幻覚スコア(519.0と504.5)を示し、短く簡潔な出力は幻覚リスクを低減する傾向があると考えられる。
  • 現在のLVLMは空間的理解や複雑な視覚的関係の把握に苦労しており、より良い空間的・構造的モデリングの必要性が示された。
  • 224×224を超える高解像度の画像入力は、細部や小さな物体の認識を向上させ、出力の正確性を向上させることに寄与する。
  • ウェブページや記事などのインタリーブド画像・テキストデータを用いた複数画像の事前学習は、複数画像にわたる推論や要約能力の向上に寄与する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。