[論文レビュー] AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation
本稿では、生成的および識別的タスクの両方において、マルチモodal Large Language Models (MLLMs)における幻覚現象を評価するためのLLMフリーで多次元のベンチマーク、AMBERを紹介する。この手法により、外部LLMに依存せずに、存在、属性、関係に関する幻覚をコスト効率よく自動的に評価可能であり、GPT-4Vですら顕著な幻覚を示すことが判明した—特に属性および関係の理解において顕著である。
Despite making significant progress in multi-modal tasks, current Multi-modal Large Language Models (MLLMs) encounter the significant challenge of hallucinations, which may lead to harmful consequences. Therefore, evaluating MLLMs' hallucinations is becoming increasingly important in model improvement and practical application deployment. Previous works are limited in high evaluation costs (e.g., relying on humans or advanced LLMs) and insufficient evaluation dimensions (e.g., types of tasks and hallucinations). In this paper, we propose an LLM-free multi-dimensional benchmark AMBER, which can be used to evaluate both generative task and discriminative task including existence, attribute and relation hallucination. Based on AMBER, we design a low-cost and efficient evaluation pipeline. Additionally, we conduct a comprehensive evaluation and detailed analysis of mainstream MLLMs including GPT-4V(ision), and also give guideline suggestions for mitigating hallucinations. The data and code of AMBER are available at https://github.com/junyangwang0410/AMBER.
研究の動機と目的
- 人間のアノテーションや高度なLLMに依存する既存の幻覚評価ベンチマークの高コストと範囲の狭さに対処する。
- 存在、属性、関係の複数の幻覚タイプをカバーする包括的で多次元のベンチマークを構築し、生成的および識別的タスクの両方を網羅する。
- 外部の高価なモデルに依存しないLLMフリーで自動化された評価パイプラインを設計し、依存性を低減しスケーラビリティを向上させる。
- GPT-4Vを含む主流のMLLMの実証的分析を行い、持続的な幻覚パターンを特定し、緩和戦略の指針を示す。
提案手法
- 曖昧性を最小限に抑えるために、明確な視覚的コンテンツと明確に定義されたオブジェクトを備えた、高品質でトレーニング画像でないデータセットを収集する。
- 各画像に対して、オブジェクトの存在、属性(例:色、状態、数)、空間的・時間的関係について、正確で多段階のラベルを付与する。
- 外部LLMに依存せずに、モデル出力と正解アノテーションを比較するためのルールベースおよびNLPベースの技術(例:spaCy、NLTK)を用いた自動評価パイプラインを設計する。
- タスク固有の評価プロトコルを実装する:生成的タスクでは、生成されたテキストを基準アノテーションと比較する。識別的タスクでは、存在、属性、関係に関する主張に対して二値分類を実施する。
- F1スコアと正答率を主な指標として用い、さまざまな幻覚タイプとタスクにおける幻覚率を定量化する。
- GPT-4Vを含む多様なMLLMを評価するためのベンチマークを適用し、性能を分析し、失敗モードを同定する。
実験結果
リサーチクエスチョン
- RQ1完全にLLMフリーなベンチマークは、生成的および識別的MLLMタスクにおける幻覚を効果的に評価できるか?
- RQ2GPT-4Vを含む主流のMLLMは、統一的で多次元のベンチマーク上で、存在、属性、関係の各幻覚タイプに対してどのように性能を示すか?
- RQ3MLLMにおける属性および関係の幻覚の主な失敗モードは何か?また、モデルアーキテクチャによってその特徴はどのように変化するか?
- RQ4ルールベースの自動評価パイプラインは、LLMに依存せずに、どの程度信頼性のある幻覚検出を達成できるか?
主な発見
- AMBERは、生成的および識別的タスクの両方において、LLMフリーで自動化された幻覚評価を成功裏に実現し、評価コストを低減するとともにスケーラビリティを向上させた。
- GPT-4Vですら顕著な幻覚を示しており、特に属性および関係の理解において顕著である。属性幻覚のF1スコアは約0.7、関係幻覚のF1スコアは約0.6であった。
- MLLMは、オブジェクトの状態や数に関する細分化された属性幻覚に対しては著しく低い性能を示しており、こうした属性に焦点を当てたデータの収集改善が求められる。
- 一方、行動関連の幻覚では、MLLMは比較的高い性能を示しており、オープンソースモデルは一部のケースでGPT-4Vを上回ることもあった。これは、行動理解の学習が効果的に行われている可能性を示唆している。
- 関係幻覚は最も深刻であり、大多数のモデルが約60%の正答率にとどまり、関係記述のトレーニングデータが偏っているか希少である可能性が原因と考えられる。
- ベンチマークは、GPT-4Vにおける誤ったオブジェクト関係や誤った属性主張といった幻覚を効果的に検出できており、その感受性と信頼性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。