[論文レビュー] MedVH: Towards Systematic Evaluation of Hallucination for Large Vision Language Models in the Medical Context
本稿では、視覚的質問応答、レポート生成、誤った自信の裏付けに関する5つのタスクに焦点を当てた、医療大規模ビジョン言語モデル(LVLM)における幻覚の評価のための新規ベンチマークMedVHを紹介する。標準的な医療タスクでは優れたパフォーマンスを示すが、一般モデルと比較して医療LVLMは幻覚の発生率がより高いことが判明し、臨床応用における重要な信頼性の懸念を示している。
Large Vision Language Models (LVLMs) have recently achieved superior performance in various tasks on natural image and text data, which inspires a large amount of studies for LVLMs fine-tuning and training. Despite their advancements, there has been scant research on the robustness of these models against hallucination when fine-tuned on smaller datasets. In this study, we introduce a new benchmark dataset, the Medical Visual Hallucination Test (MedVH), to evaluate the hallucination of domain-specific LVLMs. MedVH comprises five tasks to evaluate hallucinations in LVLMs within the medical context, which includes tasks for comprehensive understanding of textual and visual input, as well as long textual response generation. Our extensive experiments with both general and medical LVLMs reveal that, although medical LVLMs demonstrate promising performance on standard medical tasks, they are particularly susceptible to hallucinations, often more so than the general models, raising significant concerns about the reliability of these domain-specific models. For medical LVLMs to be truly valuable in real-world applications, they must not only accurately integrate medical knowledge but also maintain robust reasoning abilities to prevent hallucination. Our work paves the way for future evaluations of these studies.
研究の動機と目的
- 医療分野におけるドメイン特化型LVLMにおける幻覚の系統的評価の欠如に応えること。
- 多様な医療画像およびテキスト入力に対して幻覚感受性をテストできるベンチマークの開発。
- 一般モデルと医療ファインチューニング済みLVLMの間で幻覚発生率を比較すること、特に小規模データセットでのファインチューニング後の影響を特に検証すること。
- プロンプトの表現方法や構成が、幻覚的応答に対するモデルの頑健性に与える影響を調査すること。
- 実臨床応用に向けたより信頼性が高く、幻覚に強い医療LVLMの開発を促進すること。
提案手法
- RAD-VQA、SLAKE、PMC-VQA、Path-VQA、VQA-Med-2021、MIMIC-Diff-VQAを含む複数の公開データセットを合成して、複数選択式VQAタスク用にMedVHを構築した。
- 長文医療レポート生成タスクの評価のため、実際のMIMIC-CXRレポートを統合した。
- 誤った画像と臨床的に誤った質問を想定した2つの専用タスクを設計し、誤った視覚的およびテキスト的入力へのモデルの耐性をテストした。
- 一般モデル(例:GPT-4V、LLaVA)、医療特化モデル(例:LLaVA-Med、Med-Flamingo)、CXRファインチューニング済みモデル(例:CheXAgent、LLM-CXR)を含む多様なLVLMを評価した。
- プロンプトの表現方法の影響を評価するため、アブレーションスタディを実施。具体的には、「上記のどれとも違う」を理想の否定選択肢に置き換えた。
- モデルの不確実性を促すヒントをプロンプトに組み込むことで、不確実性への誘導が幻覚耐性に与える影響をテストした。

実験結果
リサーチクエスチョン
- RQ1一般LVLMと比較して、医療LVLMは幻覚検出タスクでどのように性能を発揮するか?
- RQ2プロンプトの表現方法が、医療LVLMの幻覚感受性にどの程度影響を与えるか?
- RQ3ヒントを含む戦略的プロンプト設計により、モデルの頑健性を向上させられるか?特に、誤りの可能性についてのヒントが効果を示すか?
- RQ4長文出力生成が、医療LVLMにおける幻覚リスクをどのように拡大させるか?
- RQ5小規模な医療データセットでのファインチューニングが、LVLMにおける幻覚発生率に与える影響は何か?
主な発見
- 標準医療ベンチマークでは優れたパフォーマンスを示すが、一般LVLMと比較して医療LVLMは顕著に高い幻覚発生率を示した。
- ChatGPT-4Vは、「上記のどれとも違う」を提示された場合、理想的な否定選択肢に比べて精度が低下した。これは、プロンプトの表現方法に感受性があることを示している。
- LLaVAは「上記のどれとも違う」を選択する傾向が強く、曖昧または誤った選択肢の処理においてバイアスがあると考えられる。
- CheXAgentは、誤った選択肢の表現を単純化した場合に性能が向上した。これは、複雑な否定表現下での推論に限界があることを示している。
- プロンプトにヒントを組み込むことで、ほとんどのモデルで幻覚耐性が向上したが、MiniGPTを除いては同様の傾向が見られた。これは、プロンプト工学による頑健性向上の有効性を示している。
- ベンチマークの結果、高いタスク精度を達成しても、医療LVLMは誤ったまたは誤解を招く入力に対して過剰な自信を示す傾向にあり、幻覚のリスクに依然として脆弱であることが判明した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。