Skip to main content
QUICK REVIEW

[논문 리뷰] MedVH: Towards Systematic Evaluation of Hallucination for Large Vision Language Models in the Medical Context

Zishan Gu, Changchang Yin|arXiv (Cornell University)|2024. 07. 03.
Anomaly Detection Techniques and Applications인용 수 4
한 줄 요약

이 논문은 시각질문응답, 보고서 생성, 잘못된 자신감의 정당화에 초점을 맞춘 다섯 가지 작업을 통해 의료 대규모 시각언어 모델(LVLM)에서의 환각 현상 평가를 위한 새로운 벤치마크인 MedVH를 소개한다. 표준 의료 과제에서 뛰어난 성능을 보이지만, 일반 모델보다 의료 LVLM에서 환각 발생률이 높아 임상 응용 분야에서의 신뢰성에 심각한 문제를 제기한다.

ABSTRACT

Large Vision Language Models (LVLMs) have recently achieved superior performance in various tasks on natural image and text data, which inspires a large amount of studies for LVLMs fine-tuning and training. Despite their advancements, there has been scant research on the robustness of these models against hallucination when fine-tuned on smaller datasets. In this study, we introduce a new benchmark dataset, the Medical Visual Hallucination Test (MedVH), to evaluate the hallucination of domain-specific LVLMs. MedVH comprises five tasks to evaluate hallucinations in LVLMs within the medical context, which includes tasks for comprehensive understanding of textual and visual input, as well as long textual response generation. Our extensive experiments with both general and medical LVLMs reveal that, although medical LVLMs demonstrate promising performance on standard medical tasks, they are particularly susceptible to hallucinations, often more so than the general models, raising significant concerns about the reliability of these domain-specific models. For medical LVLMs to be truly valuable in real-world applications, they must not only accurately integrate medical knowledge but also maintain robust reasoning abilities to prevent hallucination. Our work paves the way for future evaluations of these studies.

연구 동기 및 목표

  • 의료 맥락 내에서 도메인 특화 LVLM의 환각 현상에 대한 체계적인 평가 부족 문제를 해결하기 위해.
  • 다양한 의료 시각적 및 텍스트 입력에 대한 환각에 대한 취약성을 테스트할 수 있는 벤치마크를 개발하기 위해.
  • 작은 데이터셋으로 미세조정된 일반 모델과 의료 전용 미세조정 모델 간의 환각 발생률를 비교하기 위해.
  • 프롬프트 표현 방식과 설계가 모델의 환각 응답에 대한 내성에 어떤 영향을 미치는지 조사하기 위해.
  • 실제 임상 현장에 도입 가능한 더 신뢰성 있고 환각에 강건한 의료 LVLM의 개발을 촉진하기 위해.

제안 방법

  • 다양한 공개 데이터셋, 즉 RAD-VQA, SLAKE, PMC-VQA, Path-VQA, VQA-Med-2021, MIMIC-Diff-VQA를 융합하여 다중 선택 시각질문응답 과제를 위한 MedVH를 구축하였다.
  • 장기적인 의료 보고서 생성 과제를 평가하기 위해 실제 MIMIC-CXR 보고서를 통합하여 확장된 출력에서의 환각 현상을 평가하였다.
  • 모델이 오해의 소재가 되는 시각적 및 텍스트적 입력에 대한 저항력을 테스트하기 위해 '잘못된 이미지'와 '임상적으로 잘못된 질문'이라는 두 가지 전용 과제를 설계하였다.
  • 일반 모델(예: GPT-4V, LLaVA), 의료 전용 모델(예: LLaVA-Med, Med-Flamingo), 그리고 CXR에 대해 미세조정된 모델(예: CheXAgent, LLM-CXR)을 포함한 다양한 LVLM을 평가하였다.
  • 프롬프트 표현 방식에 대한 분석을 위해, 이상적인 否정 선택지 대신 '위에 언급된 바가 없음'을 사용하여 문장 구성에 대한 민감도를 평가하는 분석을 수행하였다.
  • 모델이 불확실성에 대해 유도하는 힌트를 프롬프트에 통합하여, 불확실성 유도가 환각에 대한 저항력 향상에 어떤 영향을 미치는지 테스트하였다.
Figure 1: Overall evaluation framework.
Figure 1: Overall evaluation framework.

실험 결과

연구 질문

  • RQ1의료 LVLM은 일반 LVLM에 비해 환각 탐지 과제에서 어떻게 성능을 보이나?
  • RQ2프롬프트 표현 방식은 의료 LVLM의 환각에 대한 취약성에 어느 정도 영향을 미치는가?
  • RQ3예를 들어 오류 가능성에 대한 힌트를 포함한 전략적 프롬프트 설계를 통해 모델의 내성은 향상될 수 있는가?
  • RQ4장기적인 응답 생성은 의료 LVLM에서 환각 위험을 어떻게 증폭시키는가?
  • RQ5작은 의료 데이터셋으로의 미세조정은 LVLM의 환각 발생률에 어떤 영향을 미치는가?

주요 결과

  • 의료 LVLM는 표준 의료 벤치마크에서 뛰어난 성능를 보이지만, 일반 LVLM보다 훨씬 높은 환각 발생률을 보였다.
  • ChatGPT-4V는 '위에 언급된 바가 없음'으로 프롬프트를 변경할 경우 정확도가 감소하여 프롬프트 표현 방식에 민감함을 보였다.
  • LLaVA는 '위에 언급된 바가 없음'을 선택하는 경향이 뚜렷하여, 모호하거나 잘못된 선택지를 다룰 때 편향이 있음을 시사했다.
  • CheXAgent는 잘못된 선택지의 표현 방식이 단순할수록 성능 향상을 보였으며, 복잡한 否정 표현에서의 추론 능력에 한계가 있음을 나타냈다.
  • 프롬프트에 힌트를 포함시킴으로써 대부분의 모델에서 환각에 대한 저항력이 향상되었으며, 단지 MiniGPT만 제외하고는 그러한 경향을 보였다. 이는 프롬프트 엔지니어링이 내성 향상에 유의미한 가치를 지닌다는 것을 보여준다.
  • 벤치마크는 높은 과제 정확도를 달성하더라도, 잘못되거나 오해의 소재가 되는 입력에 대해 과도하게 자신감을 갖는 경향으로 인해 의료 LVLM가 여전히 환각에 취약하다는 점을 드러냈다.
Figure 2: Detailed illustration of evaluation tasks in MedVH.
Figure 2: Detailed illustration of evaluation tasks in MedVH.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.