Skip to main content
QUICK REVIEW

[논문 리뷰] HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models

Tianrui Guan, Fuxiao Liu|arXiv (Cornell University)|2023. 10. 23.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

HallusionBench는 346张의 이미지에 걸쳐 수작업으로 제작된 1,129개의 시각질문 쌍을 포함하는 새로운 진단 기준으로, 대규모 시각-언어 모델(LVLMs)에서 언어 환각과 시각적 오해를 체계적으로 평가하고 분석하기 위해 제작되었다. 이 기준은 GPT-4V가 단지 31.42%의 질문-쌍 정확도를 기록함으로써 심각한 실패 모드를 드러내었으며, 최신 모델들에서 언어 사전 지식에 대한 과도한 의존성과 시각적 입력의 오해를 일으키는 문제를 폭 드러내었다.

ABSTRACT

We introduce HallusionBench, a comprehensive benchmark designed for the evaluation of image-context reasoning. This benchmark presents significant challenges to advanced large visual-language models (LVLMs), such as GPT-4V(Vision), Gemini Pro Vision, Claude 3, and LLaVA-1.5, by emphasizing nuanced understanding and interpretation of visual data. The benchmark comprises 346 images paired with 1129 questions, all meticulously crafted by human experts. We introduce a novel structure for these visual questions designed to establish control groups. This structure enables us to conduct a quantitative analysis of the models' response tendencies, logical consistency, and various failure modes. In our evaluation on HallusionBench, we benchmarked 15 different models, highlighting a 31.42% question-pair accuracy achieved by the state-of-the-art GPT-4V. Notably, all other evaluated models achieve accuracy below 16%. Moreover, our analysis not only highlights the observed failure modes, including language hallucination and visual illusion, but also deepens an understanding of these pitfalls. Our comprehensive case studies within HallusionBench shed light on the challenges of hallucination and illusion in LVLMs. Based on these insights, we suggest potential pathways for their future improvement. The benchmark and codebase can be accessed at https://github.com/tianyi-lab/HallusionBench.

연구 동기 및 목표

  • 대규모 시각-언어 모델(LVLMs)의 언어 환각과 시각적 오해와 관련된 실패 모드를 진단하고 체계적으로 분석하기 위해.
  • 표준 정확도 지표를 넘어서 모델 행동의 정량적 분석을 가능하게 하는 진단 기준을 개발하기 위해.
  • LVLM의 언어 사전 지식에 대한 과도한 의존성과 시각적 오해의 취약성을 드러내어, 최신 모델들에서도 이러한 문제들이 나타남을 폭 드러내기 위해.
  • 구조화된 인간 애너테이션 데이터셋을 제공하여 제어된 시각질문 쌍을 통해 특정 실패 패턴을 고립하고 연구하기 위해.
  • LVLM 추론에서 발생하는 구체적인 실패 유형과 그 근본 원인을 특정함으로써 향후 모델 개선을 이끌어내기 위해.

제안 방법

  • 165개의 원본 이미지와 181개의 인간 편집 이미지를 사용하여, 새로운 쌍질문 구조를 적용한 1,129개의 시각질문-답변(VQA) 쌍을 제작한다.
  • 각 VQA 쌍은 표준 질문과 시각적 편집이 가미된 수정된 버전을 포함하며, 조건 간 모델 응답을 비교할 수 있도록 한다.
  • 원본 이미지와 편집된 이미지 조건 간 응답 일관성을 기반으로 실패 모드를 분류하기 위해 의사결정수프레임워크를 적용한다.
  • 이 방법은 언어 환각(시각적 입력 없이 잘못된 답변)과 시각적 오해(시각적 편집 오해로 인한 잘못된 답변)의 정량적 진단을 가능하게 한다.
  • 통제군 설계를 통해 실패 원인이 언어 사전 지식에 기인하는지, 시각적 오인에 기인하는지 분리하여 분석한다.
  • 이 프레임워크는 실패를 언어 환각, 시각적 오해, 또는 둘 다의 조합으로 진단 레이블링하는 데 지원한다.

실험 결과

연구 질문

  • RQ1GPT-4V와 LLaVA-1.5와 같은 최신 LVLM들은 시각적 입력이 없거나 변경되었을 때 얼마나 많은 언어 환각을 보이는가?
  • RQ2이미지의 시각적 편집은 LVLM의 추론에 어떤 영향을 미치며, 오류의 몇 퍼센트가 언어 편향이 아닌 시각적 오해에 기인하는가?
  • RQ3구조화된 진단 프레임워크는 LVLM 응답에서 언어 환각과 시각적 오해를 어떻게 구분할 수 있는가?
  • RQ4복잡하고 모호한 시각적 추론 과제에서 최신 LVLM과 인간 수준 이해력 사이의 성능 격차는 어느 정도인가?
  • RQ5예를 들어, 기울인 차트를 잘못 읽거나 지도의 영역이 뒤바뀐 경우와 같은 특정 실패 패atters는 현재 LVLM 아키텍처의 근본적인 약점을 드러내는가?

주요 결과

  • 최신 LVLM인 GPT-4V는 HallusionBench에서 질문-쌍 정확도가 단지 31.42%에 그쳐 심각한 추론 한계를 보였다.
  • 모든 다른 평가 대상 모델은 16% 이하의 정확도를 기록하여 성능 격차가 심각하고 LVLM 전반에 걸쳐 광범위한 실패가 존재함을 시사했다.
  • 실패의 상당 부분이 언어 환각으로 진단되었으며, 이는 시각적 입력이 없을 때조차도 모델이 매개변수 지식에 의존해 잘못된 답변을 내는 것을 의미한다.
  • 편집된 지도나 기울인 차트를 잘못 읽는 경우에 시각적 오해가 자주 관찰되었으며, 시각적 입력이 명확히 변경되었음에도 불구하고 이러한 오류가 발생했다.
  • LLaVA-1.5는 시각적 입력이 없을 때도 약한 일반 지식 추론 능력을 보였고, 오해의 시각적 편집이 제시되었을 때도 자신의 답변을 수정하지 못해 낮은 시각적 기반 능력을 보였다.
  • 의사결정수 분석은 실패 모드를 성공적으로 분류하였으며, 오류의 30%는 언어 환각, 25%는 시각적 오해, 45%는 둘 다의 조합으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.