[논문 리뷰] Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges
이 논문은 Bingo 벤치마크를 도입하여 GPT-4V(ision) 및 기타 비전-언어 모델에서 편향 및 간섭이 초래하는 환각을 분석하고, 완화 시도를 평가하며, 지속적인 도전과제를 보고합니다.
While GPT-4V(ision) impressively models both visual and textual information simultaneously, it's hallucination behavior has not been systematically assessed. To bridge this gap, we introduce a new benchmark, namely, the Bias and Interference Challenges in Visual Language Models (Bingo). This benchmark is designed to evaluate and shed light on the two common types of hallucinations in visual language models: bias and interference. Here, bias refers to the model's tendency to hallucinate certain types of responses, possibly due to imbalance in its training data. Interference pertains to scenarios where the judgment of GPT-4V(ision) can be disrupted due to how the text prompt is phrased or how the input image is presented. We identify a notable regional bias, whereby GPT-4V(ision) is better at interpreting Western images or images with English writing compared to images from other countries or containing text in other languages. Moreover, GPT-4V(ision) is vulnerable to leading questions and is often confused when interpreting multiple images together. Popular mitigation approaches, such as self-correction and chain-of-thought reasoning, are not effective in resolving these challenges. We also identified similar biases and interference vulnerabilities with LLaVA and Bard. Our results characterize the hallucination challenges in GPT-4V(ision) and state-of-the-art visual-language models, and highlight the need for new solutions. The Bingo benchmark is available at https://github.com/gzcch/Bingo.
연구 동기 및 목표
- GPT-4V(ision)에서 편향과 간섭에 초점을 맞춘 환각 원인을 식별하고 특성화한다.
- 지역, OCR, 사실 콘텐츠에 걸친 실패 및 성공 사례를 포함하는 포괄적 벤치마크(Bingo)를 구축한다.
- 프롬프트 기반 완화책(자기 교정, chain-of-thought)이 환각에 어떤 영향을 미치는지 평가한다.
- Bingo 과제에서 GPT-4V(ision)와 다른 비전-언어 모델(LLaVA, Bard)을 비교한다.
- 비전-언어 모델링의 견고성 및 향후 방향에 대한 시사점을 논의한다.
제안 방법
- 이미지와 한 개 또는 두 개의 질문을 짝지어 190개의 실패 사례와 131개의 성공 사례로 Bingo를 구성한다.
- 편향을 지역 편향, OCR 편향, 사실 편향으로 분류하고, 간섭은 이미지-대-이미지 간섭과 텍스트-대-이미지 간섭으로 분류한다.
- 사람의 주석(정답/오답)을 사용하여 GPT-4V(ision)를 평가하고 범주별 정확도를 보고한다.
- 비교 맥락을 위한 LLaVA-1.5와 Bard의 편향 및 간섭을 분석한다.
- 자기 교정 프롬프트 및 chain-of-thought 프롬프트를 포함한 완화 접근 방식을 테스트하여 환각에 대한 영향을 평가한다.
- 질적 예시를 제공하고 현재 완화 전략의 한계를 논의한다.
실험 결과
연구 질문
- RQ1GPT-4V(ision) 및 기타 VLM에서 환각의 주요 원천(편향 대 간섭)은 무엇인가?
- RQ2지역, OCR 및 사실 편향이 언어와 지역에 걸친 비전-언어 이해에 어떤 영향을 미치는가?
- RQ3이미지-대-이미지 간섭과 텍스트-대-이미지 간섭이 시각 프롬프트에 대한 모델 판단에 어떤 영향을 미치는가?
- RQ4자기 교정 또는 chain-of-thought 프롬프팅이 비전-언어 모델의 환각을 완화하는가?
- RQ5편향 및 간섭 측면에서 Bingo 벤치마크에서 GPT-4V(ision), LLaVA-1.5, Bard의 비교는 어떠한가?
주요 결과
- GPT-4V(ision)는 지역 편향을 보이며 서구/세계 이미지는 비서구 이미지보다 더 잘 처리한다.
- OCR 편향이 분명하며, 이미지 내의 영어 및 프랑스어 텍스트는 OCR 탐지기의 한계로 다른 언어보다 더 잘 처리된다.
- 사실 편향이 존재하며, 모델이 이미지 증거보다 학습된 사실에 의존하는 경우가 있으며 반사실적 사례가 높은 오차율을 유발한다.
- 이미지-대-이미지 간섭이 유사한 이미지가 함께 그룹화될 때 성능을 심하게 저하시킨다.
- 텍스트-대-이미지 간섭으로 모델이 이미지 콘텐츠보다 사용자 주장의 일치 방향으로 이끈다( sycophancy ).
- 자기 교정은 카테고리 전반에서 대략 16.56–16.9% 만큼 환각을 감소시키지만 여전히 많은 오류가 남아 있으며, chain-of-thought 프롬프팅은 일관된 이점을 제한적이거나 효과가 없을 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.