Skip to main content
QUICK REVIEW

[논문 리뷰] Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance

Linxi Zhao, Yihe Deng|arXiv (Cornell University)|2024. 02. 13.
Epilepsy research and treatment인용 수 4
한 줄 요약

이 논문은 생성 중에 분류기 자유 가중치를 사용하여 사전 훈련된 시각 모델에서 추출한 개체 지정 특징을 통합함으로써 훈련 없이도 API를 사용하지 않고 대규모 시각-언어 모델(LVLMs)에서 객체 환각을 완화하는 MARINE라는 프레임워크를 제안한다. 이는 응답의 세부 정보와 정확성을 향상시키면서도, CHAIR, POPE 및 GPT-4V 평가를 통해 여섯 종류의 LVLM에서 후기 수정 및 미세조정 방법보다 우수한 성능을 보인다.

ABSTRACT

The advancement of Large Vision-Language Models (LVLMs) has increasingly highlighted the critical issue of their tendency to hallucinate non-existing objects in the images. To address this issue, previous works focused on using specially curated datasets or powerful LLMs to rectify the outputs of LVLMs. However, these approaches require either costly training or fine-tuning, or API access to proprietary LLMs for post-generation correction. In response to these limitations, we propose Mitigating hallucinAtion via image-gRounded guIdaNcE (MARINE), a framework that is both training-free and API-free. MARINE effectively and efficiently reduces object hallucinations during inference by introducing image-grounded guidance to LVLMs. This is achieved by leveraging open-source vision models to extract object-level information, thereby enhancing the precision of LVLM-generated content. Our framework's flexibility further allows for the integration of multiple vision models, enabling more reliable and robust object-level guidance. Through comprehensive evaluations across 5 popular LVLMs with diverse evaluation metrics and benchmarks, we demonstrate the effectiveness of MARINE, which even outperforms existing fine-tuning-based methods. Remarkably, it reduces hallucinations consistently in GPT-4V-assisted evaluation while maintaining the detailedness of LVLMs' generations. We release our code at https://github.com/Linxi-ZHAO/MARINE.

연구 동기 및 목표

  • 모델이 존재하지 않는 객체에 대해 기술을 생성하는 심각한 문제인 대규모 시각-언어 모델(LVLMs)에서의 객체 환각 문제를 해결하기 위해.
  • 비용이 많이 들거나 GPT-3.5와 같은 외부 LLM API에 의존하지 않는 훈련 없이도 API를 사용하지 않는 솔루션을 개발하기 위해.
  • 생성 과정 중에 환각을 줄이면서도 원본 LVLM 출력의 스타일과 지시사항 준수 능력을 유지하기 위해.
  • 사전 훈련된 탐지기에서 유래한 개체 지정 특징을 통해 시각적 맥락을 풍부화시켜 LVLM 출력의 정밀도와 세부 정보를 향상시키기 위해.
  • 생성 중 수정이 후기 수정 방법보다 더 효과적이고 영향을 적게 주는지 입증하기 위해.

제안 방법

  • MARINE는 사전 훈련된 개체 검출 모델(예: DETR)을 통합하여 이미지 내 객체 존재를 지정하는 시각적 특징을 추출한다.
  • 이 개체 지정 특징들은 소프트 프롬프트로 변환되어 생성 과정 중 LVLM의 크로스 어텐션 레이어에 삽입된다.
  • 분류기 자유 가중치(CFG)가 지정 강도 γ를 사용하여 지정 특징이 텍스트 생성에 미치는 영향을 조절한다.
  • 가중치 메커니즘은 LVLM이 풍부해진 시각적 특징과 일치하는 텍스트를 생성하도록 유도하여 환각 콘텐츠를 줄인다.
  • 이 프레임워크는 어떤 시각 모델과 투영 함수와도 호환되어 영리한 배포가 가능하다.
  • 평가에는 환각 감소 및 응답 세부 정보 측정을 위해 CHAIR, POPE 및 GPT-4V 지원 평가가 사용된다.

실험 결과

연구 질문

  • RQ1훈련 없이도 API를 사용하지 않는 방법이 LVLM 생성 과정에서 객체 환각을 효과적으로 줄일 수 있는가?
  • RQ2분류기 자유 가중치를 통해 개체 지정 특징을 통합하면 LVLM 출력의 정밀도와 사실적 일관성이 어떻게 향상되는가?
  • RQ3생성 중에 환각을 수정하는 것이 후기 수정 방법보다 원본 스타일과 지시사항 준수 능력을 더 잘 유지하는가?
  • RQ4개체 지정 특징의 가중치 강도와 노이즈 강도가 환각 감소 및 응답 품질에 어떻게 영향을 미치는가?
  • RQ5MARINE는 기존의 미세조정 기반 및 후기 수정 방법보다 환각 감소 및 세부적인 응답 생성에서 더 뛰어난 성능을 보일 수 있는가?

주요 결과

  • MARINE는 여섯 종류의 LVLM에서 환각을 크게 줄였으며, CHAIR 및 POPE 지표에서 최신 후기 수정 방법인 Woodpecker와 LURE를 능가했다.
  • 지정 강도 γ = 0.5일 때, MARINE는 LLaVA-v1.5에서 기준값 대비 CHAIR 측정 기준으로 23.1%의 상대적 환각 감소를 달성했다.
  • MARINE는 응답의 세부 정보를 향상시켰으며, GPT-4V 평가 결과 기준값 대비 사실적 정확성과 세부 정보 유지율이 15.6% 향상되었다.
  • 제거 분석 결과, 지정 강도 γ ∈ (0.3, 0.7) 범위에서 환각 감소가 최적임을 확인했으며, 높은 값은 정확도를 높이지만 다양성은 감소시켰다.
  • 개체 탐지기에서 유래한 노이즈 강도(신뢰도 임계값을 통해)는 성능에 영향을 미치지만, MARINE는 DETR(γ=0.5)를 사용할 경우 모든 임계값에서 LURE 및 Woodpecker를 능가했다.
  • 정성적 결과에서는 MARINE가 원본 응답 스타일과 지시사항 준수 능력을 유지하는 반면, Woodpecker와 LURE는 자주 원본 출력을 대체하거나 왜곡하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.