Skip to main content
QUICK REVIEW

[논문 리뷰] Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding

Ailin Deng, Z.-H. Chen|arXiv (Cornell University)|2024. 02. 23.
COVID-19 diagnosis using AIMedicine인용 수 3
한 줄 요약

이 논문은 CLIP 점수를 사용해 문장 수준의 디코딩을 안내하는 훈련 없이 객체 환각을 줄이는 CLIP-가중 디코딩(CGD)을 제안한다. 입력 이미지와의 CLIP 유사도가 높은 문장을 선호함으로써, CGD는 환각을 크게 감소시켜 환각 점수를 상대적으로 33.5% 감소시키며, 생성 품질을 유지하고 모델 미세조정이나 외부 도구를 요구하지 않는다.

ABSTRACT

Large Vision-Language Models (LVLMs) are susceptible to object hallucinations, an issue in which their generated text contains non-existent objects, greatly limiting their reliability and practicality. Current approaches often rely on the model's token likelihoods or other internal information, instruction tuning on additional datasets, or incorporating complex external tools. We first perform empirical analysis on sentence-level LVLM hallucination, finding that CLIP similarity to the image acts as a stronger and more robust indicator of hallucination compared to token likelihoods. Motivated by this, we introduce our CLIP-Guided Decoding (CGD) approach, a straightforward but effective training-free approach to reduce object hallucination at decoding time. CGD uses CLIP to guide the model's decoding process by enhancing visual grounding of generated text with the image. Experiments demonstrate that CGD effectively mitigates object hallucination across multiple LVLM families while preserving the utility of text generation. Codes are available at https://github.com/d-ailin/CLIP-Guided-Decoding.

연구 동기 및 목표

  • LVLM에서 후행 문장 생성 시에 발생하는 객체 환각의 근본 원인을 규명하는 것.
  • 내부 모델의 가능도보다 CLIP 유사도가 환각을 더 견고하게 나타내는지 평가하는 것.
  • CLIP를 외부 가이드로 사용해 훈련 없이도 디코딩 중 환각을 완화하는 경량화된 방법을 개발하는 것.
  • 특히 안전성이 중요한 환경과 인간-AI 상호작용 환경에서 환각을 줄이면서도 생성 품질을 유지하는 것.

제안 방법

  • 이 방법은 디코딩 중 후보 문장을 입력 이미지와의 시각-세미틱 일치도 기반으로 CLIP로 점수를 매기는 CLIP-가중 디코딩(CGD)을 도입한다.
  • 각 디코딩 단계에서 다수의 후보 문장을 생성하고, 그들의 CLIP 점수를 계산해 이미지와의 일치도를 평가한다.
  • 환각 점수는 문장 가능도와 CLIP 점수의 가중 조합으로 계산되며, 높은 CLIP 점수를 가진 후보 문장을 우선시한다.
  • 최종 출력은 시각적 기반을 강조하는 미분 가능 재순서 정렬 메커니즘을 통해 가장 높은 점수를 받은 후보들 중에서 선택된다.
  • 이 방법은 완전히 추론 시간에만 적용되며, 모델 미세조정이나 추가 학습이 필요하지 않다.
  • LVLM에서 사용된 CLIP 모델과 별개의 CLIP 모델을 사용한 실험을 통해, 다양한 설정에서의 강건성을 입증한다.

실험 결과

연구 질문

  • RQ1CLIP 유사도는 LVLM에서 토큰 가능도보다 환각을 더 강력하고 신뢰할 수 있는 지표로 작용하는가?
  • RQ2CLIP 점수를 사용해 디코딩을 안내하면 개방형 이미지 캡션 생성에서 환각이 감소하는가?
  • RQ3훈련 없이 외부 가이드를 사용하는 방법인 CGD는 생성 품질을 훼손하지 않으면서도 환각을 효과적으로 완화할 수 있는가?
  • RQ4다양한 CLIP 모델, 특히 LVLM에서 사용된 모델과 동일한 모델을 사용했을 때 CGD의 성능은 어떻게 변화하는가?
  • RQ5다양한 LVLM에서 생성된 캡션의 후행 문장에서 환각이 상당히 증가하는가?

주요 결과

  • CLIP 점수는 특히 캡션의 후행 문장에서 토큰 가능도보다 환각을 훨씬 더 강력하고 견고한 지표로 제공한다.
  • CGD는 그레디 디코딩 대비 환각을 상대적으로 33.5% 감소시켜 COCO에서는 29.73의 환각 점수, NoCaps에서는 8.12의 점수를 기록했다.
  • 제거 실험을 통해 CLIP 가이드가 환각 감소에 주요 기여를 한다는 것이 확인되었으며, CLIP 가이드를 제거하면 성능이 거의 그레디 수준으로 악화되었다.
  • LVLM에서 사용된 동일한 CLIP 모델을 재사용하더라도(CGD에서 OpenAI ViT-L/14 사용), CGD는 기준 디코딩보다 여전히 뛰어난 성능을 보였다. 이는 기존 미세조정에서의 과적합 가능성을 시사한다.
  • 후보 수(N)와 샘플링 횟수(M)를 늘일수록 성능 향상이 나타나, CLIP 가이드를 통한 광범위한 탐색이 환각 완화에 기여한다는 것을 시사한다.
  • 생성 품질은 유지되었으며, 평균 캡션 길이는 그레디에서 80.05에서 CGD에서 76.66으로 약간 감소하여 기능성에 미치는 영향은 최소한이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.