Skip to main content
QUICK REVIEW

[논문 리뷰] IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding

Lanyun Zhu, Deyi Ji|arXiv (Cornell University)|2024. 02. 28.
Hallucinations in medical conditions인용 수 5
한 줄 요약

이 논문은 이미지를 편향하는 디코딩(Image-Biased Decoding, IBD)을 소개합니다. 이는 이미지 편향 예측기와 표준 모델을 비교하여 LVLM의 환각을 감소시키고, 파라미터 오버헤드를 최소화하면서 진실성을 향상시키는 대조적 디코딩 방식입니다.

ABSTRACT

Despite achieving rapid developments and with widespread applications, Large Vision-Language Models (LVLMs) confront a serious challenge of being prone to generating hallucinations. An over-reliance on linguistic priors has been identified as a key factor leading to these hallucinations. In this paper, we propose to alleviate this problem by introducing a novel image-biased decoding (IBD) technique. Our method derives the next-token probability distribution by contrasting predictions from a conventional LVLM with those of an image-biased LVLM, thereby amplifying the correct information highly correlated with image content while mitigating the hallucinatory errors caused by excessive dependence on text. We further conduct a comprehensive statistical analysis to validate the reliability of our method, and design an adaptive adjustment strategy to achieve robust and flexible handling under varying conditions. Experimental results across multiple evaluation metrics verify that our method, despite not requiring additional training data and only with a minimal increase in model parameters, can significantly reduce hallucinations in LVLMs and enhance the truthfulness of the generated response.

연구 동기 및 목표

  • LVLM이 언어적 사전 정보에 과도하게 의존해 발생하는 환각 문제를 동기부여하고 해결합니다.
  • 모델 재학습 없이 이미지 콘텐츠를 강조하는 디코딩-타임 메커니즘을 개발합니다.
  • 토큰 선택을 개선하기 위해 이미지 편향 예측기와 표준 모델을 쌍으로 하는 대조적 디코딩 프레임워크를 도입합니다.
  • 최소한의 오버헤드로 LVLM 전반의 환각을 감소시키는 통계적·경험적 검증을 제공합니다.

제안 방법

  • QK 주의집중 계산에서 편향 계수 c를 통해 이미지 토큰에 대한 주의를 증폭시켜 hatTheta라는 이미지 편향 LVLM을 구성하되 모델 파라미터를 변경하지 않습니다.
  • L_CD = logit_hatTheta - logit_theta를 사용하여 원래 모델 theta와 이미지 편향 모델 hatTheta의 예측을 대조하고 softmax(L_CD)에서 p(y_i | y_<i)을 도출합니다.
  • theta에서 hatTheta로의 확률 증가가 내용 단어(content words)에 대해 더 정확할 가능성이 높은 토큰이 될 것이라고 가정합니다(기능어는 제외).
  • 적응 가능한 인자 I와 스케일링 파라미터 alpha로 제어되는 표준 MLE 디코딩과 CD 기반 조정을 혼합하는 동적 조정 메커니즘을 도입하여 다양한 단어 유형과 theta와 hatTheta 간의 유사성에 대응합니다.
  • (a) 가벼운 프롬프트 튜닝(P)을 통한 COCO 캡션에서 hatTheta를 미세조정하고, (b) 고확률 토큰으로 후보를 제한하는 적응 가능한 타당성 제약을 추가하여 IBD를 강화합니다.
  • L_CD, 동적 가중치, 후보-헤드 제약 V_head(y_<i)에 대한 전체 방법과 방정식을 제시합니다.

실험 결과

연구 질문

  • RQ1이미지 편향 디코딩이 기본 디코딩 전략에 비해 LVLM의 환각을 줄이는가?
  • RQ2이미지 중심 예측기로부터 도출된 대조적 디코딩 점수가 콘텐츠 단어의 토큰 선택을 개선하고 기능어의 과다 보정은 피하는가?
  • RQ3동적 조정과 프롬프트가 다양한 LVLM과 데이터셋에서 IBD의 강건성에 어떤 영향을 미치는가?
  • RQ4이미지 편향이 모델-세계 지식과 어떻게 상호작용하는가? 이 접근법에 한계가 있는가(예: 무해한 텍스트 편향 환각 등)

주요 결과

  • IBD는 CHAIR, GPT-4 보조, GPT-4V 보조 평가에서 기본 디코딩 및 여러 환각 중심 디코더를 지속적으로 능가합니다.
  • IBD는 InstructBLIP, MiniGPT-4, LLaVA-1.5, Shikra 기반에서 더 낮은 CHAIR 점수(대상 객체 환각 감소)를 달성합니다.
  • 매우 적은 파라미터 오버헤드(~74k 프롬프트 파라미터)로 IBD는 ReCaption, Woodpecker, CD, VCD, DoLa, OPERA에 비해 환각을 줄이고 진실성을 향상시킵니다.
  • 동적 조정 메커니즘은 기능어에 대해서는 MLE를 우선시키고, 콘텐츠 단어 혹은 이미지 의존적 예측에 대해서 CD를 활용하는 강건성을 높입니다.
  • 특정 구성요소에 대한 제거 실험이 동적 조정, 프롬프트 미세조정, 적응 가능한 타당성 제약의 필요성을 제시하여 성능 유지에 기여합니다.
  • IBD는 여러 LVLM 백본에서 CHAIR, GPT-4 보조, GPT-4V 보조 평가에서 최상위 또는 거의 최상위 점수를 달성합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.