Skip to main content
QUICK REVIEW

[논문 리뷰] Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment

Pritam Sarkar, Sayna Ebrahimi|arXiv (Cornell University)|2024. 05. 28.
Functional Brain Connectivity StudiesNeuroscience인용 수 3
한 줄 요약

이 논문은 다중모态 대규모 언어 모델(MLLM)에서 객체 환각 현상을 완화하기 위해 데이터 증강을 통한 대비 훈련 방법인 HALVA를 제안한다. 환각 응답을 데이터 증강을 통해 생성하고, 토큰 수준의 대비 손실을 적용하여 잘못된 토큰이 생성될 확률을 줄인다. 이 방법은 일반적인 시각-언어 성능을 떨어뜨리지 않으면서도 최소한의 피팅 훈련과 추론 오버헤드 없이 환각 현상을 효과적으로 감소시킨다.

ABSTRACT

Despite their significant advancements, Multimodal Large Language Models (MLLMs) often generate factually inaccurate information, referred to as hallucination. In this work, we address object hallucinations in MLLMs, where information is generated about an object not present in the input image. We introduce Data-augmented Phrase-level Alignment (DPA), a novel loss which can be applied to instruction-tuned off-the-shelf MLLMs to mitigate hallucinations, while preserving their general vision-language capabilities. To fine-tune MLLMs with DPA, we first generate a set of `hallucinated' and `correct' response pairs through generative data augmentation by selectively altering the ground-truth information of the correct responses at a phrase level. The DPA loss is then used to train MLLMs to reduce the likelihood of hallucinated phrases compared to the correct ones. Our thorough evaluation on various benchmarks confirms the effectiveness of DPA in mitigating hallucination while retaining the out-of-the-box performance of the MLLMs on general tasks. For instance, MLLMs finetuned with DPA, which we refer to as Hallucination Attenuated Language and Vision Assistant (HALVA), improve F1 by up to 13.4% on hallucination visual question-answering and reduce the hallucination rate by up to 4.2% on image description tasks.

연구 동기 및 목표

  • 모델이 존재하지 않는 객체나 특성을 기술하는 객체 환각 현상을 해결하기 위해.
  • 추론 시간 증가나 다시 시작하는 재훈련이 필요 없이 환각 현상을 완화하는 방법을 개발하기 위해.
  • 환각 현상 완화 후에도 일반적인 시각-언어 성능을 유지하거나 향상시키기 위해.
  • 광범위한 데이터나 아키텍처 변경 없이도 상용 MLLM에 적용 가능하게 하기 위해.
  • 비용이 많이 드는 추론 시 보정 또는 대규모 사전 훈련에 의존도를 줄이기 위해.

제안 방법

  • 지식 기반 캡션의 사실적 특성 요소를 선택적으로 수정하여 환각 응답을 생성하기 위해 생성적 데이터 증강을 사용한다.
  • 사실적 토큰과 환각 토큰 간의 토큰 수준에서 대비 손실을 적용하여 올바른 토큰의 상대적 확률을 높인다.
  • 기본 MLLM(기준 모델)과의 KL 발산 제약을 통해 훈련 중 일반 능력을 유지한다.
  • 사전 훈련된 MLLM에 경량 피팅 훈련 절차로 적용하여 상용 모델에 직접 구현 가능하게 한다.
  • 환각 감소와 일반화 능력 평가를 위해 생성적 및 분류적 시각-언어 과제에서 평가한다.
  • 훈련 과정은 빠르고 효율적이며, 최소한의 컴퓨팅 자원과 추가 추론 인프라가 필요 없다.

실험 결과

연구 질문

  • RQ1대비 훈련 방법이 일반적인 시각-언어 능력을 떨어뜨리지 않으면서 MLLM의 객체 환각 현상을 줄일 수 있는가?
  • RQ2데이터 증강을 통한 환각 응답 생성은 추론 시 환각 탐지 능력을 향상시키는 데 얼마나 효과적인가?
  • RQ3피팅 훈련 후 표준 시각-언어 벤치마크에서 제안된 방법이 성능을 유지하거나 향상시키는가?
  • RQ4이 방법은 최소한의 컴퓨팅 비용과 추론 오버헤드 없이 상용 MLLM에 적용 가능한가?
  • RQ5이 방법은 훈련 데이터에서 객체 동시 발생 패턴으로 인한 환각 현상을 어느 정도 완화하는가?

주요 결과

  • HALVA는 생성적 및 분류적 시각-언어 벤치마크에서 객체 환각 현상을 크게 줄이며, 기준 방법보다 환각 완화 성능이 뛰어나다.
  • VQAv2, GQA, OK-ViCa와 같은 표준 시각-언어 벤치마크에서 성능을 유지하거나 향상시키며, 일반 능력 저하가 없음을 보여준다.
  • qualitative 비교를 통해 HALVA는 긍정적 지시 편향으로 인해 모든 질문에 'Yes'로 대답하는 경향을 효과적으로 줄였다.
  • 예를 들어 야구 경기 장면에서 '투수'와 함께 '타자'와 '심판'이 함께 나타나는 공존 패턴으로 인한 잘못된 기술(예: 'pitcher'에 'batter'나 'umpire' 기재)을 성공적으로 완화했다.
  • 대비 훈련 과정은 효율적이며, 최소한의 훈련 시간과 추가 추론 비용이 없어 생산 환경에 적합하다.
  • qualitative 결과로 HALVA는 객체의 위치와 특성을 정확히 기술하는 반면, 기본 모델인 LLaVA-v1.5는 존재하지 않는 객체들인 'carrot', 'people', 또는 'handbag'을 자주 환각적으로 기술한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.