[논문 리뷰] Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
이 논문은 대비 학습에서 환각적인 캡션을 딱딱한 음성 예제로 사용하여 다중모달 대규모 언어 모델(MLLM)에서 환각을 줄이는 Hallucination Augmented Contrastive Learning(HACL)을 제안한다. 비환각적 텍스트와 시각적 표현을 정렬하고 환각적 텍스트에서 이를 밀어내는 방식으로 HACL은 MMhal-Bench에서 MiniGPT-4 기준으로 환각을 34.66% 감소시키며, 여러 벤치마크에서 성능을 향상시킨다.
Multi-modal large language models (MLLMs) have been shown to efficiently integrate natural language with visual information to handle multi-modal tasks. However, MLLMs still face a fundamental limitation of hallucinations, where they tend to generate erroneous or fabricated information. In this paper, we address hallucinations in MLLMs from a novel perspective of representation learning. We first analyzed the representation distribution of textual and visual tokens in MLLM, revealing two important findings: 1) there is a significant gap between textual and visual representations, indicating unsatisfactory cross-modal representation alignment; 2) representations of texts that contain and do not contain hallucinations are entangled, making it challenging to distinguish them. These two observations inspire us with a simple yet effective method to mitigate hallucinations. Specifically, we introduce contrastive learning into MLLMs and use text with hallucination as hard negative examples, naturally bringing representations of non-hallucinative text and visual samples closer while pushing way representations of non-hallucinating and hallucinative text. We evaluate our method quantitatively and qualitatively, showing its effectiveness in reducing hallucination occurrences and improving performance across multiple benchmarks. On the MMhal-Bench benchmark, our method obtains a 34.66% /29.5% improvement over the baseline MiniGPT-4/LLaVA. Our code is available on https://github.com/X-PLUG/mPLUG-HalOwl/tree/main/hacl.
연구 동기 및 목표
- 다중모달 대규모 언어 모델(MLLM)에서 사실과 어긋나거나 허구적인 시각적 설명을 생성하는 환각 문제를 해결하기 위해.
- LLM의 표현 공간에서 텍스트 및 시각적 표현의 분포를 분석하여 환각의 근본 원인을 탐구하기 위해.
- 시각적 및 텍스트 모odal 간의 교차모달 표현 정렬을 향상시켜 환각 탐지 및 완화를 강화하기 위해.
- 환각적인 캡션을 딱딱한 음성 예제로 활용하는 대비 학습 프레임워크를 개발하기 위해.
- MMhal-Bench 및 MME를 포함한 여러 다중모달 벤치마크에서 제안된 방법의 효과성을 검증하기 위해.
제안 방법
- LLM의 프로젝션된 시각 토큰 시퀀스와 텍스트 토큰 시퀀스 간의 대비 학습을 도입한다.
- GPT-4를 사용하여 환각적인 캡션을 생성하고, 학습 중에 진정한 캡션과 대비하기 위해 딱딱한 음성 예제로 사용한다.
- 대비 손실을 적용하여 비환각적 텍스트와 시각 입력의 표현을 가까이 모으고, 비환각적 및 환각적 텍스트의 표현을 서로 멀어지게 한다.
- 이러한 대비 목표를 통해 시각 인코더와 LLM 간의 학습된 인터페이스를 미세조정하여 교차모달 정렬을 향상시킨다.
- 사전학습 기간 동안 이 방법을 적용하고, 환각적인 캡션 사용 및 학습 파라다임 선택의 영향을 평가하기 위해 분석 연구를 실시한다.
- t-SNE를 사용한 표현 공간의 시각화 결과, HACL이 모odal 갭을 줄이고 환각적 및 비환각적 텍스트 표현을 분리시킴을 확인하였다.
실험 결과
연구 질문
- RQ1MLLM에서 환각 비율이 높은 이유는 무엇이며, 환각적 및 비환각적 텍스트 표현의 분포가 이에 기여하는 방식은 무엇인가?
- RQ2시각적 표현과 텍스트 표현 간의 교차모달 의미적 갭이 MLLM에서 환각 탐지에 얼마나 방해가 되는가?
- RQ3대비 학습에서 환각적인 캡션을 딱딱한 음성 예제로 사용하는 것이 정렬을 향상시키고 환각을 줄이는 데 효과적인가?
- RQ4사전학습 기간 동안 LLM 또는 시각 인코더를 동결하거나 활성화하는 학습 파라다임의 선택이 HACL 방법의 성능과 안정성에 미치는 영향은 어떠한가?
- RQ5HACL은 환각 감소 외에도 표준 벤치마크에서 일반적인 다중모달 추론 성능 향상에 기여하는가?
주요 결과
- HACL은 MMhal-Bench 벤치마크에서 MiniGPT-4 기준으로 환각을 34.66% 감소시켰다.
- MME 벤치마크에서는 기준 LLaVA 대비 성능을 11% 향상시켰다.
- t-SNE 표현 공간의 시각화 결과, HACL이 시각적 표현과 텍스트 표현 간의 모달 갭을 크게 줄임을 확인하였다.
- HACL 적용 후 환각적 캡션의 표현이 진정한 캡션 표현과 더 분명히 분리됨을 확인하여, 더 나은 분리가 이루어졌음을 시사한다.
- 대비 학습에 환각적인 캡션을 포함시키면 성능 향상이著명하게 향상되며, 그들이 생략될 경우 성능 향상이 다소 제한적임을 확인하였다.
- 첫 번째 사전학습 단계에서 LLM을 활성화하면 치명적인 기억 상실과 성능 저하가 발생하지만, 시각 인코더를 활성화하면 정렬과 성능 향상에 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.