[논문 리뷰] Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization
이 논문은 시각-언어 모델이 쌍(양성, 음성)으로 구성된 이미지-텍스트 응답에서 학습함으로써 비현실적인 응답을 선호하지 않도록 하는 새로운 방법인 환각 인지 직접 선호 최적화(Hallucination-Aware Direct Preference Optimization, HA-DPO)를 제안한다. HA-DPO는 환각을 크게 감소시켜 MiniGPT-4의 POPE 정확도를 51.13%에서 86.13%로, MME 점수를 932.00에서 1326.46으로 향상시키며, 환각 인지 응답 쌍으로 구성된 소규모 고품질 데이터셋에서 효율적인 선호 학습을 통해 일반화 능력을 향상시킨다.
Multimodal large language models have made significant advancements in recent years, yet they still suffer from a common issue known as the "hallucination problem", in which the models generate textual descriptions that inaccurately depict or entirely fabricate content from associated images. This paper introduces a novel solution, Hallucination-Aware Direct Preference Optimization (HA-DPO), which reframes the hallucination problem as a preference selection task. The model is trained to favor the non-hallucinating response when presented with two responses of the same image (one accurate and one hallucinatory). Furthermore, this paper proposes an efficient pipeline for constructing positive~(non-hallucinatory) and negative~(hallucinatory) sample pairs, ensuring a high-quality, style-consistent dataset for robust preference learning. When applied to three mainstream multimodal models, HA-DPO significantly reduced hallucination issues and amplified the models' generalization capabilities. Notably, the MiniGPT-4 model, when enhanced with HA-DPO, demonstrated a substantial improvement: POPE accuracy rose from 51.13% to 86.13% (an absolute improvement of 35%), and the MME score surged from 932.00 to 1326.46 (a relative improvement of 42.32%). The codes, models, and datasets are made accessible at https://opendatalab.github.io/HA-DPO.
연구 동기 및 목표
- 대규모 시각-언어 모델(LVLMs)에서 이미지의 사실과 어긋나는 기술을 생성하는 지속적인 환각 문제를 해결하기 위해.
- 감독적 피니팅에서의 높은 데이터/annotation 비용과 후처리 보정에서의 외부 도구 의존성 등의 기존 방법의 한계를 극복하기 위해, 환각 감소를 선호 학습 문제로 재정의하기 위해.
- 확장 가능하고 효율적이며 효과적인 학습 파이프라인을 개발하여, 광범위한 데이터나 외부 도구 없이도 환각을 최소화하면서 모델의 일반화 능력을 향상시키기 위해.
- 세부 범주에 의존하지 않는 세부적인 환각 측정을 위한 새로운 종합적 평가 지표인 문장 수준 환각 비율(Sentence-level Hallucination Ratio, SHR)을 도입하기 위해.
제안 방법
- 동일한 이미지에 대해 두 개의 응답이 주어졌을 때, 비현실적인 응답보다 비환각 응답을 선호하도록 학습하는 직접 선호 최적화(DPO) 작업으로 환각 감소를 재정의한다.
- 스타일이 일관된 양성(비환각) 및 음성(환각) 응답 쌍을 생성하는 데이터 구축 파이프라인을 제안하여 학습 안정성과 모델 정렬을 보장한다.
- 정책 모델가 기준 모델의 비환각 출력 선호도를 따라가도록 최적화하는 선호 손실 함수를 적용함으로써 강화 학습 의존도를 최소화한다.
- 정책 업데이트와 기준 모델 일관성을 균형 잡기 위해 온도 조정된 교차 엔트로피 손실을 통합한 수정된 DPO 목표 함수를 사용한다.
- 고품질, 다양한, 현실적인 환각 음성 쌍을 학습에 사용하기 위해 인간-자동 필터링 프로세스를 활용한다.
- 사전 정의된 범주에 의존하지 않는 문장 수준에서의 환각을 정량적으로 평가하기 위해 새로운 벤치마크인 문장 수준 환각 비율(SHR)을 도입한다.
실험 결과
연구 질문
- RQ1환각을 생성 또는 후처리 작업이 아닌 선호 학습 문제로 간주함으로써, 시각-언어 모델의 환각을 효과적으로 줄일 수 있는가?
- RQ2거대한 인간 애너테이션 데이터가 필요 없이도, 고품질의 스타일 일관성 있는 양성 및 음성 응답 쌍을 효율적으로 구성할 수 있는가?
- RQ3소규모 학습 데이터로도 HA-DPO는 감독적 피니팅 및 후처리 보정 방법에 비해 환각 감소에 얼마나 뛰어난 성능을 보이는가?
- RQ4HA-DPO를 통해 환각을 줄임으로써 대규모 다중모odal 추론 및 인지 능력이 측정 가능한 수준으로 향상되는가?
- RQ5제안된 문장 수준 환각 비율(SHR) 지표는 다양한 이미지 기술에 걸쳐 세부적이고 종합적인 환각 패턴을 얼마나 효과적으로 포착하는가?
주요 결과
- HA-DPO는 SHR 벤치마크에서 MiniGPT-4의 환각 비율을 47.3%에서 44.4%로 3.0%p 감소시켜 환각 문장 비율을 낮췄다.
- HA-DPO 피니팅 이후 MiniGPT-4의 POPE 정확도는 51.13%에서 86.13%로 35.0%p의 절대적 향상이 이루어졌다.
- LLaVA-1.5는 HA-DPO 피니팅 이후 POPE 벤치마크에서 기존 최고 성능(F1 점수 90.25%)을 달성하여 다른 최첨단 방법들을 능가했다.
- MiniGPT-4의 MME 점수는 932.00에서 1326.46으로 상승하여 상대적 향상률이 42.32%에 이르렀으며, 이는 일반 다중모달 능력 향상을 시사한다.
- InstructBLIP는 HA-DPO 적용 후 MME의 인지 점수에서 71.32점 상승을 기록하여 다양한 모델 간 일관된 성능 향상을 입증했다.
- HA-DPO는 단지 2,000장의 이미지와 16,000개의 응답 쌍으로만 POPE 및 MME에서 최고 성능을 기록했으며, LLaVA-RLHF(160K)나 LRV(400K)와 같은 경쟁 방법들보다 훨씬 적은 데이터로도 성능을 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.