Skip to main content
QUICK REVIEW

[논문 리뷰] RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback

Tianyu Yu, Yuan Yao|arXiv (Cornell University)|2023. 12. 01.
Topic Modeling인용 수 5
한 줄 요약

RLHF-V는 밀도 높은 직접 선호도 최적화(DDPO)를 사용하여 환상에 대한 세분화된, 문단 수준의 인간 보정과 모델 행동을 일치시킴으로써 다중모달 LLM의 신뢰성을 향상시킨다. 단지 1.4k개의 주석 처리된 샘플만으로도 환상 비율을 34.8% 감소시켰으며, 이는 10k개 샘플로 훈련된 LLaVA-RLHF를 뛰어넘고, 과도한 일반화에 의한 환상에 대한 강건성에서 GPT-4V를 능가한다.

ABSTRACT

Multimodal Large Language Models (MLLMs) have recently demonstrated impressive capabilities in multimodal understanding, reasoning, and interaction. However, existing MLLMs prevalently suffer from serious hallucination problems, generating text that is not factually grounded in associated images. The problem makes existing MLLMs untrustworthy and thus impractical in real-world (especially high-stakes) applications. To address the challenge, we present RLHF-V, which enhances MLLM trustworthiness via behavior alignment from fine-grained correctional human feedback. Specifically, RLHF-V collects human preference in the form of segment-level corrections on hallucinations, and performs dense direct preference optimization over the human feedback. Comprehensive experiments on five benchmarks in both automatic and human evaluation show that, RLHF-V can enable substantially more trustworthy MLLM behaviors with promising data and computation efficiency. Remarkably, using 1.4k annotated data samples, RLHF-V significantly reduces the hallucination rate of the base MLLM by 34.8%, outperforming the concurrent LLaVA-RLHF trained on 10k annotated data. The final model achieves state-of-the-art performance in trustworthiness among open-source MLLMs, and shows better robustness than GPT-4V in preventing hallucinations aroused from over-generalization. We open-source our code, model, and data at https://github.com/RLHF-V/RLHF-V.

연구 동기 및 목표

  • 고위험 실세계 응용에서 신뢰성을 해치는 다중모달 LLM(MLLM)의 환상 문제를 해결한다.
  • 粗모양의 피드백과 모호한 레이블링으로 인해 기존의 RLHF 및 지시 훈련 방법이 인간 선호도와 모델 행동을 정밀하게 일치시키지 못하는 한계를 극복한다.
  • 더 많은 보상 해킹을 방지하고 학습 효율성을 향상시키기 위해 전체 응답을 순위 매기는 대신, 밀도 높은, 문단 수준의 수정 피드백을 수집한다.
  • 최소한의 인간 주석 작업으로도 강력한 행동 일치를 달성할 수 있는 데이터 효율적이고 강건한 훈련 프레임워크를 개발한다.
  • 오픈소스 MLLM에서 최신 기술 수준의 신뢰성을 달성하면서도 강력한 유용성과 사실 기반 성능을 유지한다.

제안 방법

  • 모델 응답의 환상적 내용에 대해 세분화되고 문단 수준의 수정 피드백 형태로 인간 피드백을 수집하여, 잘못된 시각적 기술을 직접 식별하고 수정한다.
  • 기존 RLHF의 보조적 접근 방식이 아닌, 밀도 높고 세분화된 선호 신호를 직접적으로 정책 모델 최적화하는 데 사용되는 새로운 훈련 목표인 밀도 높은 직접 선호도 최적화(DDPO)를 설계한다.
  • MLLM 정책을 수정된 문단에 맞추기 위해 DDPO를 적용하여, 환상적인 영역에 더 강한 기울기 신호를 할당함으로써 사실 기반 성능을 향상시킨다.
  • 수정 피드백을 기반으로 훈련된 보상 모델을 사용하여 정책 업데이트를 지도함으로써, 최적화 과정에서 수정 사항이 우선시되도록 보장한다.
  • 피드백 수집 및 훈련 파이프라인을 통합된 프레임워크로 통합하여 MLLM의 효율적이고 확장 가능한 피지테이닝을 지원한다.
  • 고품질의 밀도 높은 피드백을 활용하여, 대규모 선호도 주석이 필요로 하는 것에 의존하지 않고도 효과적인 행동 일치를 달성한다.

실험 결과

연구 질문

  • RQ1세분화되고 문단 수준의 인간 피드백은 거시적 순위 매기기 피드백보다 MLLM의 정확성과 신뢰성 향상에 더 효과적인가?
  • RQ2밀도 높은 직접 선호도 최적화(DDPO)는 MLLM 일치의 맥락에서 기존 PPO 기반 RLHF에 비해 더 효율적이고 안정적인 훈련을 가능하게 하는가?
  • RQ3예를 들어 1.4k개 샘플의 소규모 인간 피드백 데이터셋이 이전 연구에서 사용된 더 큰 데이터셋(예: LLaVA-RLHF의 10k개 샘플)보다 더 나은 환상 감소를 달성할 수 있는가?
  • RQ4GPT-4V와 같은 강력한 모델에 비해 RLHF-V는 과도한 일반화에 기인한 환상에 대해 얼마나 더 강건한가?
  • RQ5제안된 프레임워크는 다중모달 환경을 초월한 다른 LLM에서도 환상을 줄이는 데 일반화될 수 있는가?

주요 결과

  • 단지 1.4k개의 주석 처리된 수정 피드백 샘플만으로도, 기반 MLLM의 물체 환상 비율을 34.8% 감소시켰으며, 이는 10k개 샘플이 필요한 LLaVA-RLHF에 비해 뚜렷이 뛰어난 성능을 보였다.
  • RLHF-V는 오픈소스 MLLM 중에서 최신 기술 수준의 신뢰성을 달성했으며, 장문이고 복잡한 응답에서 뛰어난 사실 기반 성능을 보였다.
  • 특히 모호하거나 복잡한 시각적 시나리오에서 과도한 일반화에 기인한 환상 방지를 위해 GPT-4V보다 더 뛰어난 강건성을 보였다.
  • 인간 평가 결과, RLHF-V가 생성한 응답은 기반 모델과 경쟁하는 피지테이닝 모델의 응답보다 사실 기반 성향이 높고 환상에 덜 노출됨을 확인했다.
  • DDPO는 밀도 높은 피드백을 활용해 효율적이고 안정적인 훈련을 가능하게 하였으며, 보상 해킹을 방지하고 올바른 행동에 대한 책임 할당을 향상시켰다.
  • 환상 감소를 크게 줄였음에도 불구하고 강력한 유용성과 응답 품질을 유지하여 사실 정확성과 유효성 간 효과적인 트레이드오프를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.