Skip to main content
QUICK REVIEW

[논문 리뷰] AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation

Junyang Wang, Yuhang Wang|arXiv (Cornell University)|2023. 11. 13.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 생성 및 판별 작업 전반에서 다중 모odal 대규모 언어 모델(MLLM)의 환각 현상 평가를 위한 LLM을 사용하지 않는 다차원 기준 AMBER를 소개한다. 이 기준은 외부 LLM에 의존하지 않고 존재, 속성, 관계 환각 현상을 비용 효율적이고 자동으로 평가할 수 있게 하며, GPT-4V조차도 특히 속성 및 관계 이해에서 상당한 환각 현상을 보이는 것으로 드러났다.

ABSTRACT

Despite making significant progress in multi-modal tasks, current Multi-modal Large Language Models (MLLMs) encounter the significant challenge of hallucinations, which may lead to harmful consequences. Therefore, evaluating MLLMs' hallucinations is becoming increasingly important in model improvement and practical application deployment. Previous works are limited in high evaluation costs (e.g., relying on humans or advanced LLMs) and insufficient evaluation dimensions (e.g., types of tasks and hallucinations). In this paper, we propose an LLM-free multi-dimensional benchmark AMBER, which can be used to evaluate both generative task and discriminative task including existence, attribute and relation hallucination. Based on AMBER, we design a low-cost and efficient evaluation pipeline. Additionally, we conduct a comprehensive evaluation and detailed analysis of mainstream MLLMs including GPT-4V(ision), and also give guideline suggestions for mitigating hallucinations. The data and code of AMBER are available at https://github.com/junyangwang0410/AMBER.

연구 동기 및 목표

  • 인간의 주석 또는 고급 LLM에 의존하는 기존 환각 현상 평가 기준의 높은 비용과 범위 제한 문제를 해결하기 위해.
  • 생성 및 판별 작업 전반에서 존재, 속성 및 관계 유형의 다양한 환각 현상을 포함하는 종합적이고 다차원적인 기준을 개발하기 위해.
  • 외부 모델에 대한 의존도를 줄이고 확장성을 향상시키기 위해 LLM을 사용하지 않고 자동화된 평가 파이프라인을 설계하기 위해.
  • 주요 MLLM, 특히 GPT-4V를 포함한 모델들의 실증적 분석을 통해 지속적인 환각 패턴을 규명하고 대응 전략을 안내하기 위해.

제안 방법

  • 모호성을 최소화하기 위해 명확한 시각적 콘텐츠와 잘 정의된 객체를 갖춘 고품질의 비학습 이미지 데이터셋을 준비하기 위해.
  • 각 이미지에 대해 객체 존재, 속성(예: 색상, 상태, 수량) 및 공간/시간적 관계에 대한 정밀한 다단계 레이블을 부여하기 위해.
  • 외부 LLM에 의존하지 않고 규칙 기반 및 자연어 처리 기반 기법(예: spaCy, NLTK)을 사용하여 모델 출력을 기준값 레이블과 비교하는 자동화된 평가 파이프라인을 설계하기 위해.
  • 작업 유형별 평가 프로토콜을 구현: 생성 작업의 경우 생성된 텍스트를 기준 레이블과 비교하고, 판별 작업의 경우 존재, 속성 및 관계 주장에 대해 이진 분류를 수행하기 위해.
  • 환각 빈도를 다양한 환각 유형과 작업 유형에서 정량화하기 위해 F1 점수와 정확도를 주요 지표로 사용하기 위해.
  • GPT-4V를 포함한 다양한 MLLM을 평가하기 위해 이 기준을 적용하여 성능 분석 및 실패 모드 규명하기 위해.

실험 결과

연구 질문

  • RQ1완전히 LLM을 사용하지 않는 기준이 생성 및 판별 MLLM 작업 전반에서 환각 현상을 효과적으로 평가할 수 있는가?
  • RQ2주요 MLLM, 특히 GPT-4V가 통합된 다차원 기준에서 존재, 속성 및 관계 유형의 환각 현상에 대해 어떻게 성능을 보이는가?
  • RQ3MLLM의 속성 및 관계 환각 현상에서 두드러지는 실패 모드는 무엇이며, 모델 아키텍처에 따라 어떻게 다를 수 있는가?
  • RQ4외부 LLM에 의존하지 않고 자동화된 규칙 기반 평가 파이프라인은 얼마나 신뢰할 수 있는 환각 탐지 성능을 달성할 수 있는가?

주요 결과

  • AMBER는 생성 및 판별 작업 전반에서 LLM을 사용하지 않고도 환각 현상을 자동으로 평가할 수 있게 하여 평가 비용을 줄이고 확장성을 높였다.
  • 평가된 가장 고급 MLLM인 GPT-4V조차도 존재하지 않는 속성 및 관계 이해에서 상당한 환각 현상을 보이며, 속성 환각의 경우 F1 점수 약 0.7, 관계 환각의 경우 약 0.6를 기록했다.
  • 객체 상태 및 수량과 관련된 세밀한 속성 환각 현상에 대해 MLLM의 성능이 열악하여, 이러한 속성에 초점을 맞춘 개선된 데이터 셋 구성이 필요하다는 점을 시사한다.
  • 반대로, 행동 관련 환각 현상에 대해서는 MLLM이 상대적으로 우수한 성능을 보이며, 오픈소스 모델의 경우 일부 사례에서 GPT-4V를 초월하기도 해 행동 이해에 효과적으로 학습된 것으로 보인다.
  • 관계 환각 현상은 가장 심각한 편으로, 대부분의 모델이 약 60%의 정확도에 머물러 있어 관계 기술에 대한 훈련 데이터의 편향성 또는 희소성 때문일 가능성이 높다.
  • 이 기준은 GPT-4V의 잘못된 객체 관계 및 허위 속성 주장과 같은 환각 현상을 성공적으로 탐지하여 민감도와 신뢰성의 검증을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.