Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey on Benchmarks of Multimodal Large Language Models

Li Jian, Weisheng Lu|arXiv (Cornell University)|2024. 08. 16.
Topic Modeling인용 수 4
한 줄 요약

이 종합 검토에서는 다중모态 대규모 언어 모델(MLLM)을 평가하는 180개의 벤치마크에 대한 포괄적인 분석을 제시하며, 이를 인지 및 이해, 인지 및 추론, 특정 도메인, 핵심 능력, 기타 모odalities로 분류한다. 2024년 이후 83개의 벤치마크에서 GPT-4와 Gemini가 최고 성능을 보이며, 평가가 MLLM 개발과 AGI 발전을 위해 핵심 분야로 간주되어야 한다고 주장한다.

ABSTRACT

Multimodal Large Language Models (MLLMs) are gaining increasing popularity in both academia and industry due to their remarkable performance in various applications such as visual question answering, visual perception, understanding, and reasoning. Over the past few years, significant efforts have been made to examine MLLMs from multiple perspectives. This paper presents a comprehensive review of 200 benchmarks and evaluations for MLLMs, focusing on (1)perception and understanding, (2)cognition and reasoning, (3)specific domains, (4)key capabilities, and (5)other modalities. Finally, we discuss the limitations of the current evaluation methods for MLLMs and explore promising future directions. Our key argument is that evaluation should be regarded as a crucial discipline to support the development of MLLMs better. For more details, please visit our GitHub repository: https://github.com/swordlidev/Evaluation-Multimodal-LLMs-Survey.

연구 동기 및 목표

  • 다중모달 대규모 언어 모델(MLLM)을 평가하는 180개의 벤치마크에 대한 포괄적이고 체계적인 검토를 제공하기 위해.
  • 평가 기준의 다섯 가지 핵심 차원(인지 및 이해, 인지 및 추론, 특정 도메인, 핵심 능력, 기타 모달리티)에 따라 평가 벤치마크를 식별하고 분류하기 위해.
  • 2024년 이후 발표된 83개의 벤치마크에서 최고의 MLLM(예: GPT-4, Gemini)의 성능을 분석하여 추세와 모델의 강점을 파악하기 위해.
  • 현재 평가 관행의 한계를 부각하고 MLLM 개발에서 평가를 핵심 분야로 삼아야 한다고 주장하기 위해.
  • 부족하게 다뤄진 분야를 식별하고 강력하고 신뢰성 있으며 일반화 가능한 평가 프레임워크를 촉진함으로써 향후 연구를 이끌기 위해.

제안 방법

  • 평가 초점을 기반으로 다섯 가지 주요 범주로 분류된 180개의 MLLM 평가 벤치마크를 체계적으로 수집하고 분류하기 위해.
  • 작업 유형, 데이터 크기, 모달리티 지원(이미지, 영상, 음성, 3D 등), 주석 형식, 평가 프로토콜 등을 포함한 벤치마크 세부 정보를 정리하기 위해.
  • 2024년의 83개의 벤치마크에서 상위 세 개의 MLLM(GPT-4, Gemini, GPT-4V)의 성능을 분석하며, 정확도 및 작업 커버리지 등의 지표를 포함하기 위해.
  • 기능 범위(예: 공간 추론, 환상 탐지, 의료 영상 등)에 따라 벤치마크를 정리하는 분류 체계를 개발하여 다중 벤치마크 간 비교를 가능하게 하기 위해.
  • 향후 평가 수요를 반영하기 위해 M3DBench(3D 추론), ScanReason(3D 기반), MMT-Bench(일체형 작업)와 같은 새로운 벤치마크를 포함하기 위해.
  • 개방형 질문(예: MQA, 개방형 질문)을 위한 GPT 기반 평가를 사용하여 다양한 모델 간 비교를 표준화하기 위해.

실험 결과

연구 질문

  • RQ1MLLM 벤치마크에서 지배적인 평가 범주와 하위 유형은 무엇이며, 인지, 추론, 도메인 특화 작업에 어떻게 분포되어 있는가?
  • RQ22024년 이후 발표된 83개의 벤치마크에서 최고 성능을 내는 MLLM(예: GPT-4, Gemini)의 성능은 어떻게 비교되는가?
  • RQ3현재 MLLM 평가 관행의 주요 한계는 무엇이며, 특히 내구성, 공정성, 실제 세계 일반화 능력 측면에서 어떤가?
  • RQ43D, 음성, 포인트 클라우드와 같은 신규 모달리티를 대상으로 한 벤치마크는 고도화된 MLLM 능력을 평가하는 데 어떻게 기여하는가?
  • RQ5기존의 벤치마크는 지시어 따르기, 환상 방지, 다단계 추론과 같은 사용자 중심의 핵심 능력을 얼마나 평가하는가?

주요 결과

  • GPT-4와 Gemini는 2024년 이후 83개의 벤치마크에서 일관되게 다른 모델들을 압도하며, 다중모달 추론 및 이해 능력에서의 지배적 위치를 입증한다.
  • 인지 및 이해 벤치마크(예: VQA, 이미지 캡션)가 가장 널리 보급되어 있으나, 공간 추론, 논리적 추론과 같은 인지 및 추론 작업은 점점 더 복잡해지고 있다.
  • 3D 환경(예: M3DBench, ScanReason)과 공간 추론(예: SpatialRGPT)을 대상으로 한 벤치마크가 등장하여, MLLM의 세밀한 공간 이해 능력 평가를 위해 설계되고 있으며, 이는 현재 MLLM의 약점으로 지적된다.
  • 환상 또는 신뢰성 평가를 포함한 벤치마크는 전체의 15%에 불과하여, 모델의 신뢰성과 안전성 평가에 있어 심각한 격차가 있음을 시사한다.
  • MMT-Bench와 MCUB 벤치마크는 이미지, 음성, 영상, 포인트 클라우드 4개의 모달리티에서의 공동 추론 및 다중모달 공통성 평가를 목표로 하여, 종합적인 다중모달 지능 평가로의 이동을 상징한다.
  • 벤치마크의 증가에도 불구하고 통합 평가 프레임워크는 존재하지 않으며, 많은 벤치마크에서 주석, 평가 지표, 또는 개방형 접근성의 표준화가 부족하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.