Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey of Multimodal Large Language Model from A Data-centric Perspective

Tianyi Bai, Hao Liang|arXiv (Cornell University)|2024. 05. 26.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 종합적 서베이는 다중모态 대규모 언어 모델(MLLM)에 대한 데이터 중심 분석을 제공하며, 다양한 모odal 간 데이터 수집, 정제, 품질 및 평가에 중점을 둔다. 본 서베이는 데이터 양, 품질 및 구조를 향상시키는 반복적 데이터 개선 전략이 MLLM 성능을 크게 향상시킬 수 있음을 제안하며, 모델 아키텍처 최적화를 넘어서 데이터셋 개발 및 벤치마킹을 위한 체계적인 프레임워크를 제공한다.

ABSTRACT

Multimodal large language models (MLLMs) enhance the capabilities of standard large language models by integrating and processing data from multiple modalities, including text, vision, audio, video, and 3D environments. Data plays a pivotal role in the development and refinement of these models. In this survey, we comprehensively review the literature on MLLMs from a data-centric perspective. Specifically, we explore methods for preparing multimodal data during the pretraining and adaptation phases of MLLMs. Additionally, we analyze the evaluation methods for the datasets and review the benchmarks for evaluating MLLMs. Our survey also outlines potential future research directions. This work aims to provide researchers with a detailed understanding of the data-driven aspects of MLLMs, fostering further exploration and innovation in this field.

연구 동기 및 목표

  • 모델 아키텍처 향상 외에 데이터 중심 접근법에 대한 종합적인 연구가 부족한 데 대비하여 이를 해결하기 위해.
  • 사전학습 및 적응 과정에서 데이터 특성—양, 품질, 모달 이질성—이 MLLM 성능에 미치는 영향을 조사하기 위해.
  • 시각, 청각, 텍스트, 영상 모달 간 기존 다중모달 데이터셋 및 평가 벤치마크에 대한 체계적인 리뷰를 제공하기 위해.
  • MLLM의 데이터 정제, 데이터 관리 및 강력한 평가에 있어 열려 있는 과제를 규명하고 향후 연구 방향을 제안하기 위해.
  • 모델 중심 조정이 아닌 데이터 중심 개선을 강조함으로써 MLLM의 데이터 기반 혁신 기반을 마련하기 위해.

제안 방법

  • 텍스트, 시각, 청각, 영상, 3D 환경의 다섯 가지 모달에 걸쳐 다중모달 데이터셋을 체계적으로 분류하고 검토한다.
  • 사전학습 및 파인튜닝 기간 동안 데이터 수집, 선별, 주석 처리 및 사전처리 전략을 포함한 MLLM용 데이터 준비 파이프라인을 분석한다.
  • 주석 일관성, 모달 일치도, 언어 다양성 등의 지표를 통해 데이터 품질을 평가한다.
  • VQA, VCR, Charades-STA, QVHighlight, AudioCaps, Clotho, ClothoAQA와 같은 작업별 데이터셋을 포함한 MLLM 평가 프레임워크를 검토한다.
  • 데이터 양 확대, 데이터 품질 향상, 더 나은 모달 일치를 위한 데이터 구조화를 통해 반복적 데이터 개선을 강조하는 데이터 중심 프레임워크를 제안한다.
  • 데이터가 모델 성능의 주요 동력임을 중시하는 데이터 중심 AI(DCAI)의 통찰을 통합하여 데이터셋 설계 및 평가를 이끌며, 데이터를 핵심 요소로 삼는다.

실험 결과

연구 질문

  • RQ1다양한 모달 간에 다중모달 데이터를 효과적으로 수집, 선별 및 관리할 수 있는 방법은 무엇인가? 이를 통해 MLLM 학습을 지원할 수 있는가?
  • RQ2다양한 작업 및 아키텍처에서 데이터 품질, 양, 모달 일치도가 MLLM 성능에 미치는 영향는 어떠한가?
  • RQ3기존 평가 벤치마크는 어떻게 개선되어야 실생활 다중모달 이해 및 추론 능력을 더 잘 반영할 수 있는가?
  • RQ4MLLM를 위한 고품질, 다양성 있고 확장 가능한 다중모달 데이터셋을 정제하고 유지하는 데 있어 핵심 과제는 무엇인가?
  • RQ5현재 모델 중심 패러다임을 넘어서 다중모달 LLM의 데이터 중심 개발을 선도하기 위해 필요한 향후 연구 방향은 무엇인가?

주요 결과

  • 데이터 품질은 데이터 양만큼 중요하며, 정제된 데이터셋을 통해 더 작은 모델이 더 큰 모델의 성능을 따라잡을 수 있다.
  • Charades-STA 데이터셋은 시계열 활동 정위치를 위한 복잡하고 장문의 언어 쿼리를 지원하며, 훈련용 13,898개, 테스트용 4,233개의 클립-문장 쌍을 포함한다.
  • QVHighlight 데이터셋은 10,000개 이상의 YouTube 영상과 쿼리 관련 순간 주석 및 시각적 중요도 점수를 제공하여 하이라이트 검출 및 순간 정위치를 가능하게 한다.
  • AudioCaps는 46,000개의 청각-캡션 쌍을 포함하며, Clotho는 4,981개의 청각 샘플과 24,905개의 캡션을 제공하여 일반적인 청각 캡션 및 기술 작업을 지원한다.
  • ClothoAQA는 1,991개의 오디오 파일과 11,946개의 커뮤니티 기반 질문(예/아니요 및 단어 하나로 된 답변 포함)을 제공하여 오디오 질의응답 평가를 가능하게 한다.
  • Audio-MusicAVQA는 9,000여 개의 음악 공연 영상에서 유래한 45,000개 이상의 QA 쌍을 포함하며, 9종의 질문 유형과 33개의 템플릿을 통해 오디오-비주얼 장면에서의 시공간적 추론을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.