[논문 리뷰] MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning
이 논문은 다중모달 차트 이해를 위한 600만 건의 인스턴스를 포함하는 지시튜닝 데이터셋인 MMC-Instruction을 소개하고, 이 데이터로 미세조정된 시각-언어 모델인 MMCA를 제안한다. MMCA는 차트 질의응답 벤치마크에서 최신 기술 수준(SoTA) 성능을 달성한다. 또한 인간이 애너테이션한 종합적인 평가 세트인 MMC-Benchmark를 제안하며, 이는 9개의 다양한 작업을 포함하고 있다. 이는 기존의 LMMs—특히 GPT-4V—가 복잡한 작업, 예를 들어 차트에서 데이터테이블로, 차트에서 JSON으로의 변환 작업에서 뚜렷한 한계를 드러낸다.
With the rapid development of large language models (LLMs) and their integration into large multimodal models (LMMs), there has been impressive progress in zero-shot completion of user-oriented vision-language tasks. However, a gap remains in the domain of chart image understanding due to the distinct abstract components in charts. To address this, we introduce a large-scale MultiModal Chart Instruction ( extbf{MMC-Instruction}) dataset comprising 600k instances supporting diverse tasks and chart types. Leveraging this data, we develop MultiModal Chart Assistant ( extbf{MMCA}), an LMM that achieves state-of-the-art performance on existing chart QA benchmarks. Recognizing the need for a comprehensive evaluation of LMM chart understanding, we also propose a MultiModal Chart Benchmark ( extbf{MMC-Benchmark}), a comprehensive human-annotated benchmark with nine distinct tasks evaluating reasoning capabilities over charts. Extensive experiments on MMC-Benchmark reveal the limitations of existing LMMs on correctly interpreting charts, even for the most recent GPT-4V model. Our work provides an instruction-tuning methodology and benchmark to advance multimodal understanding of charts. Code and data are available at https://github.com/FuxiaoLiu/MMC.
연구 동기 및 목표
- 복잡하고 추상적인 차트 요소, 예를 들어 추세선, 범례, 축 레이블 등의 이해 능력이 떨어지는 대규모 다중모달 모델(LMMs)의 격차를 보완한다.
- 기존의 차트 이해 데이터셋이 일반적으로 크기가 작거나 템플릿 기반이며 언어 스타일과 차트 유형의 다양성이 부족한 점을 해결한다.
- 단순한 QA를 넘어서 다양한 인지 수준의 작업을 포함하는 종합적이고 인간이 애너테이션한 벤치마크(MMC-Benchmark)를 개발하여 LMMs의 성능을 평가한다.
- 다양하고 개방형 지시 데이터셋을 사용하여 대규모 지시튜닝을 통해 LMM의 차트 이해 능력을 향상시킨다.
- 기존의 LMMs가 특히 차트에서 데이터 추출 작업(예: 차트 → 데이터테이블, 차트 → JSON)에서 지속적으로 약한 성능을 보이는 이유를 규명하고 분석한다.
제안 방법
- GPT-4를 사용하여 9개의 서로 다른 차트 이해 작업 범위에서 다양하고 자유형, 개방형 지시를 생성하여 총 600만 건의 인스턴스를 포함하는 MMC-Instruction 데이터셋을 구축한다.
- 인간이 애너테이션한 종합적인 평가 세트로, 차트 정보 추출, 추론, 주제 분류, 데이터 포맷 변환(예: 차트 → 데이터테이블, 차트 → JSON) 등 9개의 서브작업을 포함하는 MMC-Benchmark를 설계한다.
- 통합 지시튜닝 전략을 사용하여 시각-텍스트 정렬을 향상시키기 위해 업데이트된 시각 프로젝터를 포함한 모듈러한 지시튜닝 LMM인 MMCA를 개발한다.
- 자유형 생성 평가(ChatGPT 기반)와 다중 선택 QA 평가를 통해 추론 능력과 사실 정확도를 모두 평가하는 두 가지 평가 프로토콜을 적용한다.
- 시각 특징을 LLM의 입력 공간에 더 잘 통합하기 위해, 미세조정 중에 시각 프로젝터를 업데이트하는 통합 학습 전략을 사용한다.
- 표준 벤치마크(예: ChartQA)와 MMC-Benchmark를 모두 대상으로 광범위한 아블레이션 및 비교 실험을 수행하여 다양한 차트 유형과 작업에서의 성능을 평가한다.

실험 결과
연구 질문
- RQ1대규모이고 다양한 지시 튜닝이, 제로샷 또는 피셔샷 능력 이상의 다중모달 차트 이해 능력 향상에 상당한 기여를 할 수 있는가?
- RQ2기존의 LMMs, 특히 GPT-4V는 차트 → 데이터테이블 및 차트 → JSON 변환과 같은 복잡하고 개방형 지시 작업에서 어떻게 수행되는가?
- RQ3제안된 MMC-Benchmark는 기존의 단순한 벤치마크가 드러내지 못한 현재의 LMMs의 한계를 어느 정도 드러내는가?
- RQ4현재의 LMMs가 차트 이해에서 주로 나타나는 주요 실패 유형은 무엇이며, 특히 지시 수행 능력과 시각적 특징 통합 능력에서의 문제는 무엇인가?
- RQ5대규모이고 다양한 데이터셋인 MMC-Instruction을 사용한 통합 지시튜닝 접근 방식이, 차트 추론 작업에서 오픈소스 LMMs와 GPT-4V와 같은 전문 모델 간의 성능 격차를 줄일 수 있는가?
주요 결과
- MMCA는 기존의 차트 QA 벤치마크에서 최신 기술 수준 성능를 달성하였으며, MMC-Benchmark의 9개 모든 작업에서 기존 오픈소스 LMMs를 크게 앞서나간다.
- 가장 고급의 다중모달 모델인 GPT-4V로도 차트 → 데이터테이블 및 차트 → JSON 작업에서 성능이 열악하여, 데이터 추출 정확도에 심각한 격차가 있음을 시사한다.
- 기존 LMMs의 MMC-Benchmark에서의 총점은 기존의 벤치마크(예: ChartQA)보다 상당히 낮은데, 이는 질문과 답변의 다양성과 개방형 성격 때문일 것이다.
- MMC-Instruction 데이터셋은 MMC-Benchmark의 9개 모든 작업에서 기준 LMMs에 비해 상당한 성능 향상을 이끌어내어, 지시튜닝에 효과적임을 입증한다.
- 흔한 실패 유형으로는 지시를 잘못 이해하는 것(예: 비율 질문에 'Yes'로 대답), 시각 인코더가 약한 것(예: CLIP 기반 모델), OCR 유사한 데이터 추출의 정확도 부족 등이 있다.
- 시각 인코더의 한계와 차트 전용 데이터에 대한 미세조정 부족은 특히 정확한 데이터 값 추출이 필요한 작업에서 성능 저하의 주요 원인이다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.