Skip to main content
QUICK REVIEW

[논문 리뷰] ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning

Fanqing Meng, Wenqi Shao|arXiv (Cornell University)|2024. 01. 04.
Topic Modeling인용 수 4
한 줄 요약

ChartAssistant는 다양한 데이터셋(ChartSFT)을 활용한 차트-테이블 사전학습과 다중 작업 지시 훈련을 통해 다중 모odal 언어 모델로서, 다양한 차트 작업에서 최신 기술 수준의 성능을 달성한다. UniChart 및 ChartLlama과 같은 기존 SOTA 모델보다 특히 실제 차트에서 zero-shot 설정에서 수치적 추론 및 일반화 능력에서 뚜렷한 성능 향상을 보였다.

ABSTRACT

Charts play a vital role in data visualization, understanding data patterns, and informed decision-making. However, their unique combination of graphical elements (e.g., bars, lines) and textual components (e.g., labels, legends) poses challenges for general-purpose multimodal models. While vision-language models trained on chart data excel in comprehension, they struggle with generalization. To address these challenges, we propose ChartAssistant, a chart-based vision-language model for universal chart comprehension and reasoning. ChartAssistant leverages ChartSFT, a comprehensive dataset covering diverse chart-related tasks with basic (e.g. bars and pies) and specialized (e.g. radars, and bubbles) chart types. It undergoes a two-stage training process, starting with pre-training on chart-to-table parsing to align chart and text, followed by multitask instruction-following fine-tuning. This approach enables ChartAssistant to achieve competitive performance across various chart tasks. Experimental results demonstrate significant performance gains over the state-of-the-art UniChart and Chartllama method, especially outperforming them on real-world chart data with zero-shot setting. The code and data are available at https://github.com/OpenGVLab/ChartAst.

연구 동기 및 목표

  • 복잡한 그래픽적 요소와 텍스트 요소를 포함한 차트를 이해하는 데에 일반적인 시각-언어 모델의 한계를 해결하기 위해.
  • 시각적 표현과 구조화된 텍스트 표현 간의 정렬을 통해 차트 이해에서 zero-shot 일반화 및 추론 능력을 향상시키기 위해.
  • 기존 차트 모델들이 작업별 특화된 미세조정이 필요로 하는 낮은 일반화 능력을 극복하기 위해.
  • 다양한 차트 유형과 작업을 포함한 종합적이고 다양한 고품질의 지시 훈련 데이터셋(ChartSFT)을 개발하기 위해.
  • 일관된 통합 모델이 다양한 실제 시나리오에서 다양한 차트 관련 작업을 높은 성능으로 수행할 수 있도록 하기 위해.

제안 방법

  • 시각적 차트 표현과 구조화된 텍스트 테이블 간의 정렬을 위해 차트-테이블 번역 작업을 기반으로 모델을 사전학습한다.
  • 다양한 차트 유형(예: 레이더도, 상자 그림 등), 작업(QA, 요약, 참조), 그리고 체인 오브 토우(Chain-of-Thought)를 포함한 수치적 추론을 위한 annotation을 포함한 대규모 지시-따르기 데이터셋인 ChartSFT를 구축한다.
  • ChartSFT에서 다중 작업 지시 훈련을 수행하여 여러 차트 관련 작업을 하나의 통합 훈련 목표로 통합한다.
  • 효율성과 강건성을 확보하기 위해 두 가지 모델 버전을 사용한다: ChartAst-D(260M 파라미터, Donut 기반) 및 ChartAst-S(13B 파라미터, SPHINX 기반).
  • 수학적 추론 및 수치 질문-답변 정확도 향상을 위해 훈련 과정에 체인 오브 토우(CoT) annotation을 통합한다.
  • 특히 arXiv에서 유래한 개방형 추론 작업을 위해 GPT-3.5를 활용해 고품질, 다양한 종류의 정확한 질문-답변 쌍을 생성한다.

실험 결과

연구 질문

  • RQ1특정 작업에 맞춘 미세조정 없이도 통합된 시각-언어 모델이 다양한 차트 유형과 작업에서 강력한 zero-shot 일반화 성능을 달성할 수 있는가?
  • RQ2차트-테이블 사전학습은 차트의 시각적 표현과 텍스트 표현 간의 정렬을 어떻게 향상시키는가?
  • RQ3다양한 차트 작업을 포함한 다중 작업 지시 훈련이 추론 및 이해 능력을 얼마나 향상시키는가?
  • RQ4체인 오브 토우(annotation)는 수치적 질문-답변 성능 향상에 얼마나 효과적인가?
  • RQ5넓고 다양한 데이터셋으로 훈련된 단일 모델이 실제 차트 데이터에서 작업별 특화된 미세조정된 모델보다 뛰어난 성능을 낼 수 있는가?

주요 결과

  • ChartAssistant는 평가된 모든 차트 작업에서 최신 기술 수준의 성능을 달성하였으며, 특히 실제 데이터에서 zero-shot 설정에서 UniChart 및 ChartLlama를 능가하였다.
  • 체인 오브 토우(CoT) annotation의 사용으로 수치적 질문-답변 정확도가 51.9%에서 72.1%로 상승하였으며, 점선도 및 선도에서는 각각 22%와 26.6%의 향상이 관찰되었다.
  • 다중 작업 지시 훈련의 어떤 구성 요소라도 생략할 경우 성능 저하가 발생하였으며, 특히 수치적 질문-답변 능력이 전체 성능에 가장 중요한 요소로 확인되었다.
  • ChartAst-S(13B 파라미터 버전)는 SPHINX에서 유산받은 동적 해상도 처리 및 혼합 시각 인코더 덕분에 뛰어난 강건성과 성능을 보였다.
  • ChartQA(augmented) 벤치마크에서 91.3%의 정확도를 기록하였고, 수치적 QA에서는 72.1%의 정확도를 달성하여 이전의 SOTA 방법들을 크게 능가하였다.
  • 제거 실험(ablation study) 결과, 다양한 차트 유형(예: 레이더도, 상자 그림 등)과 포괄적인 annotation의 포함이 일반화 능력 및 모델 능력 향상에 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.