Skip to main content
QUICK REVIEW

[논문 리뷰] MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering

Jingqun Tang, Qi Liu|arXiv (Cornell University)|2024. 05. 20.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

MTVQA는 9개의 다양한 언어에서 고품질의 전문가가 작성한 주석을 바탕으로 한 다국어, 텍스트 중심의 시각질문응답 벤치마크를 처음으로 제안하며, 번역 기반 방법에서 발생하는 시각-텍스트 불일치 문제를 해결한다. 평가 결과 최신 다국어 다중모odal 언어모델(MLLM)들 사이에 뚜렷한 성능 격차가 드러나, 다국어 텍스트 기반 시각 이해 분야에서 향후 개선 여지가 크다는 점을 시사한다.

ABSTRACT

Text-Centric Visual Question Answering (TEC-VQA) in its proper format not only facilitates human-machine interaction in text-centric visual environments but also serves as a de facto gold proxy to evaluate AI models in the domain of text-centric scene understanding. Nonetheless, most existing TEC-VQA benchmarks have focused on high-resource languages like English and Chinese. Despite pioneering works to expand multilingual QA pairs in non-text-centric VQA datasets through translation engines, the translation-based protocol encounters a substantial "visual-textual misalignment" problem when applied to TEC-VQA. Specifically, it prioritizes the text in question-answer pairs while disregarding the visual text present in images. Moreover, it fails to address complexities related to nuanced meaning, contextual distortion, language bias, and question-type diversity. In this work, we tackle multilingual TEC-VQA by introducing MTVQA, the first benchmark featuring high-quality human expert annotations across 9 diverse languages, consisting of 6,778 question-answer pairs across 2,116 images. Further, by comprehensively evaluating numerous state-of-the-art Multimodal Large Language Models~(MLLMs), including Qwen2-VL, GPT-4o, GPT-4V, Claude3, and Gemini, on the MTVQA benchmark, it is evident that there is still a large room for performance improvement (Qwen2-VL scoring 30.9 versus 79.7 for human performance), underscoring the value of MTVQA. Additionally, we supply multilingual training data within the MTVQA dataset, demonstrating that straightforward fine-tuning with this data can substantially enhance multilingual TEC-VQA performance. We aspire that MTVQA will offer the research community fresh insights and stimulate further exploration in multilingual visual text comprehension. The project homepage is available at https://bytedance.github.io/MTVQA/.

연구 동기 및 목표

  • 저자원 언어를 포함한 고품질의 다국어 텍스트 중심 VQA 벤치마크 부족 문제를 해결한다.
  • TEC-VQA에 대한 번역 기반 데이터 확장 방식에서 발생하는 시각-텍스트 불일치 문제를 극복한다.
  • 다국어 환경에서의 미묘한 언어적 과제, 맥락 왜곡, 질문 유형 다양성 등을 반영한 벤치마크를 제공한다.
  • 다국어, 텍스트 기반 시각 환경에서 다중모달 LLM의 철저한 평가를 가능하게 한다.
  • 텍스트 중심 시각 작업을 위한 다국어, 문서 중심, 지시어 훈련된 MLLM 연구를 향한 향후 연구를 자극한다.

제안 방법

  • 실제 생활 속 텍스트 기반 이미지(예: 메뉴, 청구서, 프레젠테이션, 학술 논문 등)를 다양한 출처에서 수집하여 시각-텍스트의 관련성을 확보한다.
  • 두 단계로 구성된 인간 주석 처리 프로세스를 적용: 첫 번째 단계에서 주석자들이 질문과 답변을 생성하고, 두 번째 단계에서 별도의 팀이 정확성과 일관성을 검증한다.
  • 9개 언어에 중점을 두며, 아랍어, 한국어, 일본어, 태국어, 베트남어, 러시아어, 프랑스어, 독일어, 이탈리아어를 포함하여 언어적 다양성을 확보한다.
  • 질문을 구성할 때 이미지의 내용과 텍스트 요소를 동시에 고려하도록 주석자들에게 지침을 내려 시각-텍스트 일치를 보장한다.
  • 내용 추출, 추론, 맥락 이해 등 다양한 언어에서의 세분화된 시나리오를 고려해 데이터셋을 설계한다.
  • 질문당 하나의 표준 답변을 제공하며, 향후 버전에서는 다수의 타당한 답변으로 확장할 계획이다.

실험 결과

연구 질문

  • RQ1전문가 주석이 달린 다국어 TEC-VQA 벤치마크가 번역 기반 데이터 확장에서 나타나는 시각-텍스트 불일치 문제를 해결할 수 있는가?
  • RQ2최신 MLLM의 성능은 다국어 텍스트 기반 시각질문응답에서 단일 언어 기반 벤치마크와 비교해 어떻게 나타나는가?
  • RQ3지시어 훈련이 다국어 TEC-VQA 작업에서 MLLM 성능 향상에 얼마나 기여하는가?
  • RQ4특히 고자원 언어와 저자원 언어 그룹 간 언어별 성능 격차는 어느 정도인가?
  • RQ5문서 중심 MLLM은 일반 목적의 MLLM에 비해 다국어 텍스트 중심 VQA에서 더 뛰어난 성능을 보이는가?

주요 결과

  • Claude3 Opus는 9개 언어 전반에서 평균 정확도 25.7%를 기록하여, 최신 기술의 MLLM들 역시 다국어 TEC-VQA에 있어서 여전히 도전 과제로 남아 있음을 시사한다.
  • 폐쇄형 모델, 특히 GPT-4V와 Gemini Ultra가 개방형 모델을 압도적으로 앞서며, GPT-4V는 평균 정확도 22.0%를 기록했다.
  • 언어별 성능 격차가 뚜렷했으며, 라틴 문자를 사용하는 인도·유럽어족 언어(예: 프랑스어, 독일어, 이탈리아어)가 아랍어, 태국어, 베트남어와 같은 비라틴 문자 언어보다 높은 정확도를 보였다.
  • 지시어 훈련은 평균 정확도를 8.5%p 향상시켰으며, 프랑스어에서 가장 큰 향상(14.2%p)을 보였고, 러시아어는 가장 낮은 향상(1.7%p)을 보였다.
  • 문서 중심 모델인 TextSquare와 TextMonkey는 MTVQA 벤치마크에서 일반 목적의 개방형 모델보다 유의미한 성능 향상을 보이지 않았다.
  • GLM4V는 특히 열악한 성능을 보였으며(평균 정확도 13.6%), 아랍어와 한국어에서는 거의 0점에 가까운 점수를 기록하여, 저자원 언어 이해 능력에 대한 모델 특화한 한계를 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.