Skip to main content
QUICK REVIEW

[論文レビュー] MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering

Jingqun Tang, Qi Liu|arXiv (Cornell University)|May 20, 2024
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

MTVQAは、9つの多様な言語で高品質な人間エキスパートのアノテーションを備えた、最初の多言語的・テキスト中心の視覚質問応答ベンチマークを提供し、翻訳ベースの手法における視覚的・テキスト的不一致問題に対処する。評価では、最先端のMLLMの間で顕著な性能差が明らかになり、多言語的・テキスト豊富な視覚理解分野におけるさらなる改善余地が示された。

ABSTRACT

Text-Centric Visual Question Answering (TEC-VQA) in its proper format not only facilitates human-machine interaction in text-centric visual environments but also serves as a de facto gold proxy to evaluate AI models in the domain of text-centric scene understanding. Nonetheless, most existing TEC-VQA benchmarks have focused on high-resource languages like English and Chinese. Despite pioneering works to expand multilingual QA pairs in non-text-centric VQA datasets through translation engines, the translation-based protocol encounters a substantial "visual-textual misalignment" problem when applied to TEC-VQA. Specifically, it prioritizes the text in question-answer pairs while disregarding the visual text present in images. Moreover, it fails to address complexities related to nuanced meaning, contextual distortion, language bias, and question-type diversity. In this work, we tackle multilingual TEC-VQA by introducing MTVQA, the first benchmark featuring high-quality human expert annotations across 9 diverse languages, consisting of 6,778 question-answer pairs across 2,116 images. Further, by comprehensively evaluating numerous state-of-the-art Multimodal Large Language Models~(MLLMs), including Qwen2-VL, GPT-4o, GPT-4V, Claude3, and Gemini, on the MTVQA benchmark, it is evident that there is still a large room for performance improvement (Qwen2-VL scoring 30.9 versus 79.7 for human performance), underscoring the value of MTVQA. Additionally, we supply multilingual training data within the MTVQA dataset, demonstrating that straightforward fine-tuning with this data can substantially enhance multilingual TEC-VQA performance. We aspire that MTVQA will offer the research community fresh insights and stimulate further exploration in multilingual visual text comprehension. The project homepage is available at https://bytedance.github.io/MTVQA/.

研究の動機と目的

  • 低リソース言語を含め、高品質で多言語的なテキスト中心のVQAベンチマークの不足を解消すること。
  • TCE-VQAのデータ拡張に翻訳ベースの手法を用いる際の内在的な視覚的・テキスト的不一致問題を克服すること。
  • 多言語環境下での洗練された言語的課題、文脈の歪み、質問タイプの多様性を捉えたベンチマークを提供すること。
  • 多言語的・テキスト豊富な視覚環境におけるマルチモーダルLLMの厳密な評価を可能にすること。
  • 今後の研究を促進する、多言語的・文書中心的・インstructチューニングを施したMLLMの開発を支援すること。

提案手法

  • 実世界のテキスト豊富な画像(例:メニュー、領収書、PPT、研究論文など)を多様なソースから収集し、視覚的・テキスト的関連性を確保する。
  • 2段階の人的アノテーションパイプラインを採用:第1段階でアノテーターが質問と回答を生成し、第2段階で別グループが正確性と一貫性を検証する。
  • 9か国語に焦点を当てる:アラビア語、韓国語、日本語、タイ語、ベトナム語、ロシア語、フランス語、ドイツ語、イタリア語。言語的多様性を確保する。
  • アノテーターが画像の内容とテキスト要素の両方を考慮して質問を策定することで、視覚的・テキスト的整合性を確保する。
  • コンテンツ抽出、推論、文脈理解の各分野をカバーする細分化されたシナリオを設計し、言語ごとの多様な状況を網羅する。
  • 各質問に対して正解を1つ提供するが、今後のバージョンでは複数の妥当な回答への拡張を計画している。

実験結果

リサーチクエスチョン

  • RQ1人間エキスパートによるアノテーションを備えた多言語的TCE-VQAベンチマークは、翻訳ベースのデータ拡張で見られる視覚的・テキスト的不一致問題を克服できるか?
  • RQ2最先端のMLLMは、多言語的・テキスト豊富な視覚質問応答タスクにおいて、単一言語のベンチマークと比較してどの程度の性能を示すか?
  • RQ3インストラクションチューニングは、多言語的TCE-VQAタスクにおけるMLLM性能をどの程度向上させるか?
  • RQ4特に高リソース言語グループと低リソース言語グループの間で、言語ごとの性能格差はどの程度顕著か?
  • RQ5文書中心のMLLMは、一般用途のMLLMと比較して、多言語的テキスト中心VQAタスクで優れた性能を示すか?

主な発見

  • Claude3 Opusは全9言語で平均25.7%の正答率を達成し、最先端モデルですら多言語的TCE-VQAが依然として大きな挑戦であることが示された。
  • 閉鎖型モデル、特にGPT-4VとGemini Ultraが全体的にオープンソースモデルを上回った。GPT-4Vは平均22.0%の正答率を記録した。
  • 言語ごとの性能に顕著な差が見られ、ラテン文字を使用するインドヨーロッパ語族(例:フランス語、ドイツ語、イタリア語)が、アラビア文字やタイ文字などの非ラテン文字を用いる言語(アラビア語、タイ語、ベトナム語)よりも高い正答率を示した。
  • インストラクションチューニングにより平均正答率が8.5ポイント向上した。フランス語で最大の向上(+14.2ポイント)、ロシア語で最小(+1.7ポイント)であった。
  • 文書中心のモデル(TextSquareやTextMonkey)は、一般用途のオープンソースモデルと比較して、MTVQAベンチマーク上で顕著な性能向上を示さなかった。
  • GLM4Vは特に低い性能(平均13.6%正答率)を示し、アラビア語と韓国語ではほぼゼロ点に近いスコアを記録した。これは、低リソース言語の理解におけるモデル固有の制限を浮き彫りにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。