Skip to main content
QUICK REVIEW

[論文レビュー] TAG: Boosting Text-VQA via Text-aware Visual Question-answer Generation

Jun Wang, Mingfei Gao|arXiv (Cornell University)|Aug 3, 2022
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本稿では、画像内の未活用されているシーンテキストから、高品質で多様なQAペairを合成するテキスト認識型の視覚的質疑応答生成フレームワークであるTAGを提案する。マルチモーダルトランスフォーマーを用いて、OCRトークンに根ざした質問を生成する。既存のText-VQAデータセットにこれらの合成ペアを追加することで、追加の人的ラベルなしにTextVQAおよびST-VQAのモデル性能を顕著に向上させ、大規模外部データで事前学習されたモデルを凌駕する最先端の結果を達成する。

ABSTRACT

Text-VQA aims at answering questions that require understanding the textual cues in an image. Despite the great progress of existing Text-VQA methods, their performance suffers from insufficient human-labeled question-answer (QA) pairs. However, we observe that, in general, the scene text is not fully exploited in the existing datasets -- only a small portion of the text in each image participates in the annotated QA activities. This results in a huge waste of useful information. To address this deficiency, we develop a new method to generate high-quality and diverse QA pairs by explicitly utilizing the existing rich text available in the scene context of each image. Specifically, we propose, TAG, a text-aware visual question-answer generation architecture that learns to produce meaningful, and accurate QA samples using a multimodal transformer. The architecture exploits underexplored scene text information and enhances scene understanding of Text-VQA models by combining the generated QA pairs with the initial training data. Extensive experimental results on two well-known Text-VQA benchmarks (TextVQA and ST-VQA) demonstrate that our proposed TAG effectively enlarges the training data that helps improve the Text-VQA performance without extra labeling effort. Moreover, our model outperforms state-of-the-art approaches that are pre-trained with extra large-scale data. Code is available at https://github.com/HenryJunW/TAG.

研究の動機と目的

  • 既存のText-VQAデータセットにおけるQAペアの希少なラベル付けの問題に取り組む。これは、画像に豊富に存在するシーンテキストを十分に活用していないことによる。
  • 人的ラベルなしで、未利用のシーンテキストを活用して多様で高品質なQAペアを生成する手法を開発すること。
  • OCRトークンと視覚的文脈に基づく合成QAサンプルを用いて、トレーニングデータを拡張することで、Text-VQAモデルの性能を向上させること。
  • テキスト認識型生成によるデータ拡張が、大規模外部データで事前学習されたモデルを凌駕できることを示すこと。

提案手法

  • TAGは、答え(OCRトークン)、検出されたオブジェクトの視覚的特徴、シーンテキストの埋め込みを入力として受け取り、文脈的に関連する質問を生成するマルチモーダルトランスフォーマーのアーキテクチャを採用する。
  • モデルは既存のラベル付きQAペアで学習され、オリジナルのラベルに含まれないOCRトークンを用いて、新しいQAペアを生成するようにファインチューニングされる。
  • 品質とトレーニング効率のバランスを考慮し、入力の答え選択は、最も大きなバウンディングボックスを持つOCRトークンを選択することで最適化される。
  • フレームワークは、QA生成を下流のVQAトレーニングから分離しており、スケーラブルなデータ拡張を可能にする。
  • 視覚的・意味的特徴(オブジェクト検出とOCR出力)を活用することで、質問の関連性と事実の整合性を保証する。
  • 本手法はTextVQAおよびST-VQAの両方のタスクに適用され、生成されたQAペアを元のトレーニングデータと統合し、最先端のVQAモデルをファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1画像内の未活用されているシーンテキストを、人的ラベルなしに高品質で多様なQAペアを生成するために活用できるか?
  • RQ2大規模データで事前学習されたモデルと比較して、テキスト認識型QA生成は下流のText-VQA性能をどの程度向上させるか?
  • RQ3視覚的オブジェクト、OCRトークン、答え選択戦略が、生成されたQAペアの品質に果たす寄与度は何か?
  • RQ4TAGによる合成データ拡張は、広範な事前学習に依存する既存のSOTA手法を上回ることができるか?

主な発見

  • TAGは、答え、オブジェクト、OCR入力を使用した制約付き設定下で、TextVQAの検証精度が52.54%に達し、いずれのモodalを欠落させたアブレーションよりも優れている。
  • TAP(140万件の追加事前学習サンプルを用いる)と比較して、ST-VQAでは正解率が2.70ポイント向上し、ANLSが0.022向上した。
  • 答え候補として最大3つのOCRトークン(最も大きな3つ)を使用することで、最大1つのトークンのみを使用する戦略に比べて0.19%の性能向上が得られたが、トレーニング時間の増加を伴った。
  • アブレーションスタディにより、答え、オブジェクト、OCRの3つのモダリティがすべて不可欠であることが確認され、視覚的およびテキスト的モダリティを同時に欠落させると、性能が最大3.78%低下した。
  • ST-VQAのテストセットでは、ANLSスコアが0.602に達し、追加の事前学習やモデル変更なしに、新たなSOTAを樹立した。
  • 本手法は、M4CおよびTAPの両ベンチマークにおいて顕著に優れており、合成データ生成が大規模外部データで学習されたモデルを凌駕できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。