[論文レビュー] MultiModalQA: Complex Question Answering over Text, Tables and Images
本論文では、テキスト、表、画像の3つのモダリティを統合して推論を要する29,918件の複雑な質問を含む大規模なデータセット、MultiModalQA (MMQA) を紹介する。そのうち35.7%の質問がクロスモダリティ推論を要しており、本番のクロスモダリティ推論を必要とするデータセットとして初めての試みである。著者らは、明示的な質問分解を経ずにマルチモーダル質問を暗黙的に分解するモデルであるImplicitDecompを提案し、51.7 F1の性能を達成した。これは単一ホップベースライン(38.2 F1)を著しく上回るが、人間の性能(90.1 F1)にはまだ大きな差がある。
When answering complex questions, people can seamlessly combine information from visual, textual and tabular sources. While interest in models that reason over multiple pieces of evidence has surged in recent years, there has been relatively little work on question answering models that reason across multiple modalities. In this paper, we present MultiModalQA(MMQA): a challenging question answering dataset that requires joint reasoning over text, tables and images. We create MMQA using a new framework for generating complex multi-modal questions at scale, harvesting tables from Wikipedia, and attaching images and text paragraphs using entities that appear in each table. We then define a formal language that allows us to take questions that can be answered from a single modality, and combine them to generate cross-modal questions. Last, crowdsourcing workers take these automatically-generated questions and rephrase them into more fluent language. We create 29,918 questions through this procedure, and empirically demonstrate the necessity of a multi-modal multi-hop approach to solve our task: our multi-hop model, ImplicitDecomp, achieves an average F1of 51.7 over cross-modal questions, substantially outperforming a strong baseline that achieves 38.2 F1, but still lags significantly behind human performance, which is at 90.1 F1
研究の動機と目的
- テキスト、表、画像の間で推論を要する大規模かつ複雑な質問応答データセットの構築を目的とする。
- 視覚的情報を含む真のクロスモダリティ推論を要しない既存のデータセットのギャップを埋める。
- スケーラブルなフレームワークを用いて、多様でマルチホップかつマルチモーダルな質問を大規模に生成する。
- マルチモーダルでマルチホップな推論モデルの有効性を評価し、強力なベースラインおよび人間の性能と比較する。
- MMQAデータセットを用いて、Wikipediaを対象とするオープンドメインの質問応答を可能にする。
提案手法
- Wikipediaから収集した表を、共有エンティティを介して画像およびテキストパラグラフと関連づけ、統合的なマルチモーダルコンテキストを構築する。
- 論理演算(合成、比較、交差)を用いて単一モダリティの質問を組み合わせることで、複雑な質問を形式的言語で定式化する。
- クラウドソーシングを用いて、自動生成された不自然な日本語風の質問を自然な英語に再表現する。
- 明示的な質問分解を経ずにマルチモーダル質問を推論ステップに暗黙的に分解するモデル、ImplicitDecompを提案する。
- テキスト(RoBERTa)、表(Neural Module Networks)、画像(VQAスタイルのモデル)の各専用モデルを統合的なプログラマティックフレームワーク内で実行し、推論を実行する。
- 最終的な回答を生成するために、複数モダリティにまたがる推論を調整するプログラムを予測するように、モデルをエンドツーエンドで訓練する。
実験結果
リサーチクエスチョン
- RQ1スケーラブルなフレームワークは、テキスト、表、画像の間で共同推論を要する複雑でマルチホップかつマルチモーダルな質問を生成できるか?
- RQ2既存のモデルは人間の性能と比べて、クロスモダリティ推論タスクでどの程度失敗しているか?
- RQ3明示的な質問解析を経ずに、マルチモーダル質問の暗黙的分解が推論性能の向上に寄与できるか?
- RQ4単一ホップやモダリティ特化型ベースラインと比較して、統合的マルチモーダル推論モデルはどの程度効果的か?
- RQ5最先端のモデルと人間との間には、複雑なマルチモーダル質問応答タスクでどの程度の性能差があるか?
主な発見
- MMQAには29,918件の質問が含まれており、そのうち35.7%がクロスモダリティ推論を要しており、テキスト、表、画像の間で共同推論を要する最初の大規模データセットである。
- ImplicitDecompモデルはクロスモダリティ質問で51.7 F1を達成し、強力な単一ホップベースライン(38.2 F1)に対して13.5の絶対的F1向上を達成した。
- 人間の性能は90.1 F1に達しており、現在のモデルがまだ大きなギャップを有することを示している。
- 定性的な分析により、サンプル化された質問の92%が本物のマルチホップ推論を要していることが確認され、データセットの複雑さが妥当であることが裏付けられた。
- Wikipedia上でのオープンドメイン設定において、人間のF1は84.8に低下しており、完全なアクセスが与えられても依然として課題が大きいことが示された。
- モデルの1ホップ目でのF1は、合成、比較、交差演算の各操作で33.5から61.1の範囲にあり、最終的なF1は最大61.1に達しており、効果的な推論ステップの連結が可能であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。