[論文レビュー] MuRAG: Multimodal Retrieval-Augmented Generator for Open Question Answering over Images and Text
MuRAGは、外部の非パrametricメモリから画像とテキストの両方を検索し、それらを統合して推論することで、オープンドメイン質問応答を向上させる、最初のマルチモーダル検索補強生成モデルを導入する。対照的および生成的損失を用いて、画像・テキスト混合およびテキストのみのコーパスで事前学習されたMuRAGは、WebQAおよびMultimodalQAの両ベンチマークで、ドレインファーやフル・ウィキ設定の両方において、既存モデルを10–20%の絶対的精度上回る最先端の性能を達成した。
While language Models store a massive amount of world knowledge implicitly in their parameters, even very large models often fail to encode information about rare entities and events, while incurring huge computational costs. Recently, retrieval-augmented models, such as REALM, RAG, and RETRO, have incorporated world knowledge into language generation by leveraging an external non-parametric index and have demonstrated impressive performance with constrained model sizes. However, these methods are restricted to retrieving only textual knowledge, neglecting the ubiquitous amount of knowledge in other modalities like images -- much of which contains information not covered by any text. To address this limitation, we propose the first Multimodal Retrieval-Augmented Transformer (MuRAG), which accesses an external non-parametric multimodal memory to augment language generation. MuRAG is pre-trained with a mixture of large-scale image-text and text-only corpora using a joint contrastive and generative loss. We perform experiments on two different datasets that require retrieving and reasoning over both images and text to answer a given query: WebQA, and MultimodalQA. Our results show that MuRAG achieves state-of-the-art accuracy, outperforming existing models by 10-20\% absolute on both datasets and under both distractor and full-wiki settings.
研究の動機と目的
- 既存の検索補強言語モデルがテキストのみに依存するという制限を解消し、画像にのみエンコードされた知識にアクセスできない問題に対処すること。
- 大規模コーパスからマルチモーダル知識(画像とテキスト)を統合的に検索し、補強する言語生成のための統一フレームワークを構築すること。
- 外部メモリから取得した視覚的および言語的証拠に基づいて、答えを明確に根拠づけることで、事実に基づくオープンエンド質問応答を改善すること。
- 多様な画像・テキストおよびテキストのみのデータセットを用いて、対照的および生成的損失を統合的に最適化することで、マルチモーダルモデルを事前学習し、検索および生成能力を強化すること。
提案手法
- MuRAGは、T5エンコーダとViTエンコーダを組み合わせ、画像・テキストペア、画像のみ、テキストのみの入力を共通のマルチモーダル表現空間に統合的に埋め込む。
- モデルは2段階のトレーニングパイプラインを採用:最初に小規模なバッチ内メモリを用いた効率的な事前学習を行い、次に大規模で静的にエンコードされ、インデックス化されたグローバルメモリを用いたファインチューニング。
- 事前学習段階では、関連するメモリエントリと関係のないエントリを区別するための対照的損失と、取得した知識を用いて正確な答えを生成するための生成的損失を同時に最適化する。
- 推論段階では、クエリの埋め込みを用いて外部メモリから関連する画像・テキストペアを検索し、クエリと取得したマルチモーダル証拠に基づいて答えを生成する。
- 検索プロセスは微分可能であり、エンド・トゥ・エンドでトレーニング可能であり、生成器と検索器が同時に最適化可能である。
- ファインチューニッシュ段階では、同じ対照的および生成的損失を用いて、質問とキャプション付き画像およびテキストスニペットのメモリからなる入力を使用して、下流のQAデータセットでモデルを最適化する。
実験結果
リサーチクエスチョン
- RQ1検索補強言語モデルは、マルチモーダル知識(画像とテキスト)を効果的に検索し、それらを統合して推論することで、オープンドメイン質問応答を改善できるか?
- RQ2マルチモーダル検索補強生成は、テキストのみの検索補強モデルと比較して、マルチモーダルQAベンチマークにおける精度で優れているか?
- RQ3事前学習におけるどの主要な構成要素が、マルチモーダル検索補強生成の性能向上に最も寄与しているか?
- RQ4なぜ画像ベースのクエリはテキストベースのクエリよりも著しく難しいのか?視覚的理解における主な失敗モードは何か?
主な発見
- MuRAGは、WebQAおよびMultimodalQAの両方で最先端の性能を達成し、ドレインファーやフル・ウィキ設定の両方において、既存のベースラインを10–20%の絶対的精度上回った。
- WebQAデータセットでは、ドレインファーセットでテキストクエリで80%、画像クエリで64%の精度を達成し、フル・ウィキ設定ではそれぞれ72%と54%を記録した。
- 画像ベースのクエリはテキストベースのクエリよりも著しく難易度が高く、主な失敗モードは数え間違い(52%)とオブジェクト認識エラー(29.4%)である。
- モデルはショートカット学習を示しており、誤った画像を検索しても、テキストの手がかりに基づいて正しく答えを生成する傾向があり、視覚的根拠よりもテキスト信号に依存していることが示された。
- 視覚的理解モジュールは依然としてボトル neck となっており、特に複雑なシーン、レアオブジェクト、または画像からの光学的文字認識(OCR)を要する質問では困難を示している。
- LAIONのような大規模な事前学習データを用いても、モデルは依然としてバイアスを内蔵しており、例として5%のエラーが性別認識の誤りに起因している。これは、マルチモーダルモデルにおけるより良いバイアス除去の必要性を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。