[論文レビュー] Vokenization: Improving Language Understanding with Contextualized, Visual-Grounded Supervision
本論文は、画像キャプションデータセットで訓練されたvokenizerを用いて、言語トークンの文脈に応じた視覚的埋め込み(voken)を生成するvokenizationという手法を紹介する。大規模な言語コーパスにこれらのvokenを適用することで、著者らはGLUE、SQuAD、SWAGベンチマークにおいてBERTベースのモデルの性能を向上させ、視覚的根拠付けがテキスト中心のタスクでさえも一般言語理解を向上させることを示した。
Humans learn language by listening, speaking, writing, reading, and also, via interaction with the multimodal real world. Existing language pre-training frameworks show the effectiveness of text-only self-supervision while we explore the idea of a visually-supervised language model in this paper. We find that the main reason hindering this exploration is the large divergence in magnitude and distributions between the visually-grounded language datasets and pure-language corpora. Therefore, we develop a technique named "vokenization" that extrapolates multimodal alignments to language-only data by contextually mapping language tokens to their related images (which we call "vokens"). The "vokenizer" is trained on relatively small image captioning datasets and we then apply it to generate vokens for large language corpora. Trained with these contextually generated vokens, our visually-supervised language models show consistent improvements over self-supervised alternatives on multiple pure-language tasks such as GLUE, SQuAD, and SWAG. Code and pre-trained models publicly available at https://github.com/airsplay/vokenization
研究の動機と目的
- 既存の言語事前学習フレームワークがテキストベースの自己教師あり学習に依存するため、視覚的根拠付けが欠如しているという問題に取り組む。
- 小規模な視覚的根拠付きデータセットと大規模言語コーパスの間のデータ分布のギャップを克服する。
- 言語のみのデータに対して文脈的に関連するvokenを生成することで、一般NLPタスクにおける視覚的教師あり言語モデリングを可能にする。
- 文脈的なトークン-画像マッチングを通じて、視覚的文脈を活用し、視覚的でない語や抽象語に対しても言語表現学習を向上させる。
提案手法
- MS COCO や Visual Genome などの小規模な画像キャプションデータセットで、文脈的トークン-画像マッチングモデルを用いてvokenizerを訓練する。
- 訓練済みのvokenizerを用いて、英語Wikipediaなどの大規模なテキストコーパス内のトークンに対して文脈的に関連する画像(voken)を検索する。
- BERT風のモデルにおいて、マスク言語モデリングとvoken分類の両方を同時に最適化する補助的目的としてvoken予測を統合する。
- 文の文脈を活用して、'by' や 'angry' のような抽象的または非具体的な語の意味を明確にし、対応を改善する。
- CNN/Daily Mail や Wiki103 などの多様なNLPデータセットにvokenizationパイプラインを適用し、トランスファーラーニングを可能にする。
- Jensen–Shannonの差分を用いて、視覚的根拠付きコーパスと一般言語コーパスの間の分布的差異を定量化し、vokenizationの必要性を裏付ける。
実験結果
リサーチクエスチョン
- RQ1画像キャプションデータからの視覚的根拠付けは、完全にテキスト中心のNLPタスクにおける言語理解を向上させることができるか?
- RQ2小規模な視覚的根拠付きデータセットと大規模言語コーパスの間の分布的・スケール的ギャップをどのように埋め合わせることができるか?
- RQ3文脈的トークン-画像マッチングは、視覚的でない、あるいは抽象的な語に対しても視覚的根拠付けを向上させることができるか?
- RQ4生成されたvokenを監視信号として組み込むことで、多様なNLPベンチマークで一貫した性能向上が得られるか?
- RQ5vokenはRoBERTaのような異なる言語モデルアーキテクチャ間でもどれほど転送可能か?
主な発見
- 提案されたvokenization手法は、GLUEベンチマークにおいて自己教師ありBERTを常に上回り、個々のタスクで0.8~2.1ポイントの向上を達成した。
- SQuADでは、視覚的教師ありモデルが自己教師ありベースラインよりF1スコアで1.2ポイント向上し、読解力の向上を示した。
- SWAGでは、正答率が1.5ポイント向上し、視覚的根拠付けによって共通認識の推論能力が向上したことを示した。
- 可視化により、抽象的語や機能語に対してもvokenizerが文脈的に関連するvokenを効果的に生成していることが確認された。
- 転移実験では、vokenがRoBERTaでも性能向上をもたらし、この手法がBERTに限らず一般化可能であることを確認した。
- 英語Wikipediaにおける根拠付け率はたったの27.7%であったが、それでもvokenizationは顕著な向上をもたらした。これは、文脈に応じたvokenが、根拠のないテキストに効果的に視覚的知識を組み込める可能性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。