[論文レビュー] KVL-BERT: Knowledge Enhanced Visual-and-Linguistic BERT for Visual Commonsense Reasoning
本稿では、外部の常識的知識をConceptNetから統合することで視覚的常識的推論を向上させる、知識拡張型の視覚的・言語的BERTモデルKVL-BERTを提案する。相対的位置埋め込みとマスク自己注意メカニズムを用いることで、関連する知識を注入しながら文の構造と意味的整合性を保持し、VCRベンチマークにおいて75.1%の精度を達成し、最先端の性能を実現した。
Reasoning is a critical ability towards complete visual understanding. To develop machine with cognition-level visual understanding and reasoning abilities, the visual commonsense reasoning (VCR) task has been introduced. In VCR, given a challenging question about an image, a machine must answer correctly and then provide a rationale justifying its answer. The methods adopting the powerful BERT model as the backbone for learning joint representation of image content and natural language have shown promising improvements on VCR. However, none of the existing methods have utilized commonsense knowledge in visual commonsense reasoning, which we believe will be greatly helpful in this task. With the support of commonsense knowledge, complex questions even if the required information is not depicted in the image can be answered with cognitive reasoning. Therefore, we incorporate commonsense knowledge into the cross-modal BERT, and propose a novel Knowledge Enhanced Visual-and-Linguistic BERT (KVL-BERT for short) model. Besides taking visual and linguistic contents as input, external commonsense knowledge extracted from ConceptNet is integrated into the multi-layer Transformer. In order to reserve the structural information and semantic representation of the original sentence, we propose using relative position embedding and mask-self-attention to weaken the effect between the injected commonsense knowledge and other unrelated components in the input sequence. Compared to other task-specific models and general task-agnostic pre-training models, our KVL-BERT outperforms them by a large margin.
研究の動機と目的
- 物体検出や属性認識をはるかに超えた視覚的常識的タスクにおける機械の推論を向上させること。
- 既存のモデルが複雑な視覚的質問の推論に外部の常識的知識を活用していないという限界を解決すること。
- 外部の知識を注入する際、元の入力文の構造的・意味的整合性を保持すること。
- ノイズの導入や表現学習の乱れを引き起こさずに、ConceptNetからの常識的知識をマルチモodal BERTに統合する強力な手法を開発すること。
提案手法
- 入力テキストシーケンスにConceptNetの関連するエンティティを統合して、知識を豊かにした入力を生成すること。
- 知識統合後の元の文の構造的情報を維持するために、相対的位置埋め込みを適用すること。
- 可視行列を用いて注意を制限し、注入された知識が関連するエンティティトークンにのみ影響を与えるようにすることで、関係のないコンponentsへの干渉を低減すること。
- マスク自己注意を用いて、注意計算中に元の入力の意味的および視覚的表現を保持すること。
- 豊かにされたトークン埋め込み、位置埋め込み、セグメント埋め込み、視覚的特徴、および可視行列を事前学習済みVL-BERTに供給し、共同学習および推論を実行すること。
- 2つのバリエーションを評価:1つは知識サブグラフをtransEで埋め込むもの、もう1つは注入済みトークンと元のトークンの間で位置埋め込みを共有して、構造的整合性の維持の有効性をアブレーションすること。
実験結果
リサーチクエスチョン
- RQ1ConceptNetからの外部の常識的知識は、視覚的常識的推論タスクのパフォーマンスを顕著に向上させることができるか?
- RQ2外部の知識を注入する際、元の入力の意味的および構造的表現が破壊されない方法で、マルチモダルBERTモデルに統合できるか?
- RQ3推論パフォーマンスを最大化するために、1トークンあたりに注入すべき常識的エンティティの最適数は何か?
- RQ4相対的位置埋め込みとマスク自己注意を用いることで、標準的な自己注意メカニズムと比較して推論精度が向上するか?
- RQ5提案されたKVL-BERTモデルは、VCRベンチマークにおいて、タスク固有およびタスクに依存しない事前学習済みマルチモダルモデルと比較してどのように差をつけるか?
主な発見
- KVL-BERTはQA→Rサブタスクで75.1%の精度を達成し、比較されたすべてのタスク固有およびタスクに依存しないモデルを上回った。
- Q→Aでは74.0%、Q→ARでは55.6%の精度を達成し、VCRのすべてのサブタスクで優れたパフォーマンスを示した。
- 変種I(transEを用いて知識サブグラフを埋め込む)は、KVL-BERTより2.3~4.0ポイント低い性能を示し、直接的な注入がより効果的であることを示した。
- 変種II(注入済みトークンと元のトークンの間で位置埋め込みを共有)は、注入する常識的エンティティを増やすほど性能が低下したが、KVL-BERTは安定性を維持した。
- アブレーションスタディにより、相対的位置埋め込みとマスク自己注意が知識のノイズを顕著に低減し、推論精度を向上させることを確認した。
- 1トークンあたりに注入すべき常識的エンティティの最適数は2つであり、3つに増やすと性能が低下した。これは、知識カバレッジとノイズのトレードオフがあることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。