[論文レビュー] DictBERT: Dictionary Description Knowledge Enhanced Language Model Pre-training via Contrastive Learning
DictBERTは対照的学習を用いて辞書知識を事前学習言語モデルに統合し、2つの新しい事前学習タスク—辞書エントリ予測とエントリ記述の識別—を導入することで表現学習を向上させる。ダウンストリームタスクにおける知識統合にエクストラホップ注意機構を備えたプラグイン型KBを用いることで、BERT-largeで+3.3%、GLUEで+0.9%のSOTA性能を達成する。
Although pre-trained language models (PLMs) have achieved state-of-the-art performance on various natural language processing (NLP) tasks, they are shown to be lacking in knowledge when dealing with knowledge driven tasks. Despite the many efforts made for injecting knowledge into PLMs, this problem remains open. To address the challenge, we propose extbf{DictBERT}, a novel approach that enhances PLMs with dictionary knowledge which is easier to acquire than knowledge graph (KG). During pre-training, we present two novel pre-training tasks to inject dictionary knowledge into PLMs via contrastive learning: extit{dictionary entry prediction} and extit{entry description discrimination}. In fine-tuning, we use the pre-trained DictBERT as a plugin knowledge base (KB) to retrieve implicit knowledge for identified entries in an input sequence, and infuse the retrieved knowledge into the input to enhance its representation via a novel extra-hop attention mechanism. We evaluate our approach on a variety of knowledge driven and language understanding tasks, including NER, relation extraction, CommonsenseQA, OpenBookQA and GLUE. Experimental results demonstrate that our model can significantly improve typical PLMs: it gains a substantial improvement of 0.5\%, 2.9\%, 9.0\%, 7.1\% and 3.3\% on BERT-large respectively, and is also effective on RoBERTa-large.
研究の動機と目的
- 知識集約的NLPタスクにおける事前学習言語モデル(PLM)の事実知識不足に対処すること。
- 複雑な知識グラフ(KG)やノイズの多いWikipediaソースではなく、容易に入手可能な辞書知識を用いることの妥当性と有効性を検討すること。
- PLMにおける知識統合と一般的な言語理解の両方を向上させる手法を開発すること。
- 産業的・学術的応用に容易に導入可能な実用的でスケーラブルなアプローチを設計すること。
提案手法
- 辞書エントリ予測(エントリをマスキングし、記述から予測)とエントリ記述の識別(同義語/対義語を正例/負例として用いた対照的学習)の2つの新しい事前学習タスクを提案。
- 対照的学習を用いて、意味的に類似した(正例)と異なる(負例)記述の区別により、エントリ表現のロバスト性を向上させる。
- 事前学習済みのDictBERTが微調整段階でエントリ情報を取得できるプラグイン型知識ベース機構を導入。
- 取得した辞書知識を入力表現に効果的に統合するため、エクストラホップ注意機構を採用。
- 連結、LWA(学習可能重み付き注意)、EHA(エクストラホップ注意)の複数の知識統合戦略をサポートし、柔軟な統合を可能にする。
- WikipediaやKGよりもアクセスが容易で知識密度の高い準構造的辞書データを活用し、実用的かつスケーラブルな展開を可能にする。
実験結果
リサーチクエスチョン
- RQ1辞書知識(外部知識の一種)が、知識集約的タスクにおける事前学習言語モデルの性能を顕著に向上させることができるか?
- RQ2記述からの辞書エントリ表現を学習する際に、対照的学習が有効であるか?
- RQ3辞書知識で拡張されたPLMが、知識特化タスクと一般的な言語理解タスクの両方の性能を向上させるか?
- RQ4知識グラフやWikipediaを用いる既存のK-PLMと比較して、DictBERTの性能はどのように異なるか?
- RQ5提案されたプラグインベースの知識統合機構は、事前学習モデルを直接微調整する手法を上回る性能を発揮するか?
主な発見
- DictBERTはCommonsenseQA、OpenBookQA、GLUEベンチマークにおいてBERT-largeで+3.3%の向上を達成し、既存のK-PLMを顕著に上回る。
- RoBERTa-largeでもGLUEベンチマークで+0.9%の向上を示し、特定のタスクに限定されない広範な適用可能性を示している。
- アブレーションスタディにより、辞書知識を用いた事前学習が不可欠であることが確認され、BERT-largeをプラグインとして用いる場合の向上は僅かにとどまる。
- 対照的学習(エントリ記述の識別)により平均で+0.4%の向上が得られ、表現学習におけるその有効性が裏付けられた。
- エクストラホップ注意機構(EHA)が最高の性能を示し、CSQAでは+6.1%、OBQAでは+7.7%の向上をBERT-largeに対して達成した。
- より大きな辞書(ケンブリッジ、オックスフォード、Wiktionaryからなる100万エントリ)を用いることで、平均で+0.23%の向上が得られ、スケーラビリティとロバスト性が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。