[論文レビュー] Knowledge Enhanced Contextual Word Representations
この論文では、複数の知識ベース(KB)である WordNet や Wikipedia からの構造化された知識を、知識注意と再文脈化(KAR)機構を用いて統合することで、BERT の文脈的単語表現を向上させる手法 KnowBert を提案する。未ラベルのテキスト上でエンティティリンクャーと言語モデルを共同で訓練することで、KnowBert は事実の再検索率を向上させ、パープレキシティを低減し、関係抽出、エンティティタイプ指定、語義の意味あいまいさ解消といった下流タスクで最先端の性能を達成し、いくつかのベンチマークで BERT$_{\text{LARGE}}$ を上回る。
Contextual word representations, typically trained on unstructured, unlabeled text, do not contain any explicit grounding to real world entities and are often unable to remember facts about those entities. We propose a general method to embed multiple knowledge bases (KBs) into large scale models, and thereby enhance their representations with structured, human-curated knowledge. For each KB, we first use an integrated entity linker to retrieve relevant entity embeddings, then update contextual word representations via a form of word-to-entity attention. In contrast to previous approaches, the entity linkers and self-supervised language modeling objective are jointly trained end-to-end in a multitask setting that combines a small amount of entity linking supervision with a large amount of raw text. After integrating WordNet and a subset of Wikipedia into BERT, the knowledge enhanced BERT (KnowBert) demonstrates improved perplexity, ability to recall facts as measured in a probing task and downstream performance on relationship extraction, entity typing, and word sense disambiguation. KnowBert's runtime is comparable to BERT's and it scales to large KBs.
研究の動機と目的
- 文脈的単語表現が現実世界のエンティティからの事実的知識を保持する能力に限界があることに対処すること。
- タスク固有の微調整を必要とせず、複数の知識ベースを大規模な事前学習済み言語モデルに統合する汎用的でスケーラブルな手法を開発すること。
- 構造化された知識に文脈表現を根拠づけることで、マスクされた言語モデルのパープレキシティと事実の再検索率を向上させること。
- 関係抽出や語義の意味あいまいさ解消のような、事実的推論を要する下流 NLP タスクで最先端の性能を達成すること。
- 知識統合を軽量なモジュールとして挿入することで、計算効率を維持し、既存の BERT ベースのシステムとの互換性を保つこと。
提案手法
- BERT の2つの層の間に、外部 KB からの知識を統合するための知識注意と再文脈化(KAR)モジュールを導入する。
- 統合されたエンティティリンクャーを用いて、入力テキスト内のスパンから KB(例:WordNet や Wikipedia)のエンティティ埋め込みを取得する。
- 単語からエンティティへの注意を適用して、取得したエンティティ埋め込みを用いて文脈的単語表現を再文脈化し、長距離相互作用を可能にする。
- 自己教師付き言語モデル学習と少量のエンティティリンクィングの監視信号を用いたマルチタスク目的関数を用いて、未ラベルのテキスト上でエンティティリンクャーと言語モデルを共同で事前学習する。
- 関係抽出のための特別なトークン [E1]、[/E1]、[E2]、[/E2] を、主語と目的語のスパンをマークするために使用する。エンティティタイプ指定のためには [E]、[/E] を使用する。
- エンティティ埋め込みに TuckER を用い、最小限の構造的要件でさまざまな KB 形式との互換性を確保する。
実験結果
リサーチクエスチョン
- RQ1複数の KB からの構造化された知識を統合することで、事前学習モデルにおける文脈的単語表現の事実の再検索率と品質が向上するか。
- RQ2未ラベルのテキスト上でエンティティリンクィングと言語モデルをエンドツーエンドで共同訓練することで、一般化性能と事実的知識統合が向上するか。
- RQ3BERT に軽量でモジュラーな知識挿入を施すことで、推論速度を損なわずに下流 NLP タスクの性能が向上するか。
- RQ4知的評価と外部評価の両方において、強化されたモデルは BERT$_{\text{LARGE}}$ や他の知識拡張モデルと比較してどの程度の性能を示すか。
- RQ5この手法は、ConceptNet やドメイン固有の KB といった多様な知識ソースをサポートできるほど、大規模 KB に対してもスケーラブルか。
主な発見
- KnowBert-W+W は WiC データセットでテスト F1 スコア 76.1 を達成し、BERT$_{\text{LARGE}}$ より 1.4% 高く、人間の性能との差を 13.3% 減少させた。
- TACRED 関係抽出タスクでは、KnowBert-W+W が F1 70.9% を達成し、BERT$_{\text{LARGE}}$ より 1.4% 高く、ERNIE よりも 3.5% 高かった。
- エンティティタイプ指定では、KnowBert-W+W が F1 76.1 を達成し、ERNIE より 0.6% 高く、BERT$_{\text{BASE}}$ よりも 2.5% 高かった。
- マスクされた言語モデルのパープレキシティは BERT$_{\text{BASE}}$ よりも低く、知識統合後の言語モデル品質の向上を示した。
- より小さい BERT$_{\text{BASE}}$ アーキテクチャを使用しているにもかかわらず、KnowBert-W+W は事実の再検索率とイントラクティブプローブタスクで BERT$_{\text{LARGE}}$ を上回った。
- KAR モジュールは最小限の計算オーバーヘッドしか追加せず、BERT と同等の実行時間維持が可能であり、下流アプリケーションでの BERT から KnowBert へのシームレスな置き換えを可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。