[論文レビュー] DKPLM: Decomposable Knowledge-enhanced Pre-trained Language Model for Natural Language Understanding
DKPLM は、ランタイムの知識エンコーダーを回避するため、知識注入を事前学習のみに分解する知識強化型事前学習言語モデルである。長尾エンティティ検出、疑似トークン表現、関係性知識復元を用いて、知識を効率的に注入し、ゼロショットプローブおよび知識認識タスクで最先端の性能を達成するとともに、従来のKEPLMより高速な推論を実現した。
Knowledge-Enhanced Pre-trained Language Models (KEPLMs) are pre-trained models with relation triples injecting from knowledge graphs to improve language understanding abilities. To guarantee effective knowledge injection, previous studies integrate models with knowledge encoders for representing knowledge retrieved from knowledge graphs. The operations for knowledge retrieval and encoding bring significant computational burdens, restricting the usage of such models in real-world applications that require high inference speed. In this paper, we propose a novel KEPLM named DKPLM that Decomposes Knowledge injection process of the Pre-trained Language Models in pre-training, fine-tuning and inference stages, which facilitates the applications of KEPLMs in real-world scenarios. Specifically, we first detect knowledge-aware long-tail entities as the target for knowledge injection, enhancing the KEPLMs' semantic understanding abilities and avoiding injecting redundant information. The embeddings of long-tail entities are replaced by "pseudo token representations" formed by relevant knowledge triples. We further design the relational knowledge decoding task for pre-training to force the models to truly understand the injected knowledge by relation triple reconstruction. Experiments show that our model outperforms other KEPLMs significantly over zero-shot knowledge probing tasks and multiple knowledge-aware language understanding tasks. We further show that DKPLM has a higher inference speed than other competing models due to the decomposing mechanism.
研究の動機と目的
- 従来のKEPLMにおけるファインチューニングおよび推論時の知識エンコーダーの高い計算コストを解消すること。
- 知識認識の長尾エンティティに焦点を当てることで、冗長な知識注入を低減すること。
- 下流タスク段階から知識注入を分離することで、効率的かつ高速な推論を可能にすること。
- 関係性復元の事前学習タスクを通じて、注入された知識の理解を向上させること。
- 推論時にモデルの複雑さを増加させることなく、知識プローブおよび下流NLUタスクで最先端の性能を達成すること。
提案手法
- コーパス頻度、KG近傍ノード数、意味的重要性に基づいて長尾エンティティを検出し、知識注入の優先順位を決定する。
- 検出された長尾エンティティの埋め込みを、共有PLMエンコーダーを介して知識トリプルから導出された「疑似トークン表現」に置き換える。
- エンティティトークンを1つのエンティティと関係述語を用いて再構成する、関係性知識復元の事前学習タスクを導入する。
- 知識注入を事前学習段階でのみ実施し、ファインチューニングおよび推論時に知識エンコーダーの必要性を排除する。
- 文脈表現および知識表現の両方のための共有PLMエンコーダーを用いることで、追加パラメータを最小限に抑える。
- エンティティ固有の知識注入と関係性に配慮した再構成の2段階の知識注入メカニズムを採用する。
実験結果
リサーチクエスチョン
- RQ1知識注入を推論およびファインチューニング段階から分離することで、推論速度の向上が図れるか?
- RQ2長尾エンティティに限定して知識注入を集中させることで、モデル性能の向上と冗長性の低減が達成されるか?
- RQ3関係性知識復元タスクが、注入された知識の理解を効果的に強化できるか?
- RQ4知識強化モデルが、パラメータの増加を最小限に抑え、かつランタイムの知識エンコーダーを搭載しない状態で最先端の性能を達成できるか?
- RQ5DKPLM の性能は、ゼロショットプローブおよび下流の知識認識タスクにおいて、強力なKEPLMベースラインと比較してどうなるか?
主な発見
- DKPLM は、4つのLAMAゼロショット知識プローブデータセットにおいて、最先端モデルと比較して平均トップ1正答率で+1.57%の向上を達成した。
- TACRED関係抽出ベンチマークでは、73.07%のF1スコアを達成し、KnowBERT や ERNIE-BERT を含むすべてのベースラインを上回った。
- DKPLM の推論時間(1.61秒)は、BERT(0.97秒)や RoBERTa(1.55秒)とほぼ同等であり、KEPLER(1.86秒)などのKEPLMモデルよりも顕著に高速であった。
- アブレーションスタディの結果、疑似トークン埋め込み機構を削除すると性能が著しく低下し、これが知識注入において極めて重要な役割を果たしていることが確認された。
- 高頻度エンティティやすべてのエンティティに知識を注入するのではなく、長尾エンティティに限定して注入することで、より優れた結果が得られ、注入エンティティ数を減らしても最適な性能が達成された。
- 注入知識トリプルの数を減らしてもモデルの性能が著しく低下せず、品質の優先がモデルの耐性向上に寄与することが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。