[論文レビュー] Expanding the Vocabulary of BERT for Knowledge Base Construction
本論文では、トークン再編碼とタスク固有の再事前学習を用いて意味的埋め込みを保持しつつ、マルチトークンエンティティを用いてBERTの語彙を拡張する方法であるVocabulary Expandable BERT (VE-BERT)を提案する。この手法は、130MパラメータのBERT-baseモデルのみを用いて、検証セットでF1スコア0.362、隠しテストセットでF1スコア0.323を達成し、同じ制約下でGPT-3(175Bパラメータ)を上回る性能を発揮した。
Knowledge base construction entails acquiring structured information to create a knowledge base of factual and relational data, facilitating question answering, information retrieval, and semantic understanding. The challenge called "Knowledge Base Construction from Pretrained Language Models" at International Semantic Web Conference 2023 defines tasks focused on constructing knowledge base using language model. Our focus was on Track 1 of the challenge, where the parameters are constrained to a maximum of 1 billion, and the inclusion of entity descriptions within the prompt is prohibited. Although the masked language model offers sufficient flexibility to extend its vocabulary, it is not inherently designed for multi-token prediction. To address this, we present Vocabulary Expandable BERT for knowledge base construction, which expand the language model's vocabulary while preserving semantic embeddings for newly added words. We adopt task-specific re-pre-training on masked language model to further enhance the language model. Through experimentation, the results show the effectiveness of our approaches. Our framework achieves F1 score of 0.323 on the hidden test set and 0.362 on the validation set, both data set is provided by the challenge. Notably, our framework adopts a lightweight language model (BERT-base, 0.13 billion parameters) and surpasses the model using prompts directly on large language model (Chatgpt-3, 175 billion parameters). Besides, Token-Recode achieves comparable performances as Re-pretrain. This research advances language understanding models by enabling the direct embedding of multi-token entities, signifying a substantial step forward in link prediction task in knowledge graph and metadata completion in data management.
研究の動機と目的
- マスクド言語モデルを用いた知識ベース構築におけるマルチトークンエンティティの予測という課題に対処すること。
- 標準BERTの固定語彙による制限を克服し、マルチトークンエンティティの予測に適した語彙を提供すること。
- ランダム初期化に依存せずに、新たに追加されたマルチトークンエンティティの効果的で意味的な表現を可能にすること。
- パラメータ制約のある軽量言語モデルを用いて、リンク予測および知識グラフ補完を改善すること。
- タスク固有の再事前学習とトークン再編碼技術が、LM-KBC 2023チャレンジにおいて顕著な性能向上をもたらすことを示すこと。
提案手法
- マルチトークンエンティティを語彙内での単一トークンとして統合できるよう、BERTの入力および出力埋め込み層を変更する。
- 構成トークンの表現を活用して、新規マルチトークンエンティティの意味的埋め込みを生成するトークン再編碼(TR)手法を導入する。
- チャレンジで定義された述語を用いてWikiDataにクエリを発行し、カスタムエンティティ語彙を構築する。
- 語彙に含まれる高頻度エンティティを含むフィルタリング済みWikipedia文を用いて、タスク固有の再事前学習を実施する。
- LM-KBC 2023チャレンジのトレーニングセットを用いて、エンドツーエンドの知識ベース構築を目的としたファインチューニングを実行する。
- 検証セットにおける関係タイプごとの予測性能を最適化するため、しきい値ベースのエンティティ分類戦略を用いる。
実験結果
リサーチクエスチョン
- RQ11Bパラメータ制約下で、軽量なBERTモデルが知識ベース構築においてマルチトークンエンティティを効果的に予測できるか?
- RQ2ランダム初期化と比較して、トークン再編碼手法が新規に追加されたマルチトークンエンティティに対してより優れた初期意味的埋め込みを提供するか?
- RQ3Wikipedia文を用いたタスク固有の再事前学習は、知識ベース構築の性能をどの程度向上させるか?
- RQ4トークン再編碼と再事前学習の組み合わせは、個別に適用した場合と比較して、F1スコアの向上にどの程度寄与するか?
- RQ5VE-BERTは、顕著に少ないパラメータ数であるにもかかわらず、GPT-3などの大規模言語モデルを上回る性能を発揮する理由は何か?
主な発見
- VE-BERTは、検証セットでF1スコア0.362、隠しテストセットでF1スコア0.323を達成し、同じ制約下でGPT-3(175Bパラメータ)を上回った。
- トークン再編碼手法は、追加の学習を要せずとも再事前学習と同等の性能を達成した。これは、高品質な埋め込みを初期化する有効性を示している。
- Wikipedia文を用いた再事前学習により、知識ベース構築の性能が約2パーセンテージポイント向上した。
- トークン再編碼と再事前学習を併用した場合、個別に得られた利益の合計を上回る約5パーセンテージポイントの向上が得られ、相乗効果が示された。
- VE-BERTは、'CompoundHasParts' や 'CountryHasOfficialLanguage' のような一般的な知識述語では優れた性能を発揮したが、'PersonHasSpouse' のような名前ベースの述語では、語彙内でのエンティティ頻度が低いために苦戦した。
- モデルの性能は、トレーニング語彙内での名前エンティティの出現頻度が低いために制限を受けており、希少エンティティタイプのカバー範囲の拡大が今後の課題である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。