Skip to main content
QUICK REVIEW

[論文レビュー] Prix-LM: Pretraining for Multilingual Knowledge Base Construction

Wenxuan Zhou, Fangyu Liu|arXiv (Cornell University)|Oct 16, 2021
Topic Modeling被引用数 4
ひとこと要約

Prix-LM は、多言語知識ベースを用いて単語ごとの三項節と多言語間リンクを用いて事実知識を多言語間で統一的に学習する多言語言語モデルである。XLM-R を因果的言語モデルの目的関数で微調整することにより、17 言語で多言語知識ベース補完、エンティティリンク、語彙誘導のタスクにおいて最先端の性能を達成し、効果的な多言語間知識の転送と拡張を示している。

ABSTRACT

Knowledge bases (KBs) contain plenty of structured world and commonsense knowledge. As such, they often complement distributional text-based information and facilitate various downstream tasks. Since their manual construction is resource- and time-intensive, recent efforts have tried leveraging large pretrained language models (PLMs) to generate additional monolingual knowledge facts for KBs. However, such methods have not been attempted for building and enriching multilingual KBs. Besides wider application, such multilingual KBs can provide richer combined knowledge than monolingual (e.g., English) KBs. Knowledge expressed in different languages may be complementary and unequally distributed: this implies that the knowledge available in high-resource languages can be transferred to low-resource ones. To achieve this, it is crucial to represent multilingual knowledge in a shared/unified space. To this end, we propose a unified representation model, Prix-LM, for multilingual KB construction and completion. We leverage two types of knowledge, monolingual triples and cross-lingual links, extracted from existing multilingual KBs, and tune a multilingual language encoder XLM-R via a causal language modeling objective. Prix-LM integrates useful multilingual and KB-based factual knowledge into a single model. Experiments on standard entity-related tasks, such as link prediction in multiple languages, cross-lingual entity linking and bilingual lexicon induction, demonstrate its effectiveness, with gains reported over strong task-specialised baselines.

研究の動機と目的

  • 複数の言語からの構造的知識を統合する多言語事前学習手法の不足に取り組むこと。
  • 高リソース言語の KB から低リソース言語の KB へ補完的知識を転送できるように、共通の表現空間に多言語事実をアライメントすること。
  • 統一的で知識を統合した言語モデルを用いて、リンク予測、多言語間エンティティリンク、二国語語彙誘導などの多言語下流タスクを改善すること。
  • mBERT や XLM-R などの市販の多言語モデルが、特に低リソース言語において知識集約的タスクで性能を発揮できないという限界を克服すること。
  • 構造的知識を事前学習目的に直接組み込むことで、単語ごとの知識探査と多言語 KB 補完のギャップを埋めること。

提案手法

  • 因果的言語モデルの目的関数を用いて、多言語 DBpedia を用いて多言語言語モデルである Prix-LM を事前学習する。
  • 単語ごとの知識三項節(例:{イギリス, 首都, ロンドン})をトークン列(例:"イギリスは首都である")として表現し、モデルが事実関係を学習できるようにする。
  • 多言語間リンク(例:英語と日本語のエンティティペア)を列として表現(例:英語で "The capital of England is London"、日本語で "イングランドの首都はロンドンです")し、多言語間のアライメントを可能にする。
  • これらの構造的列を用いて XLM-R を因果的言語モデルの目的関数で微調整し、モデルのパラメータに事実知識を統合する。
  • 得られたモデルを用いて、単語ごとの事実と多言語間同等性を両方ともエンコードする文脈的表現を生成する。
  • 自己回帰的デコードを用いて効率的な推論を支援し、多言語 KB 補完タスクにおけるゼロショットおよびフェイワショット応用を可能にする。

実験結果

リサーチクエスチョン

  • RQ1多言語知識ベースからの構造的知識を統合・伝達できるように、多言語言語モデルを効果的に事前学習できるか?
  • RQ2単語ごとの三項節と多言語間リンクを統合することで、多言語 KB 補完タスクの性能がどの程度向上するか?
  • RQ3Prix-LM は高リソース言語から低リソース言語へ知識を転送でき、不足しているリソースの KB を豊かにできるか?
  • RQ4Prix-LM は、タスク固有のベースラインおよび多言語ベースラインと比較して、多言語間エンティティリンクおよび二国語語彙誘導タスクでどの程度優れているか?
  • RQ5構造的知識を用いた事前学習により、モデルのゼロショットまたはフェイワショットの多言語間知識探査能力が向上するか?

主な発見

  • Prix-LM は、17 言語で強力なベースラインを上回る一貫した顕著な向上を達成し、リンク予測タスクで Hits@10 に平均 6.8%、Hits@1 に 5.2% の改善を示した。
  • 多言語間エンティティリンクでは、スワヒリ語やタイ語などの低リソース言語において、mBERT や XLM-R を最大 8.3% 上回った Hits@10 の性能を達成した。
  • 二国語語彙誘導では、BabelNet ベンチマークの 10 組の言語ペアで、最良のベースラインと比較して F1 スコアで 7.1% の向上を達成した。
  • ゼロショット一般化性能が強く、リンク予測の未学習言語ペアで Hits@1 が 72.4% を達成し、効果的な多言語間知識転送を示した。
  • プロンプトベースの知識探査タスクにおいても、標準的な多言語モデルと比較して、事実知識の保持能力が顕著に向上した。
  • アブレーションスタディにより、単語ごとの三項節と多言語間リンクの両方が独立的かつ相乗的に性能向上に寄与しており、特に低リソース言語において多言語間リンクが極めて重要であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。