Skip to main content
QUICK REVIEW

[論文レビュー] Language Models as Knowledge Bases: On Entity Representations, Storage Capacity, and Paraphrased Queries

Benjamin Heinzerling, Kentaro Inui|arXiv (Cornell University)|Aug 20, 2020
Topic Modeling参考文献 58被引用数 11
ひとこと要約

本稿では、大規模言語モデル(LM)をスケーラブルで自然言語アクセス可能な知識ベースとして使用する可能性を検討し、3種類のエンティティ表現手法—記号的、表面形式、連続的埋め込み—を提案することで、数百万のエンティティと事実の保存を可能にした。実験の結果、LMは最大500万件のWikidata三項対を79%の正確性で記憶可能であり、ゼロショットおよび少数ショットの設定下でも、言い換えられたクエリに対して効果的に知識を転送できることが示された。これにより、LMは自然言語クエリに対応する構造的知識ベースの代替手段として実用的であることが立証された。

ABSTRACT

Pretrained language models have been suggested as a possible alternative or complement to structured knowledge bases. However, this emerging LM-as-KB paradigm has so far only been considered in a very limited setting, which only allows handling 21k entities whose single-token name is found in common LM vocabularies. Furthermore, the main benefit of this paradigm, namely querying the KB using a variety of natural language paraphrases, is underexplored so far. Here, we formulate two basic requirements for treating LMs as KBs: (i) the ability to store a large number facts involving a large number of entities and (ii) the ability to query stored facts. We explore three entity representations that allow LMs to represent millions of entities and present a detailed case study on paraphrased querying of world knowledge in LMs, thereby providing a proof-of-concept that language models can indeed serve as knowledge bases.

研究の動機と目的

  • 標準的な語彙制限のため、既存のLM-as-KB手法が約21,000エンティティしか処理できないという制限を克服すること。
  • 数百万のエンティティにスケーリング可能なLMを実現するための3つのエンティティ表現手法の評価と比較。
  • 合成データを用いて、LMの世界知識事実の保存容量を実証的に推定すること。
  • 言い換えられたクエリにおける知識抽出の耐性を調査し、ゼロショットおよび少数ショットの転移性能を評価すること。
  • LMが機能的で自然言語アクセス可能な知識ベースとして実現可能であることを実証する。

提案手法

  • 3種類のエンティティ表現戦略を提案:記号的(LM語彙の拡張)、表面形式(サブワード符号化された名前とシーケンスデコーダー)、連続的(事前学習済み特徴からの学習済み埋め込み)。
  • 合成関係三項対(主語-述語-目的語)を用いて、LMが主語と述語を入力として与えられた場合に目的語トークンを予測するように訓練し、知識ベースの保存を模擬した。
  • ベースとなるLMにRoBERTa-baseを採用し、サイズを変化させた合成知識グラフで微調整を行い、記憶精度を測定した。
  • 特徴固有のオートエンコーダーを用いて、Wikidataの特徴(テキスト、数量、タイプ)から密度の高いエンティティ埋め込みを学習し、64次元のベクトルに圧縮した。
  • ゼロショットおよび少数ショットの転移を評価するため、言い換えられたクエリを生成し、クエリ変種の微調整なしまたはわずかな微調整ありの状況でモデルの性能を測定した。
  • コサイン類似度損失を用いて、単位超球面上でエンティティ埋め込みを訓練し、安定した最適化とより良い記憶性能を確保した。

実験結果

リサーチクエスチョン

  • RQ1言語モデルは、標準語彙制限を超えて数百万のエンティティを含む事実を効果的に記憶・抽出できるか?
  • RQ2現在のLMアーキテクチャにおける事実の保存容量の上限は何か? また、モデルサイズに応じてどのようにスケーリングされるか?
  • RQ3LMは、微調整なし(ゼロショット)および最小限の微調整(少数ショット)の両方で、言い換えられたクエリにどの程度一般化できるか?
  • RQ4異なるエンティティ表現手法は、精度、効率、データ要件の観点からどのようにトレードオフを形成するか?
  • RQ5知識グラフの構造的性質(例:Erdos-Renyi型対比 Barabasi-Albert型)が、LMにおける記憶可能性に影響を与えるか?

主な発見

  • 1億2500万パラメータのTransformerモデルは、100万件のWikidata三項対を95%の正確性で記憶可能であり、500万件を79%の正確性で記憶可能である。これは、より大きなモデルへのスケーリングが可能であることを示唆している。
  • 記号的エンティティ表現は、最高の記憶正確性を達成するが、エンティティリンク済みデータを必要とし、計算コストが高くなる。
  • 表面形式表現は、計算が効率よく、エンティティリンク済みデータを不要としているが、長めのエンティティ名では正確性が低下する。
  • 事前学習済み特徴エンコーダーと固定埋め込みを組み合わせた連続的埋め込みは、効率性と正確性のバランスが取れており、優れた性能を示す。
  • 言い換えられたクエリへのゼロショット転移は、類似度の高い変種に対して効果的であるが、少数ショット微調整(5~100例)により、類似度が低いクエリに対しても強固な抽出が可能になる。
  • 同じパrameter予算下でも、スケールフリー(Barabasi-Albert)トポロジーの知識グラフは、一様(Erdos-Renyi)トポロジーのグラフよりも記憶が困難である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。