Skip to main content
QUICK REVIEW

[論文レビュー] Knowledgeable or Educated Guess? Revisiting Language Models as Knowledge Bases

Boxi Cao, Hongyu Lin|arXiv (Cornell University)|Jun 17, 2021
Topic Modeling参考文献 40被引用数 9
ひとこと要約

この論文は、BERTのような事前学習済みマスキング言語モデル(MLM)が事実知識ベースとして信頼できるかどうかを調査する。3つの知識抽出パラダイム—プロンプトベース、ケースベース、コンテキストベース—の厳密な分析を通じて、高いパフォーマンスは真の知識抽出によるのではなく、プロンプトバイアス、エンティティタイプのガイダンス、外部コンテキスト内の答えの漏洩(明示的または暗黙的)によるものであることが明らかになった。本研究は、MLMが信頼できる知識ソースであるという従来の結論に疑問を呈する。

ABSTRACT

Previous literatures show that pre-trained masked language models (MLMs) such as BERT can achieve competitive factual knowledge extraction performance on some datasets, indicating that MLMs can potentially be a reliable knowledge source. In this paper, we conduct a rigorous study to explore the underlying predicting mechanisms of MLMs over different extraction paradigms. By investigating the behaviors of MLMs, we find that previous decent performance mainly owes to the biased prompts which overfit dataset artifacts. Furthermore, incorporating illustrative cases and external contexts improve knowledge prediction mainly due to entity type guidance and golden answer leakage. Our findings shed light on the underlying predicting mechanisms of MLMs, and strongly question the previous conclusion that current MLMs can potentially serve as reliable factual knowledge bases.

研究の動機と目的

  • マスキング言語モデル(MLM)であるBERTが、信頼できる事実知識ベースとして機能できるかどうかを厳密に評価すること。
  • プロンプトベース、ケースベース、コンテキストベースの3つの代表的な知識抽出パラダイムにおけるパフォーマンスを駆動する背後要因を調査すること。
  • 高いパフォーマンスが真の知識アクセスによるものか、それともプロンプトバイアス、エンティティタイプのガイダンス、答えの漏洩といったアーティファクトによるものかを特定すること。
  • MLMが信頼できる事実知識を備えていると仮定する従来のベンチマークと評価手法の妥当性に疑問を呈すること。

提案手法

  • BERT-largeおよびRoBERTa-largeを用いて、プロンプトベース抽出、ケースベース類似性、コンテキストベース推論の3つの知識抽出パラダイムを体系的に分析した。
  • Wikidataの分類体系を用いて関係のオブジェクトタイプを誘導する新しいアルゴリズムを提案し、ケースベースパラダイムにおけるタイプガイダンスの役割を評価した。
  • ゴールデン答えをコンテキスト内でマスキングすることで、明示的および暗黙的答えの漏洩を区別するための制御された設定でパフォーマンスを評価した。
  • マスキングされた答えが残りのコンテキストから再構築可能かどうかに基づいてコンテキストをグループ化し、暗黙的答えの漏洩の影響を分離した。
  • LAMAなどの標準ベンチマークを用いて、正確度とF1スコアといった定量的指標を用い、パラダイムおよび条件ごとのパフォーマンスを比較した。
  • 予測パフォーマンスに及ぼすプロンプト、例示ケース、外部コンテキストの寄与を分離するためにアブレーションスタディを実施した。

実験結果

リサーチクエスチョン

  • RQ1MLMからのプロンプトベース知識抽出は、内部の事実知識よりも、プロンプト設計にどれほど依存しているか?
  • RQ2例示ケースはMLMの予測にどのように影響するか—正確な答え選択の向上なのか、それとも単にエンティティタイプ認識のガイダンスにとどまるのか?
  • RQ3コンテキストベース推論における外部コンテキストの真の貢献は何か—答えの漏洩か、コンテキスト推論か?
  • RQ4外部コンテキストによるパフォーマンス向上は、明示的な答えの存在か、それとも暗黙的答え再構築によるものか?
  • RQ5現在の評価ベンチマークは、真の知識抽出を反映しているのか、それともデータセット固有のバイアスといったアーティファクトを反映しているのか?

主な発見

  • プロンプトベース抽出のパフォーマンスは、プロンプト構造に著しくバイアスがかかる。予測は事実の正確性よりもプロンプトの語り方と相関しており、一般化能力が低いことが示された。
  • 例示ケースは、主にエンティティタイプのガイダンスを提供することでパフォーマンスを向上させるが、同じタイプカテゴリー内での正確な答え選択を強化するわけではない。
  • 外部コンテキストは、主に答えの漏洩(明示的または暗黙的)によってパフォーマンスを著しく向上させる。
  • ゴールデン答えがコンテキスト内でマスキングされても、残りのコンテキストから答えを再構築できる場合、パフォーマンスは依然として高いままとなり、暗黙的答えの漏洩の役割が確認された。
  • コンテキストベース推論によるパフォーマンス向上は、コンテキストの推論ではなく、十分な答え関連の証拠(明示的または暗黙的)の存在によるものである。
  • 全体的な発見は、MLMが信頼できる知識ベースとして機能するとする従来の結論の妥当性を疑問視するものであり、現在の成功は強力な知識アクセスではなく、データセットのアーティファクトによるものであることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。