Skip to main content
QUICK REVIEW

[論文レビュー] Factual Probing Is [MASK]: Learning vs. Learning to Recall

Zexuan Zhong, Dan Friedman|arXiv (Cornell University)|Apr 12, 2021
Topic Modeling参考文献 28被引用数 22
ひとこと要約

本論文では、離散的トークンではなく埋め込み空間内での探索により、事実探査の精度を向上させる連続最適化手法であるOptiPromptを紹介する。LAMAベンチマークにおいて6.4%の精度向上を達成し、プロンプト探索手法がトレーニングデータ内の統計的規則性を利用していることが明らかになった。これは、探査結果がモデル内部の知識のみを反映しているという仮定に疑問を呈するものである。

ABSTRACT

Petroni et al. (2019) demonstrated that it is possible to retrieve world facts from a pre-trained language model by expressing them as cloze-style prompts and interpret the model's prediction accuracy as a lower bound on the amount of factual information it encodes. Subsequent work has attempted to tighten the estimate by searching for better prompts, using a disjoint set of facts as training data. In this work, we make two complementary contributions to better understand these factual probing techniques. First, we propose OptiPrompt, a novel and efficient method which directly optimizes in continuous embedding space. We find this simple method is able to predict an additional 6.4% of facts in the LAMA benchmark. Second, we raise a more important question: Can we really interpret these probing results as a lower bound? Is it possible that these prompt-search methods learn from the training data too? We find, somewhat surprisingly, that the training data used by these methods contains certain regularities of the underlying fact distribution, and all the existing prompt methods, including ours, are able to exploit them for better fact prediction. We conduct a set of control experiments to disentangle "learning" from "learning to recall", providing a more detailed picture of what different prompts can reveal about pre-trained language models.

研究の動機と目的

  • 連続的埋め込み空間を用いたプロンプト最適化法の開発を通じて、事実探査タスクにおける効果性の向上を図ること。
  • OptiPromptのようなプロンプト探索手法が、モデル内部の知識から学習しているのか、それともトレーニングデータ内の統計的規則性から学習しているのかを調査すること。
  • 事実探柈において「学習」(モデル重みからの学習)と「想起のための学習」(トレーニングデータのパターンからの学習)を分離すること。
  • 事実探査結果が事前学習言語モデルに本当に何を明らかにしているのか、より洗練された理解を提供すること。
  • データ駆動型一般化とモデルベース一般化を分離する制御実験を導入することで、事実探査の診断的厳密性を高めること。

提案手法

  • OptiPromptは、離散的トークンではなく連続的入力埋め込みを直接最適化することで、埋め込み空間内での勾配ベースの探索を可能にする。
  • 収束性と性能の向上を図るため、手動で作成されたプロンプトから初期化する。
  • 標準的なバックプロパゲーションを用いて、モデルの[MASK]トークンに対する予測がトレーニングセットで精度を最大化するように入力埋め込みを更新する。
  • モデルパラメータの微調整を必要とせず、計算的にも効率的である。
  • 制御実験では、ランダムなベースラインと、トレーニングデータのみで訓練された単純な分類器との性能を比較する。
  • 標準的なLAMAと、語彙的ヒューリスティクスに強いLAMA-UHNスプリットの両方で評価し、レジリエンスを検証する。

実験結果

リサーチクエスチョン

  • RQ1離散的プロンプト探索と比較して、埋め込み空間内での連続的最適化が、事実探査精度を顕著に向上させられるか?
  • RQ2OptiPromptのようなプロンプト探索手法が、モデル内部の知識ではなく、トレーニングデータ内の統計的規則性に依存している程度はどの程度か?
  • RQ3探査精度の向上は、モデルの活用度の向上によるものか、それともデータ分布のパターンの利用によるものか?
  • RQ4トレーニングデータのみで訓練された分類器は、言語モデルにアクセスせずに事実を予測できるか?
  • RQ5異なるプロンプト手法は「簡単な」例と「難しい」例の両方でどのように性能を発揮するか? これにより、一般化行動に何が明らかになるか?

主な発見

  • OptiPromptは、LAMAベンチマークにおける事実探査精度を42.2%から48.6%に向上させ、従来の離散的手法と比較して6.4%の相対的向上を達成した。
  • LAMA-UHNスプリットでは、精度を31.3%から38.4%に向上させ、語彙的ヒューリスティクスに対して高いレジリエンスを示した。
  • トレーニングデータのみで訓練された単純な分類器が、テストセットで非自明な精度(最大20%)を達成した。これは、データ分布内に利用可能な規則性が存在することを示している。
  • OptiPromptを含むすべてのプロンプト探索手法が、これらのデータ規則性の恩恵を受けており、精度向上の一部がデータの記憶またはパターンの利用に起因している可能性がある。
  • OptiPromptは「簡単な」例と「難しい」例の両方で、従来の手法を上回る性能を発揮しており、データ駆動型一般化とモデルベースの事実想起の両方に効果的であることが示された。
  • 本研究では、探査結果がモデル内部知識の厳密な下限として解釈できるとは限らず、データ分布のパターンが混在していることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。