[論文レビュー] How to Query Language Models?
本稿では、事実関連の曖昧なクエリを解消するために、入力コンテキストにFew-shotの例示を提供することで大規模言語モデル(LMs)を問い合わせる手法を提案する。これにより、知識プローブタスクにおける性能が顕著に向上する。わずか10個の例示——例えば、'Ronaldoはポルトガルのためにプレーする。Neuerは[MASK]のためにプレーする'——を追加するだけで、BERT-largeはベースラインのclozeクエリに比べてT-RExで37.8%の相対的改善を達成し、複数のフォワードパスを要する40個の言い換えプロンプトのアンサンブルでさえも上回る。
Large pre-trained language models (LMs) are capable of not only recovering linguistic but also factual and commonsense knowledge. To access the knowledge stored in mask-based LMs, we can use cloze-style questions and let the model fill in the blank. The flexibility advantage over structured knowledge bases comes with the drawback of finding the right query for a certain information need. Inspired by human behavior to disambiguate a question, we propose to query LMs by example. To clarify the ambivalent question "Who does Neuer play for?", a successful strategy is to demonstrate the relation using another subject, e.g., "Ronaldo plays for Portugal. Who does Neuer play for?". We apply this approach of querying by example to the LAMA probe and obtain substantial improvements of up to 37.8% for BERT-large on the T-REx data when providing only 10 demonstrations--even outperforming a baseline that queries the model with up to 40 paraphrases of the question. The examples are provided through the model's context and thus require neither fine-tuning nor an additional forward pass. This suggests that LMs contain more factual and commonsense knowledge than previously assumed--if we query the model in the right way.
研究の動機と目的
- 事前学習済み言語モデルに対して事実知識を問い合わせる際の、曖昧なプロンプト設計や最適でないプロンプト設計の課題に対処すること。
- コンテキスト内の例示を提供することで、マスクされた言語モデルにおける知識プローブの正確性が向上するかどうかを調査すること。
- 微調整や複数のフォワードパスを伴わずに、例示ベースのプロンプティングが従来の手法(例:言い換えアンサンブル)を上回る可能性があるかどうかを評価すること。
- T-REx、ConceptNet、BATSを含む多様な知識プローブベンチマークにおいて、このアプローチの有効性を評価すること。
提案手法
- 本手法は、cloze形式のクエリに、同じ関係の自然言語でのFew-shot例示を追加することに特徴する。例:'Ronaldoはポルトガルのためにプレーする。Neuerは[MASK]のためにプレーする'。
- 例示はモデルのコンテキストに直接挿入され、微調整や追加のフォワードパスを必要としない。
- 本手法は、モデルが例示から関係パターンを認識し、新しいクエリにそのパターンを転送できる能力を活用する。
- 性能評価には標準ベンチマークを用いる:LAMAプローブ(T-REx、Google-RE、ConceptNet)、語の類似性タスクのためのBATS、常識的推論のためのTBG。
- 各クエリに対して、モデルはマスクされたトークンを予測し、P@1(トップ1での正確度)とベースラインに対する相対的改善度で性能を測定する。
- 本手法は、最先端のベースライン(Jiang et al., 2020の言い換えアンサンブル、Petroni et al., 2020のコンテキスト拡張プローブ)と比較される。
実験結果
リサーチクエスチョン
- RQ1入力コンテキストに僅か数個の自然言語例示を提供することで、事前学習済み言語モデルにおける事実知識抽出の正確性を顕著に向上させることができるか?
- RQ2例示ベースのプロンプティングは、40個の言い換えプロンプトのアンサンブルと比較して、事実知識をプローブする際に優れているか?
- RQ3例示の数を増やしても性能向上が飽和するか、その点で追加の例示が最小限の改善しかもたらさないか?
- RQ4この手法は、事実的、常識的、類似性推論タスクを含む、さまざまな知識プローブベンチマークにどの程度一般化可能か?
主な発見
- わずか10個の例示を提供するだけで、BERT-largeのT-RExデータセットにおけるP@1性能は、標準的なclozeプロンプトベースラインに比べて37.8%向上した。
- Few-shot例示アプローチは、最大40個の言い換えプロンプトのアンサンブルを上回り、1回のフォワードパスでより高い正確度を達成した。
- ConceptNetの常識的関係において、Albert-xxlargeは10個の例示で25%の相対的性能向上を達成し、解ける類似性タスクにおいてGloVeベースラインを上回った。
- 10個を超える例示では、性能向上の効果が薄れ、限界に達していることが示された。
- 関係が矢印記号(例:[s] => [o])で表現される曖昧な状況でも、わずか数個の例示で意図する関係が明確にされ、効果的に機能した。
- 本手法は、T-REx、BATS、TBGベンチマークを用いた検証を通じて、事実的、常識的、形態的関係を含む多様な知識タイプに強く一般化できることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。