[論文レビュー] Language Models As or For Knowledge Bases
この論文は、大規模言語モデル(LM)は、内在的な不確実性や幻覚のため、構造化された知識ベース(KB)に置き換えることはできないが、候補となる事実を検証または否定するための「第二の意見」として非常に価値があると主張している。著者らは、LMを用いて新しい主張をプローブし、外部のテキスト知識を活用することで、KBの品質を向上させ、知識ベースのメンテナンス中の誤りを低減する手法を提案している。
Pre-trained language models (LMs) have recently gained attention for their potential as an alternative to (or proxy for) explicit knowledge bases (KBs). In this position paper, we examine this hypothesis, identify strengths and limitations of both LMs and KBs, and discuss the complementary nature of the two paradigms. In particular, we offer qualitative arguments that latent LMs are not suitable as a substitute for explicit KBs, but could play a major role for augmenting and curating KBs.
研究の動機と目的
- 事前学習済み言語モデル(LM)が、正確性、信頼性、保守性の観点から、明示的な知識ベース(KB)の代替として実用的かどうかを評価すること。
- LMがKBとしての中心的限界、特に幻覚、出典の欠如、事実と相関関係の区別不能性を特定すること。
- LMを用いてKBのキュレーション段階で品質を向上させる方法、特に重複するエンティティの検出、新規事実の検証、整合性の確保の観点から調査すること。
- 知識表現、スキーマの柔軟性、保守の負担という観点から、LMとKBの長所・短所を対比すること。
- LMを独立した知識リポジトリとしてではなく、KBの主張を外部で検証する役割として果たす補完的役割を提唱すること。
提案手法
- 著者らはGPT-3を主なLMとして用い、ゼロショットプロンプト(例:「アラン・チューリングは___に生まれた」)を用いて、モデルの完了出力として主語・述語・目的語の三項組みを抽出する。
- 各完了に対してLMが割り当てる信頼度スコアを、候補となる事実の妥当性の証拠として用い、高い信頼度はその事実の妥当性を示唆する。
- 自然言語プロンプトを用いてLMにプローブし、上位ランクの予測とその関連確率を分析することで、候補となるKBの主張を評価する。
- このアプローチは、LMを外部検証者として扱うものである。LMが候補となる事実に対して低い信頼度を割り当てた場合、その主張は再検査または却下の対象となる。
- このフレームワークは、既存の事実の検証(verification)と、LMを用いた候補の生成(candidate generation)の両方をサポートするが、後者はさらなる精錬を要する。
- この手法は、LMを用いて一貫性の欠如や幻覚(例:誤った配偶者や誤った賞の記述)を検出することに重点を置き、既知のKB事実と照合して予測を比較する。
実験結果
リサーチクエスチョン
- RQ1言語モデルは、事実の正確性と整合性の観点から、構造化された知識ベースに信頼性を持って置き換えられるか?
- RQ2言語モデルが事実的知識についてクエリされた際に、どの程度幻覚を生じたり、誤検出を引き起こすか?
- RQ3希少または単一の値(singleton values)を含む事例において、言語モデルの信頼度スコアと生成された事実の真偽との相関関係はいかほどか?
- RQ4KBキュレーションの過程で、LMを独立した証拠の源として、候補となる事実の検証または否定に用いることができるか?
- RQ5知識の出典、スキーマの柔軟性、保守の観点から、LMをKBとして使用する際の主な限界は何か?
主な発見
- GPT-3は、アラン・チューリングがロンドンに生まれたという事実に対して83%の高い信頼度スコアを割り当てたが、同時に彼の配偶者として「サライ・ラビングトン」を21%の信頼度で生成し、誤った主張をした。
- LMはアラン・チューリングがノーベル賞を受賞したと誤って予測(26%の信頼度)し、「戦争(war)」を賞として特定しており、共起語に偏った系のバイアスを示している。
- 「月に最初に着陸した女性は」のプロンプトに対して、GPT-3はまだ誰も月に着陸していないにもかかわらず、サリー・ライドやエイミリー・コリンズといった誤った名前を生成した。これは、モデルが事実の不在を認識できないことを示している。
- チューリング研究所のロンドンにおける住所を正しく特定できず、「ディリー・デン(Dilly’s Den)」と出力した。これは、希少または単一の事実的値に対して、性能が著しく劣ることを示している。
- チューリング賞受賞者をリストアップするようにプロンプトした場合、GPT-3は正しい名前と誤った名前の混合を返し、全73名を取得するには深いランク付け(deep ranking)が必要であり、妥当性の明確な停止点がない。
- 一方、Wikidataは明確に、アラン・チューリングに配偶者がいないと記述しており、「値なし(no value)」のステートメントを用いている。これは、LMの潜在的かつ確率的な性質では表現できない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。