[論文レビュー] X-FACTR: Multilingual Factual Knowledge Retrieval from Pretrained Language Models
X-FACTRは、23のタイプロジカルに多様な言語をカバーする、事実知識抽出のための多言語ベンチマークを導入する。クローズ形式のプローブを多トークンエンティティおよび形態論に配慮したプロンプト生成に拡張することで、多言語モデルが低リソース言語で性能を発揮しないこと、およびコードスイッチングファインチューニングによってそのような環境での知識アクセスが向上することを明らかにした。
Language models (LMs) have proven surprisingly successful at capturing factual knowledge by completing cloze-style fill-in-the-blank questions such as "Punta Cana is located in _." However, while knowledge is both written and queried in many languages, studies on LMs' factual representation ability have almost invariably been performed on English. To assess factual knowledge retrieval in LMs in different languages, we create a multilingual benchmark of cloze-style probes for 23 typologically diverse languages. To properly handle language variations, we expand probing methods from single- to multi-word entities, and develop several decoding algorithms to generate multi-token predictions. Extensive experimental results provide insights about how well (or poorly) current state-of-the-art LMs perform at this task in languages with more or fewer available resources. We further propose a code-switching-based method to improve the ability of multilingual LMs to access knowledge, and verify its effectiveness on several benchmark languages. Benchmark data and code have been released at https://x-factr.github.io.
研究の動機と目的
- 英語に偏った研究から脱却し、多様な言語における多言語言語モデル(M-LMs)の事実知識抽出能力を評価すること。
- 非英語言語における形態論的変異と多トークンエンティティの課題に対処するため、形態論に配慮したプロンプト生成スキーマを設計すること。
- 多言語事前学習が単言語事前学習と比較して、事実知識の想起をどのように向上させるかを検証すること。
- 多言語言語モデルにおける事実知識のクロスリンガウルな共有度合いを調査し、低リソース言語における抽出を改善する手法を提案すること。
- 低リソース言語における知識アクセスを向上させるために、コードスイッチングに基づくファインチューニング手法を開発・検証すること。
提案手法
- 23ヶ国語のクローズ形式プロンプトを用いた多言語ベンチマーク(X-FACTR)を構築し、事実知識のソースとしてWikidataのトリプルを活用した。
- エンティティメタデータ(例:性、数)および形態論的変形モデルを用いて文法的に正しいプロンプトを生成する、形態論に配慮したアノテーションスキーマを設計した。
- プローブを単一トークンから多トークンエンティティへ拡張し、データセットの75%以上を占める事実に適用した。
- マスクされた言語モデルからの多トークン予測を生成するための複数のデコードアルゴリズム(例:グリーディ、ビームサーチ、信頼度ベース)を提案した。
- プロンプト内のエンティティを別の言語(例:英語→フランス語)の同等物に置き換えることで、クロスリンガウルな知識アクセスを向上させるコードスイッチングベースのファインチューニング目的を導入した。
- 最先端の多言語モデル(M-BERT、XLM、XLM-R)および単言語モデルの精度とカバレッジ指標を用いて、性能を評価した。
実験結果
リサーチクエスチョン
- RQ1多言語言語モデルにおける事実知識抽出のパフォーマンスは、高リソース言語と低リソース言語でどのように異なるか?
- RQ2多言語事前学習は単言語事前学習と比較して、事実知識の想起をより良くするのか?
- RQ3多言語言語モデルにおける事実知識の記憶は、どの程度言語間で共有されており、各言語でどれほど特異的か?
- RQ4コードスイッチングベースのファインチューニングは、低リソース言語における事実知識抽出を改善できるか?
主な発見
- 多言語言語モデルは、低リソース言語(例:スワヒリ語、ヨルーバ語、マラーティ語)において、高リソース言語(例:M-BERTが英語で13.57%)と比較して顕著に低い事実知識抽出精度(例:スワヒリ語で5%未満)を示した。
- 多言語事前学習にもかかわらず、M-LMsが知識想起において一貫して単言語モデルを上回るとは限らず、言語やモデルによって性能のばらつきが顕著に見られた。
- 約50%の事実しか複数の言語で再現されておらず、M-LMsにおける知識は主に言語固有であり、言語間での転送はほとんど行われないことが示唆された。
- コードスイッチングファインチューニング手法は、低リソース言語(例:フランス語、ロシア語、ギリシャ語)でその言語でプロンプトされた場合に、事実知識抽出を向上させ、その有効性が裏付けられた。
- 多トークンエンティティの予測は依然として大きな課題であり、単一トークンエンティティと比較して精度が著しく低下(例:M-BERTが英語の多トークンエンティティで5.57%)していた。
- 信頼度ベースのデコードは、グリーディーやビームサーチと比較して一部のケースで優れた結果を示したが、全体としてのパフォーマンスは依然として低く、特に形態論的に豊富で低リソースの言語では顕著に劣っていた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。