[论文解读] X-FACTR: Multilingual Factual Knowledge Retrieval from Pretrained Language Models
X-FACTR 提出了一项多语言基准,用于评估预训练语言模型在23种语言类型多样的语言中的事实知识检索能力。该研究将填空式探针扩展至多标记实体和形态感知的提示实例化,揭示出多语言模型在低资源语言中的表现较差,而通过语言切换微调可提升此类语言环境下的知识访问能力。
Language models (LMs) have proven surprisingly successful at capturing factual knowledge by completing cloze-style fill-in-the-blank questions such as "Punta Cana is located in _." However, while knowledge is both written and queried in many languages, studies on LMs' factual representation ability have almost invariably been performed on English. To assess factual knowledge retrieval in LMs in different languages, we create a multilingual benchmark of cloze-style probes for 23 typologically diverse languages. To properly handle language variations, we expand probing methods from single- to multi-word entities, and develop several decoding algorithms to generate multi-token predictions. Extensive experimental results provide insights about how well (or poorly) current state-of-the-art LMs perform at this task in languages with more or fewer available resources. We further propose a code-switching-based method to improve the ability of multilingual LMs to access knowledge, and verify its effectiveness on several benchmark languages. Benchmark data and code have been released at https://x-factr.github.io.
研究动机与目标
- 评估多语言语言模型(M-LMs)在多样化语言中的事实知识检索能力,突破以往以英语为主导的研究焦点。
- 通过设计形态敏感的提示实例化方案,解决非英语语言中形态变化和多标记实体的挑战。
- 探究多语言预训练是否相比单语言预训练能提升事实知识的回忆能力。
- 探索多语言模型中跨语言知识重叠的程度,并提出改进低资源语言检索的方法。
- 开发并验证一种基于语言切换的微调方法,以增强低资源语言中的知识访问能力。
提出的方法
- 为23种语言创建了一个多语言基准(X-FACTR),使用维基数据三元组作为事实知识来源,采用填空式提示。
- 设计了一种形态敏感的标注方案,利用实体元数据(如性、数)和形态屈折模型,生成语法正确的提示。
- 将探针从单标记实体扩展至多标记实体,这些实体在数据集中占比超过75%。
- 提出了多种解码算法(如贪心法、束搜索、基于置信度的方法),用于从掩码语言模型中生成多标记预测。
- 引入了一种基于语言切换的微调目标,将提示中的实体替换为另一种语言的对应形式(如英-法),以提升跨语言知识访问能力。
- 在准确性与覆盖率指标上,评估了最先进多语言模型(M-BERT、XLM、XLM-R)和单语言模型的性能。
实验结果
研究问题
- RQ1多语言语言模型在高资源语言与低资源语言中的事实知识检索表现有何差异?
- RQ2多语言预训练是否相比单语言预训练能带来更好的事实知识回忆能力?
- RQ3多语言模型中存储的事实知识在多大程度上跨语言共享?每种语言中的知识有多独特?
- RQ4基于语言切换的微调能否提升低资源语言中的事实知识检索能力?
主要发现
- 多语言语言模型在低资源语言中的事实知识检索准确率显著较低(例如,斯瓦希里语、约鲁巴语和马拉地语的准确率低于5%),而高资源语言中的表现则高得多(例如,M-BERT在英语中的准确率为13.57%)。
- 尽管经过多语言预训练,M-LMs 在知识回忆方面并未始终优于单语言模型,其表现因语言和模型而异,差异显著。
- 仅约50%的事实在超过一种语言中被回忆,表明M-LMs中的知识在很大程度上是语言特定的,难以在语言间迁移。
- 语言切换微调方法在以低资源语言提示时,能有效提升事实知识检索性能(例如,法语、俄语、希腊语),证明了其有效性。
- 多标记实体预测仍是主要挑战,准确率显著下降(例如,M-BERT在英语多标记实体上的准确率仅为5.57%),远低于单标记实体。
- 在某些情况下,基于置信度的解码优于贪心法或束搜索,但总体表现仍然较低,尤其是在形态丰富且资源匮乏的语言中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。