Skip to main content
QUICK REVIEW

[论文解读] Cross-lingual Information Retrieval with BERT

Zhuolin Jiang, A. El-Jaroudi|arXiv (Cornell University)|Apr 24, 2020
Topic Modeling参考文献 23被引用 22
一句话总结

本文提出一种基于微调多语言 BERT 的跨语言信息检索(CLIR)模型,该模型在无需标注相关性注释的情况下,学习英语查询与外语文档之间的相关性。通过利用平行双语语料构建代理训练数据,该模型在立陶宛语 CLIR 基准测试中达到最先进性能,优于神经基线模型,并与概率模型相当。

ABSTRACT

Multiple neural language models have been developed recently, e.g., BERT and XLNet, and achieved impressive results in various NLP tasks including sentence classification, question answering and document ranking. In this paper, we explore the use of the popular bidirectional language model, BERT, to model and learn the relevance between English queries and foreign-language documents in the task of cross-lingual information retrieval. A deep relevance matching model based on BERT is introduced and trained by finetuning a pretrained multilingual BERT model with weak supervision, using home-made CLIR training data derived from parallel corpora. Experimental results of the retrieval of Lithuanian documents against short English queries show that our model is effective and outperforms the competitive baseline approaches.

研究动机与目标

  • 开发一种基于 BERT 的深度相关性匹配模型,用于跨语言信息检索。
  • 通过从平行双语语料中生成训练数据,减少对昂贵的人工标注查询-文档相关性标签的依赖。
  • 提升低资源语言对(如英语到立陶宛语)的跨语言文档检索性能。
  • 证明在代理 CLIR 数据上微调多语言 BERT 可在跨语言设置中实现强大的零样本和少样本泛化能力。

提出的方法

  • 在基于平行双语语料构建的代理 CLIR 任务上微调多语言 BERT 模型,仅使用句子级对齐,不依赖词级对齐。
  • 通过将英语查询与平行语料中对应的外语文本句子配对构建训练数据,若二者互为翻译则视为相关。
  • 采用 BERT 的输入格式:[CLS] 查询 [SEP] 外语文本 [SEP],并共享查询与文档 token 之间的注意力机制。
  • 使用对比学习目标进行模型优化,以最大化正确查询-句子对的相关性得分,同时最小化错误配对的得分。
  • 利用 BERT 的自注意力机制捕捉查询与文档之间在词级别和 n-gram 级别的匹配模式。
  • 可视化注意力头,分析 BERT 如何捕捉源语言与目标语言之间的词对词匹配及二元组级别语义模式。

实验结果

研究问题

  • RQ1微调后的多语言 BERT 模型是否能在无显式相关性标注的情况下有效学习跨语言相关性?
  • RQ2基于 BERT 的 CLIR 模型在低资源语言对上的性能与传统神经网络及非神经基线模型相比如何?
  • RQ3从平行双语语料中生成的代理训练数据在多大程度上可替代昂贵的相关性标注数据用于 CLIR?
  • RQ4BERT 在跨语言检索中学习了哪些类型的匹配模式(如词级别、二元组级别)?

主要发现

  • 基于 BERT 的 CLIR 模型在开发集上取得 61.8 的 MAP 分数,在分析集上达到 65.7,优于 QRANN、点积注意力及其他神经基线模型。
  • 在短语查询子集上,BERT 模型取得 61.3% 的 MAP 分数,为所有对比模型中的最高分,表明其在多词查询上表现优异。
  • 模型在语音数据上的 MQWV 得分为 65.4,在文本数据上为 65.7,优于所有其他神经模型,并与最佳非神经模型持平。
  • 注意力可视化结果证实,BERT 同时捕捉了直接的词对词匹配(如 'writing' → 'rašo')和二元组级别建模(如 'writing well' → 'rašo arba gerai')。
  • 尽管仅在单字查询上进行训练,该模型在短语查询上的表现最佳,表明其对多词查询模式具有强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。