Skip to main content
QUICK REVIEW

[论文解读] A Supervised Word Alignment Method based on Cross-Language Span Prediction using Multilingual BERT

Masaaki Nagata, Katsuki Chousa|arXiv (Cornell University)|Apr 29, 2020
Topic Modeling参考文献 36被引用 6
一句话总结

该论文提出了一种监督式词对齐方法,将词对齐问题建模为跨语言跨度预测任务,利用微调后的多语言 BERT 来预测源语言词元对应的目际语言跨度。该方法仅需 150–300 个黄金对齐句且无需并行预训练数据,即在中文-英文等任务上取得了最先进(SOTA)的 F1 分数(如 86.7),优于以往的监督式与无监督方法。

ABSTRACT

We present a novel supervised word alignment method based on cross-language span prediction. We first formalize a word alignment problem as a collection of independent predictions from a token in the source sentence to a span in the target sentence. As this is equivalent to a SQuAD v2.0 style question answering task, we then solve this problem by using multilingual BERT, which is fine-tuned on a manually created gold word alignment data. We greatly improved the word alignment accuracy by adding the context of the token to the question. In the experiments using five word alignment datasets among Chinese, Japanese, German, Romanian, French, and English, we show that the proposed method significantly outperformed previous supervised and unsupervised word alignment methods without using any bitexts for pretraining. For example, we achieved an F1 score of 86.7 for the Chinese-English data, which is 13.3 points higher than the previous state-of-the-art supervised methods.

研究动机与目标

  • 为解决过去二十年来尽管神经机器翻译技术不断进步,词对齐准确率却停滞不前的问题。
  • 开发一种仅需极少黄金对齐数据且无需并行单语预训练文本的监督式词对齐方法。
  • 通过利用多语言 BERT 和一种问答风格的跨度预测框架,提升低资源语言对的对齐准确率。
  • 探索在训练过程中未见过的语言对上的零样本词对齐能力。

提出的方法

  • 将词对齐问题形式化为一系列 SQuAD 风格的问答任务,其中源语言词元作为问题,目标语言跨度作为答案。
  • 每个对齐实例被转换为一个上下文-问题-答案三元组,其中上下文为目际句子,问题为一个源词元。
  • 使用黄金对齐的句子对微调多语言 BERT,以预测对应于每个源词元的目标句子中的跨度。
  • 模型被训练以预测目标句子中对齐跨度的起始和结束位置,将多词元对齐视为多个答案。
  • 通过将源句中词元周围上下文信息融入问题中,以提升对齐精度。
  • 通过互换源语言与目标语言的角色,该方法支持双向对齐(例如,英-日与日-英)

实验结果

研究问题

  • RQ1能否通过问答框架将词对齐有效重构为跨语言跨度预测任务?
  • RQ2多语言 BERT 是否能在仅使用极少黄金对齐数据且无并行预训练的前提下,实现更优的词对齐性能?
  • RQ3与仅使用源词元相比,将源词元的上下文信息融入问题是否能提升对齐准确率?
  • RQ4该模型是否能在未在特定对齐数据上微调的情况下,泛化至零样本语言对?

主要发现

  • 所提方法在中文-英文词对齐任务上取得了 86.7 的 F1 分数,相比之前最先进(SOTA)的监督式方法提升了 13.3 个百分点。
  • 仅使用 150–300 个黄金对齐句,该模型即优于需要数百万并行句子进行预训练的监督式与无监督式方法。
  • 在零样本设置下,该模型在日-英任务上取得了 58.8 的 F1 分数(对比 GIZA++ 的 57.6),在罗马尼亚-英文任务上取得了 77.8 的 F1 分数(对比 MGIZA++ 的 73.6),展现出强大的泛化能力。
  • 将源词元周围的上下文信息融入问题后,对齐准确率得到提升,尤其对歧义词或高频词效果更明显。
  • 尽管使用了远少于标注句子且无并行预训练数据,该方法仍显著优于 Garg 等人(2019)与 Stengel-Eskin 等人(2019)的方法。
  • 该模型在多种语言对上表现稳健,包括形态丰富的语言和低资源语言(如罗马尼亚语和日语)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。