Skip to main content
QUICK REVIEW

[论文解读] Cross-Lingual Transfer Learning for Question Answering

Chia‐Hsuan Lee, Hung-yi Lee|arXiv (Cornell University)|Jul 13, 2019
Topic Modeling参考文献 44被引用 7
一句话总结

本文提出了一种用于问答的跨语言迁移学习方法,结合基于机器翻译(MT)和基于生成对抗网络(GAN)的方法,以提升中文等低资源目标语言的性能。基于 GAN 的方法通过引入语言判别器和词对词双语词典,采用对抗训练学习语言不变表示,其性能可与基于 MT 的方法相媲美,且无需依赖句级翻译系统。结合两种方法可在中文 DRCD 数据集上取得最先进结果。

ABSTRACT

Deep learning based question answering (QA) on English documents has achieved success because there is a large amount of English training examples. However, for most languages, training examples for high-quality QA models are not available. In this paper, we explore the problem of cross-lingual transfer learning for QA, where a source language task with plentiful annotations is utilized to improve the performance of a QA model on a target language task with limited available annotations. We examine two different approaches. A machine translation (MT) based approach translates the source language into the target language, or vice versa. Although the MT-based approach brings improvement, it assumes the availability of a sentence-level translation system. A GAN-based approach incorporates a language discriminator to learn language-universal feature representations, and consequentially transfer knowledge from the source language. The GAN-based approach rivals the performance of the MT-based approach with fewer linguistic resources. Applying both approaches simultaneously yield the best results. We use two English benchmark datasets, SQuAD and NewsQA, as source language data, and show significant improvements over a number of established baselines on a Chinese QA task. We achieve the new state-of-the-art on the Chinese QA dataset.

研究动机与目标

  • 通过从英语等高资源语言迁移知识,提升低资源语言(如中文)的问答性能。
  • 探究机器翻译是否能有效实现跨语言问答知识的迁移。
  • 开发一种仅依赖词对词双语词典的低资源跨语言迁移方法。
  • 比较基于 MT 和基于 GAN 的迁移方法的有效性。
  • 结合两种方法以实现在低资源目标语言上的最优性能。

提出的方法

  • 基于 MT 的方法在微调问答模型前,使用句级翻译系统将源语言(如英语)的训练数据翻译成目标语言(如中文)。
  • 基于 GAN 的方法引入语言相关层和语言判别器,通过领域对抗训练学习语言不变的潜在表示。
  • 语言判别器被训练以区分源语言和目标语言的表示,而问答模型则被训练以欺骗判别器,从而鼓励共享特征学习。
  • 训练过程交替更新源语言或目标语言相关层以最小化主损失,而另一方仅最小化问答损失,以确保训练稳定性。
  • 该方法仅使用词对词双语词典,避免依赖句级机器翻译系统。
  • 通过结合基于 MT 和基于 GAN 的方法,可实现最佳性能,同时利用翻译与对抗特征对齐的优势。

实验结果

研究问题

  • RQ1句级机器翻译能否有效实现从高资源语言到低资源语言的问答知识迁移?
  • RQ2仅使用词对词双语词典的基于 GAN 的方法能否在跨语言问答中达到与基于 MT 的方法相当的性能?
  • RQ3使用语言判别器的对抗训练是否有助于学习用于跨语言迁移的语言不变表示?
  • RQ4结合基于 MT 和基于 GAN 的迁移策略是否能带来性能提升?
  • RQ5在使用跨语言迁移时,目标语言需要多少标注数据?与完全监督训练相比表现如何?

主要发现

  • 基于 MT 的方法在中文 DRCD 数据集上显著提升性能,当以 SQuAD 作为源数据时,F1 得分为 87.26。
  • 仅使用词对词双语词典的基于 GAN 的方法与最佳基于 MT 的方法性能相当,在基于 SQuAD 训练时 F1 得分为 85.35。
  • 结合 MT 和 GAN 方法可取得最佳性能,在基于 SQuAD 的训练中 F1 得分为 87.26,在 NewsQA 上为 84.94。
  • GAN-CH 变体(将源语言(英语)表示对齐至目标语言(中文))优于 GAN-EN,表明将源语言对齐至目标语言更有效。
  • 所提方法将所需中文标注数据减少至 15,000 对 QA 对,即可达到基线模型使用 25,000 对数据训练的性能,展现出强大的数据效率。
  • 基于 GAN 的方法在中文 DRCD 数据集上达到最先进性能,为低资源跨语言问答设立了新基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。