Skip to main content
QUICK REVIEW

[论文解读] Translation Transformers Rediscover Inherent Data Domains

Maksym Del, Elizaveta Korotkova|arXiv (Cornell University)|Sep 16, 2021
Natural Language Processing Techniques参考文献 21被引用 5
一句话总结

该论文表明,NMT Transformer 即使在没有显式领域标签的情况下,也能在其隐藏表征中固有地学习并保留领域特定信息。通过利用这些内部表征进行无监督聚类——尤其是文档级别的聚类——其在领域聚类和领域自适应性能方面优于使用外部预训练语言模型(如 XLM-R)的方法,在微调原始标签时表现更优或相当。

ABSTRACT

Many works proposed methods to improve the performance of Neural Machine Translation (NMT) models in a domain/multi-domain adaptation scenario. However, an understanding of how NMT baselines represent text domain information internally is still lacking. Here we analyze the sentence representations learned by NMT Transformers and show that these explicitly include the information on text domains, even after only seeing the input sentences without domains labels. Furthermore, we show that this internal information is enough to cluster sentences by their underlying domains without supervision. We show that NMT models produce clusters better aligned to the actual domains compared to pre-trained language models (LMs). Notably, when computed on document-level, NMT cluster-to-domain correspondence nears 100%. We use these findings together with an approach to NMT domain adaptation using automatically extracted domains. Whereas previous work relied on external LMs for text clustering, we propose re-using the NMT model as a source of unsupervised clusters. We perform an extensive experimental study comparing two approaches across two data scenarios, three language pairs, and both sentence-level and document-level clustering, showing equal or significantly superior performance compared to LMs.

研究动机与目标

  • 探究 NMT Transformer 是否在无显式监督的情况下,隐式地在其隐藏表征中编码文本领域信息。
  • 评估基于 NMT 模型表征生成的无监督领域聚类质量,与基于预训练语言模型的聚类质量进行比较。
  • 通过重用 NMT 模型自身学习到的聚类,而非依赖外部语言模型,提升 NMT 领域自适应性能。
  • 测试基于 NMT 的聚类在多种语言对和数据场景下的有效性,包括带标签的混合语料库和无标签的异构语料库(如 ParaCrawl)。

提出的方法

  • 使用平均池化上下文嵌入,从预训练 NMT Transformer 编码器的所有层中提取句子和文档级别的表征。
  • 应用主成分分析(PCA)和 k-means 聚类,从这些表征中识别无监督领域聚类。
  • 使用自动发现的聚类在领域自适应框架中微调 NMT 模型,替代依赖 XLM-R 等外部模型进行聚类。
  • 在两种数据设置下,将基于 NMT 的聚类与 XLM-R 的聚类及原始语料库标签进行性能比较:带标签的混合语料库和无标签的 ParaCrawl 数据。
  • 通过在多个语言对(如 EN-DE、EN-ET、EN-CS)上使用 BLEU 分数评估模型性能,并分析不同模型大小和聚类数量下的结果。
  • 通过较小的 NMT 模型进行消融研究,评估所提聚类方法的鲁棒性和可扩展性。

实验结果

研究问题

  • RQ1NMT Transformer 是否能在无任何显式领域监督的情况下,在其隐藏表征中学习并保留领域特定信息?
  • RQ2基于 NMT 表征的无监督领域聚类质量与基于 XLM-R 等预训练语言模型的聚类质量相比如何?
  • RQ3基于 NMT 的聚类能否有效用于领域自适应,实现与使用原始领域标签相当或更优的性能?
  • RQ4基于 NMT 的聚类性能是否依赖于模型大小、语言对或数据异质性(如 ParaCrawl)?

主要发现

  • NMT 模型生成的句子和文档表征与实际文本领域聚类非常接近,在无任何监督的情况下,文档级别几乎达到 100% 的对应度。
  • 基于 NMT 的聚类在聚类纯度和翻译质量方面优于基于 XLM-R 的聚类,尤其在文档级别聚类中表现更优。
  • 在自动提取的 NMT 聚类上微调 NMT 模型,其性能可匹配或超过在原始语料库标签上微调的性能,尤其在 EN-ET 和 EN-CS 翻译任务中表现更优。
  • 即使模型参数量仅为原来的 1/5,基于 NMT 的聚类性能仍可与 XLM-R 相当,证明了该方法的鲁棒性和可扩展性。
  • 在 DE-EN ParaCrawl 设置中,基于 NMT 的聚类显著优于 XLM-R,尤其当模型容量足够支持该语言对时。
  • 该方法减少了对外部预训练模型的依赖,简化了领域自适应流程,同时保持或提升了翻译质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。