Skip to main content
QUICK REVIEW

[论文解读] BPE and CharCNNs for Translation of Morphology: A Cross-Lingual Comparison and Analysis

Pamela Shapiro, Kevin Duh|arXiv (Cornell University)|Sep 5, 2018
Natural Language Processing Techniques参考文献 10被引用 8
一句话总结

本文研究了在低资源、词形丰富的语言中,字节对编码(BPE)与字符级卷积神经网络(charCNN)在神经机器翻译中的互补作用。研究发现,将BPE与charCNN结合可在八种语言中持续提升翻译性能,且在希伯来语中,仅使用charCNN的表现优于BPE,原因在于其非纯辅音文字(impure abjad script)和词形模板结构。

ABSTRACT

Neural Machine Translation (NMT) in low-resource settings and of morphologically rich languages is made difficult in part by data sparsity of vocabulary words. Several methods have been used to help reduce this sparsity, notably Byte-Pair Encoding (BPE) and a character-based CNN layer (charCNN). However, the charCNN has largely been neglected, possibly because it has only been compared to BPE rather than combined with it. We argue for a reconsideration of the charCNN, based on cross-lingual improvements on low-resource data. We translate from 8 languages into English, using a multi-way parallel collection of TED transcripts. We find that in most cases, using both BPE and a charCNN performs best, while in Hebrew, using a charCNN over words is best.

研究动机与目标

  • 评估BPE与charCNN在处理低资源神经机器翻译中词形复杂性方面的有效性。
  • 确定BPE与charCNN在建模子词形态时是否具有互补性或冗余性。
  • 研究语言特异性性能差异,特别是具有非纯辅音文字的闪米特语系语言。
  • 为在低资源设置下将charCNN作为源端词形建模更强基线提供实证证据。
  • 发布OpenNMT-py中charCNN的开源实现,以支持可复现性与扩展。

提出的方法

  • 在源端训练数据上应用BPE进行子词分割,通过迭代合并高频字符对实现。
  • 将字符级卷积神经网络(charCNN)集成到编码器中,从字符级嵌入学习词表示。
  • 在单一模型架构中结合BPE与charCNN,使注意力机制能够同时关注子词单元与字符级模式。
  • 使用涵盖八种语言(阿拉伯语、法语、德语、希伯来语、匈牙利语、葡萄牙语、罗马尼亚语、俄语)的多语种平行TED演讲数据集,以英语为目标语言。
  • 使用开发集与测试集上的BLEU分数训练并评估模型,比较不同配置:word+tok、word+char、bpe+tok、bpe+char、stem+tok、stem+char。
  • 对翻译输出进行定性分析,以理解失败模式与词形建模行为。

实验结果

研究问题

  • RQ1BPE与charCNN在提升词形丰富、低资源语言翻译性能方面表现如何?
  • RQ2BPE与charCNN在建模子词形态时是否具有互补性,还是提供冗余改进?
  • RQ3为何BPE在希伯来语与阿拉伯语中表现欠佳甚至产生负面影响?这与它们的正字法与词形系统有何关联?
  • RQ4在何种语言或类型学背景下,仅使用charCNN能优于基于BPE的模型?
  • RQ5BPE与charCNN在处理复杂复合词时如何相互作用?字符级建模在纠正子词分割错误中发挥何种作用?

主要发现

  • 在八种语言中的七种中,BPE与charCNN的结合始终取得最高BLEU分数,其中葡萄牙语-英语翻译的最高分为41.67。
  • 在希伯来语中,word+char配置取得35.53的BLEU分数,优于bpe+char系统(30.81),表明BPE在此语言中损害了性能。
  • BPE在希伯来语中造成有害的分割(如将“mk@@ ndh”误分以表示“from Canada”),在阿拉伯语中亦然(如将“alkn@@ dywn”误分以表示“the Canadians”),可能由于缺乏元音符号标记与模板化词形结构。
  • 在德语中,bpe+char模型在复合词(如“self-portraits”)上表现更优,其中BPE将“selbstportraits”分割为“selbst@@ portr@@ aits”,而charCNN有助于重建正确语义。
  • 在经过形态归一化处理的文本(如ISRI词干提取器处理的阿拉伯语)上,charCNN效果较差,BLEU提升从3.41降至0.06,表明形态归一化降低了charCNN的实用性。
  • charCNN在建模字符级模式方面特别有益于音译词(如希伯来语中的“milli-”),其中BPE的子词单元会破坏识别。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。