Skip to main content
QUICK REVIEW

[论文解读] Fully Character-Level Neural Machine Translation without Explicit Segmentation

Jason D. Lee, Kyunghyun Cho|arXiv (Cornell University)|Oct 10, 2016
Natural Language Processing Techniques被引用 8
一句话总结

本文提出了一种完全基于字符级别的神经机器翻译模型,可直接将源字符序列映射到目标字符序列,无需显式分词。通过使用带有最大池化和高速公路层的字符级卷积编码器,该模型实现了与子词级别模型相当的训练速度,并在多语言翻译任务中表现更优,尤其在低资源语对(如FI-EN)上表现突出,同时还能无缝处理句子内的代码切换。

ABSTRACT

Most existing machine translation systems operate at the level of words, relying on explicit segmentation to extract tokens. We introduce a neural machine translation (NMT) model that maps a source character sequence to a target character sequence without any segmentation. We employ a character-level convolutional network with max-pooling at the encoder to reduce the length of source representation, allowing the model to be trained at a speed comparable to subword-level models while capturing local regularities. Our character-to-character model outperforms a recently proposed baseline with a subword-level encoder on WMT'15 DE-EN and CS-EN, and gives comparable performance on FI-EN and RU-EN. We then demonstrate that it is possible to share a single character-level encoder across multiple languages by training a model on a many-to-one translation task. In this multilingual setting, the character-level encoder significantly outperforms the subword-level encoder on all the language pairs. We observe that on CS-EN, FI-EN and RU-EN, the quality of the multilingual character-level translation even surpasses the models specifically trained on that language pair alone, both in terms of BLEU score and human judgment.

研究动机与目标

  • 开发一种完全在字符级别运行、不依赖显式词分词的神经机器翻译系统。
  • 克服词级别模型在处理罕见词和OOV(词汇表外)词时的局限性,尤其是在形态丰富的语言中。
  • 探究在多对一多语言翻译设置中,单一字符级别编码器是否可跨多种语言共享。
  • 评估模型在低资源语对上的泛化能力,以及在无需显式语言识别的情况下处理句子内代码切换的能力。

提出的方法

  • 模型使用带有最大池化和高速公路层的字符级卷积编码器,以减少序列长度并提高训练效率。
  • 编码器处理原始字符序列,并生成捕捉局部规律和形态模式的上下文表示。
  • 基于双向RNN的解码器结合注意力机制,逐个生成目标字符,条件依赖于编码器的上下文向量。
  • 在多语言训练中,单一字符级编码器被多个源语言(德语、捷克语、芬兰语、俄语)共享,并全部翻译为英语。
  • 模型通过交叉熵损失端到端训练,并使用批量归一化和Dropout进行随机梯度下降优化。
  • 系统通过BLEU分数和人工评估进行评估,并在代码切换和低资源设置下进行消融研究。

实验结果

研究问题

  • RQ1完全基于字符级别的NMT模型是否能在无需显式分词的情况下,与子词级别模型达到相当的性能?
  • RQ2在多个语言之间共享字符级别编码器是否能提升低资源语对(如FI-EN和RU-EN)的性能?
  • RQ3模型是否能泛化到句子内代码切换的情况,并在无显式语言识别的情况下正确翻译混合语言输入?
  • RQ4与双语子词级别模型相比,字符级别多语言模型的参数效率如何?

主要发现

  • 字符级模型在DE-EN和CS-EN任务上优于子词级别基线模型,BLEU分数更高,且对罕见词的处理更优。
  • 在FI-EN和RU-EN任务上,字符级模型与子词级别基线模型性能相当,但在多语言训练中表现显著提升。
  • 在FI-EN、CS-EN和RU-EN任务上,多语言字符级模型在BLEU分数和人工评估中均优于双语子词级别模型和双语字符级别模型。
  • 模型在句子内代码切换上表现出强大的泛化能力,无需语言识别即可将混合语言输入翻译为连贯的英文输出。
  • 由于多任务学习带来的正则化作用,多语言字符级模型在低资源语对(如FI-EN)上更不易过拟合。
  • 训练字符级模型比子词级别基线慢约35%,但在单张GPU上仍可在两周内完成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。