Skip to main content
QUICK REVIEW

[论文解读] Augmenting Statistical Machine Translation with Subword Translation of Out-of-Vocabulary Words

Nelson F. Liu, Jonathan May|arXiv (Cornell University)|Aug 16, 2018
Natural Language Processing Techniques参考文献 39被引用 9
一句话总结

本文提出基于子词的改进方法,通过利用拼写线索翻译未登录词(OOV),以提升统计机器翻译(SMT)性能。提出三种可泛化的策略——编辑距离、向量距离和字符级序列到序列模型,在14种语言类型多样的语言中实现一致的BLEU提升(平均0.5,最高2.0),尤其在低资源设置下表现显著。

ABSTRACT

Most statistical machine translation systems cannot translate words that are unseen in the training data. However, humans can translate many classes of out-of-vocabulary (OOV) words (e.g., novel morphological variants, misspellings, and compounds) without context by using orthographic clues. Following this observation, we describe and evaluate several general methods for OOV translation that use only subword information. We pose the OOV translation problem as a standalone task and intrinsically evaluate our approaches on fourteen typologically diverse languages across varying resource levels. Adding OOV translators to a statistical machine translation system yields consistent BLEU gains (0.5 points on average, and up to 2.0) for all fourteen languages, especially in low-resource scenarios.

研究动机与目标

  • 解决统计机器翻译(SMT)中在训练期间未见过的未登录词(OOV)翻译这一长期存在的挑战。
  • 通过利用子词拼写信息,克服SMT在处理OOV时的局限性,灵感来源于人类通过词形和拼写模式推断翻译的能力。
  • 开发无需依赖语言特异性启发式规则或大量平行数据的通用、与语言无关的OOV翻译方法。
  • 在多种语言中评估OOV翻译方法的内在性能,并评估其集成到完整SMT系统后的实际影响。
  • 证明子词层面的推理能够生成训练数据中不存在的新目标语言词汇,尤其通过序列到序列模型实现。

提出的方法

  • 使用编辑距离将OOV词元与词汇表内外语词进行匹配,选择Levenshtein距离最小的词,然后预测该匹配词的最常见英文翻译。
  • 应用在单语数据上训练的FastText词嵌入,通过余弦相似度计算OOV词与词汇表内词向量的距离,选择最接近的匹配词进行翻译预测。
  • 训练字符级序列到序列(seq2seq)模型,从OOV输入逐词元生成英文翻译,从而实现新目标语言词汇的组合生成。
  • 利用单语数据、双语词典和从平行语料中提取的词对齐翻译表构建OOV翻译器,无需语言特异性规则。
  • 在14对语言上进行内在评估,使用未出现在训练数据中的保留OOV词对,设置独立的验证集和测试集。
  • 将性能最佳的OOV翻译器集成到句法SMT(SBMT)系统中,并在标准测试集上测量整体BLEU得分提升。

实验结果

研究问题

  • RQ1子词层面的拼写相似性能否被有效利用,以实现对多种语言中OOV词的翻译,且具备良好的泛化能力?
  • RQ2在不同类型的OOV词中,基于子词的OOV翻译策略(编辑距离、向量距离、seq2seq)在性能上如何比较?
  • RQ3OOV翻译器在多大程度上提升了整体SMT系统性能,尤其是在低资源设置下?
  • RQ4序列到序列模型能否通过重新组合子词单元,生成训练期间未见过的新英文词汇?
  • RQ5不同方法最适合处理哪些OOV类型(如词形变化、复合词、拼写错误)?原因是什么?

主要发现

  • 将OOV翻译器集成到句法SMT系统后,在全部14种语言中均实现一致的BLEU提升,平均提升0.5 BLEU,低资源设置下最高达2.0 BLEU。
  • 序列到序列(seq2seq)模型在词形变化和复合词上的表现最佳,对词形变化的精确匹配准确率达24.6%,对复合词达40.0%,优于编辑距离和向量方法。
  • 编辑距离在拼写错误上的表现最佳(准确率31.6%),而向量距离在专有名词上表现更强(准确率20.0%),但seq2seq仍更优(准确率60.0%)。
  • seq2seq模型成功生成了训练数据中不存在的新英文词汇,如'cyberviolence'和'balkanized',证明其能够将子词单元组合为未见的目标语言词元。
  • 编辑距离在音译情况下的准确率为21.4%,与seq2seq模型持平,而向量距离仅为14.3%。
  • 内在评估显示,seq2seq模型在多种OOV类型上的泛化能力最强,整体精确匹配准确率达26.0%,显著优于编辑距离(17.0%)和向量方法(14.0%)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。