Skip to main content
QUICK REVIEW

[论文解读] Analyzing the Use of Character-Level Translation with Sparse and Noisy Datasets

Jörg Tiedemann, Preslav Nakov|arXiv (Cornell University)|Sep 27, 2021
Natural Language Processing Techniques参考文献 36被引用 15
一句话总结

本文研究了在低资源、噪声大且数据稀疏的数据集(特别是众包电影字幕)上,使用语义相近的中间语言(如保加利亚语)进行字符级统计机器翻译(SMT),以提升马其顿语到英语的翻译效果。结果表明,字符级模型可使未登录词(OOV)减少40%以上,并在低数据环境下使BLEU分数提升2–3分,通过多中间语言生成合成数据的方法优于级联翻译模型。

ABSTRACT

This paper provides an analysis of character-level machine translation models used in pivot-based translation when applied to sparse and noisy datasets, such as crowdsourced movie subtitles. In our experiments, we find that such character-level models cut the number of untranslated words by over 40% and are especially competitive (improvements of 2-3 BLEU points) in the case of limited training data. We explore the impact of character alignment, phrase table filtering, bitext size and the choice of pivot language on translation quality. We further compare cascaded translation models to the use of synthetic training data via multiple pivots, and we find that the latter works significantly better. Finally, we demonstrate that neither word-nor character-BLEU correlate perfectly with human judgments, due to BLEU's sensitivity to length.

研究动机与目标

  • 解决稀疏且有噪声的数据集(如众包电影字幕)在低资源机器翻译中的挑战。
  • 探索字符级SMT模型在传统词级模型表现不佳的低数据环境下的有效性。
  • 研究中间语言选择、短语表过滤、字符对齐及数据规模对翻译质量的影响。
  • 比较级联翻译与通过多中间语言生成合成数据的方法,以提升性能。
  • 评估自动指标(BLEU)与人工判断的相关性,尤其关注长度敏感性。

提出的方法

  • 将字符作为单位训练短语基于的SMT模型,使用特殊标记表示空格,并允许短语长度和语言模型阶数最高达10。
  • 应用字符级对齐算法,在字符层面对齐源句与目标句,实现子词级别的翻译。
  • 通过短语表剪枝与过滤提升模型效率与翻译质量。
  • 通过级联多个中间语言(如马其顿语 → 保加利亚语 → 英语)生成合成训练数据,利用跨语言相似性。
  • 结合词级与字符级模型,以同时利用词汇级与子词级映射。
  • 通过Cohen’s Kappa进行人工手动评估,以衡量评分者间的一致性,并对比人工判断与BLEU分数。

实验结果

研究问题

  • RQ1字符级SMT模型在低资源、有噪声的数据集中减少未登录词(OOV)的效果如何?
  • RQ2在数据稀疏的环境下,字符对齐、短语表过滤与中间语言选择对翻译质量有何影响?
  • RQ3通过多中间语言生成合成数据是否优于使用单一中间语言的级联翻译?
  • RQ4词级与字符级BLEU分数与人工判断的相关性如何,尤其在考虑句子长度影响时?
  • RQ5字符级模型在应对拼写错误、词形变化及分词错误方面有多强的鲁棒性,这些错误在用户生成内容中很常见?

主要发现

  • 与词级模型相比,字符级SMT模型使未翻译词数减少40%以上,显著提升流畅性与信息保留率。
  • 在低数据环境下,字符级模型相比词级基线模型使BLEU分数提升2–3分,表明在平行数据有限时仍具强大竞争力。
  • 通过多中间语言生成合成数据的方法优于所有级联翻译设置,在基线基础上实现14个BLEU分数的提升。
  • 假设/参考句长比强烈影响BLEU分数:比值越接近1.0(如1.006)的模型,BLEU分数越高,这解释了人工排名与BLEU排名之间的差异。
  • 人工判断显示几乎完美的评分者一致性(Cohen’s Kappa > 0.83),但BLEU分数与人工判断并不完全相关,因其对句子长度敏感。
  • 字符级模型对词形变化、拼写错误与词边界错误具有高度鲁棒性,常见于字幕内容,能正确翻译罕见或未知形式(如'razveselam' → 'razveselya' → 'cheer you up')。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。