Skip to main content
QUICK REVIEW

[论文解读] Active Learning for Massively Parallel Translation of Constrained Text into Low Resource Languages

Zhong Zhou, Alex Waibel|arXiv (Cornell University)|Aug 16, 2021
Natural Language Processing Techniques参考文献 48被引用 7
一句话总结

本文提出一种针对大规模并行神经机器翻译中低资源语言的主动学习随机采样方法,优于传统的基于部分的人工翻译策略。通过在《圣经》中随机采样约1,000行进行训练,并结合人工校对和词汇扩展迭代更新模型,该方法在英语翻译中实现+8.5 BLEU的提升,在东波科姆奇语中实现+1.9 BLEU的提升,其中词汇更新被证明至关重要,而通过完整草稿预训练实现的自监督则具有负面影响。

ABSTRACT

We translate a closed text that is known in advance and available in many languages into a new and severely low resource language. Most human translation efforts adopt a portion-based approach to translate consecutive pages/chapters in order, which may not suit machine translation. We compare the portion-based approach that optimizes coherence of the text locally with the random sampling approach that increases coverage of the text globally. Our results show that the random sampling approach performs better. When training on a seed corpus of ~1,000 lines from the Bible and testing on the rest of the Bible (~30,000 lines), random sampling gives a performance gain of +11.0 BLEU using English as a simulated low resource language, and +4.9 BLEU using Eastern Pokomchi, a Mayan language. Furthermore, we compare three ways of updating machine translation models with increasing amount of human post-edited data through iterations. We find that adding newly post-edited data to training after vocabulary update without self-supervision performs the best. We propose an algorithm for human and machine to work together seamlessly to translate a closed text into a severely low resource language.

研究动机与目标

  • 为解决在极低资源语言中以最少人工投入翻译封闭受限文本的挑战。
  • 比较在低资源机器翻译中,基于部分的人工翻译策略与随机采样在种子语料选择方面的有效性。
  • 评估在低资源环境下,利用人工校对数据和词汇适应进行迭代模型更新策略的效果。
  • 开发一种联合人机工作流程,以在保持连贯性和覆盖度的同时加速翻译质量提升。

提出的方法

  • 采用随机采样策略从封闭文本(如《圣经》)中选取约1,000行作为初始种子语料,优先考虑全局覆盖度而非局部连贯性。
  • 所提出的算法在多源、多目标模型的机器翻译与人工对选定文本部分的校对之间交替进行,分轮迭代执行。
  • 模型更新结合新校对数据与词汇扩展,避免对完整翻译草稿进行预训练,以防止性能下降。
  • 通过保留测试集上的BLEU分数评估翻译质量,并在迭代过程和不同语言体裁中跟踪性能表现。
  • 通过结合多个源语言的翻译结果,计算中心度指标,以在人工审查前提升草稿质量。
  • 工作流程基于词汇多样性增加和模型不确定性,动态选择下一轮需校对的文本部分。

实验结果

研究问题

  • RQ1在低资源机器翻译中,随机采样作为种子语料选择方法是否优于传统的基于部分的方法?
  • RQ2在低资源环境下,结合人工校对和词汇适应的迭代模型更新策略如何影响翻译质量?
  • RQ3与通过词汇扩展进行渐进式更新相比,对完整翻译草稿进行自监督预训练对性能有何影响?
  • RQ4封闭文本内部不同体裁(如文学体裁)如何影响翻译性能和学习效率?
  • RQ5联合人机工作流程是否能在极低资源语言中以最少人工输入实现高质量翻译?

主要发现

  • 在将《圣经》翻译为英语(模拟低资源语言)时,随机采样方法相比基线方法实现+8.5 BLEU的性能提升,优于基于部分的方法。
  • 对于玛雅语系的东波科姆奇语,该随机采样方法相比基线实现+1.9 BLEU的提升,证明其在真实低资源环境下的有效性。
  • 结合新校对数据的词汇更新显著提升性能,其中“更新词汇”(Updated-Vocab)优于“旧词汇”(Old-Vocab),且两者均优于基线模型。
  • 尽管理论上具有吸引力,但通过完整翻译草稿进行自监督预训练会损害性能,应避免使用。
  • 性能提升在不同书目间分布不均,哲学性和诗歌体裁的文本(如《箴言》和《雅歌》)在训练数据达到约20%后迅速改善。
  • 部分书目(如《提摩太》)即使在训练了33本书的数据后仍难以翻译,表明学习效果存在显著的体裁与风格依赖性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。