Skip to main content
QUICK REVIEW

[论文解读] Decoding and Diversity in Machine Translation

Nicholas Roberts, Davis Liang|arXiv (Cornell University)|Nov 26, 2020
Natural Language Processing Techniques参考文献 19被引用 15
一句话总结

本文研究神经机器翻译(NMT)中BLEU分数优化与翻译多样性之间的权衡,表明束搜索解码虽然提升了BLEU分数,却严重降低了输出多样性,并加剧了性别代词偏见。本文引入了一套分布性诊断方法,显示标签平滑和束搜索在n-gram、标点符号、复制率以及基于BERT的判别能力方面均降低了与人类参考翻译的相似性,而温度为1.0的采样方法产生的输出最接近人类水平。

ABSTRACT

Neural Machine Translation (NMT) systems are typically evaluated using automated metrics that assess the agreement between generated translations and ground truth candidates. To improve systems with respect to these metrics, NLP researchers employ a variety of heuristic techniques, including searching for the conditional mode (vs. sampling) and incorporating various training heuristics (e.g., label smoothing). While search strategies significantly improve BLEU score, they yield deterministic outputs that lack the diversity of human translations. Moreover, search tends to bias the distribution of translated gender pronouns. This makes human-level BLEU a misleading benchmark in that modern MT systems cannot approach human-level BLEU while simultaneously maintaining human-level translation diversity. In this paper, we characterize distributional differences between generated and real translations, examining the cost in diversity paid for the BLEU scores enjoyed by NMT. Moreover, our study implicates search as a salient source of known bias when translating gender pronouns.

研究动机与目标

  • 研究神经机器翻译输出中高BLEU分数与低多样性之间的权衡。
  • 识别束搜索和标签平滑作为导致翻译多样性降低和性别代词翻译偏见增加的关键因素。
  • 开发并应用一组分布性诊断工具,以衡量生成输出与人类参考翻译之间的相似性。
  • 利用TF-IDF和基于BERT的判别器评估模型输出的可判别性,以评估其自然性。
  • 质疑当模型缺乏人类般多样性时,使用人类水平BLEU作为基准的合理性。

提出的方法

  • 作者在WMT 2017德语-英语、英语-德语以及WMT 2014法语-英语翻译数据集上,对比了贪婪解码、束搜索和不同温度下的采样策略。
  • 他们引入了一组多样性诊断指标:n-gram L1距离、句长分布、标点符号频率、复制率(超过50%的词元重叠)以及性别代词表征。
  • 他们使用TF-IDF逻辑回归和微调后的BERT(108M参数)作为判别器,以区分生成翻译与真实参考翻译。
  • 他们评估了标签平滑对多样性与BLEU的影响,比较了在不同解码策略下,是否使用标签平滑训练的模型。
  • 他们计算了模型输出与真实参考之间的分布相似性度量,以训练-验证集中的参考句作为基线。
  • 他们将复制率定义为生成句子中与源句有超过50%词元重叠(排除标点符号和数字)的占比。

实验结果

研究问题

  • RQ1束搜索解码在n-gram、句长、标点符号和复制率方面,如何影响NMT输出与人类参考翻译之间的分布相似性?
  • RQ2标签平滑在多大程度上降低了NMT输出与人类参考之间的分布相似性?这种影响如何随解码策略而变化?
  • RQ3束搜索与采样在保留性别代词表征和避免误指性别方面表现如何比较,特别是在训练数据不平衡的情况下?
  • RQ4基于TF-IDF或BERT特征训练的判别器能否可靠地区分生成翻译与真实翻译?这种区分能力如何随解码方法而变化?
  • RQ5当NMT系统产生确定性、非多样化的输出,且与人类翻译分布显著偏离时,为何人类水平BLEU是一个不可靠的基准?

主要发现

  • 在完全训练的模型上,束搜索解码使BLEU分数比采样高出14分,但在n-gram、句长、标点符号和复制率方面,与人类参考翻译的分布相似性显著降低。
  • 温度为1.0的采样生成的输出在n-gram频率、标点符号使用和复制率方面,与人类参考翻译的分布最为相似,几乎与训练集的复制率相当。
  • 束搜索增加了性别代词翻译中的误指率:它放大了训练数据中更常见性别的偏见,例如在德语-英语翻译中偏向使用'she',在法语-英语翻译中偏向使用'he'。
  • 标签平滑降低了输出与人类参考之间的分布相似性,并增加了输出的可判别性——尤其在与束搜索结合时,使基于TF-IDF和BERT的判别器更容易将生成文本分类为'非人类'。
  • 基于BERT的判别器在区分生成与真实翻译方面优于TF-IDF逻辑回归,但即使表现最佳的模型(温度T=1.0采样)也无法可靠地将样本分类为'生成',前提是模型未使用束搜索。
  • 本研究表明,束搜索和标签平滑虽然提升了BLEU分数,却以牺牲多样性与增加偏见为代价,从而削弱了人类水平BLEU作为性能基准的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。