Skip to main content
QUICK REVIEW

[论文解读] Simpler and Faster Learning of Adaptive Policies for Simultaneous Translation

Baigong Zheng, Renjie Zheng|arXiv (Cornell University)|Sep 4, 2019
Natural Language Processing Techniques参考文献 9被引用 4
一句话总结

本文提出了一种监督学习框架,通过从平行语料中提取的最优 READ/WRITE 动作序列,训练同时翻译的自适应策略,实现更快、更稳定的训练,并在不微调底层 NMT 模型的情况下提升翻译质量。该方法在低延迟下实现了高于先前方法的 BLEU 分数,使用单张 GPU 训练约 12 小时即可完成。

ABSTRACT

Simultaneous translation is widely useful but remains challenging. Previous work falls into two main categories: (a) fixed-latency policies such as Ma et al. (2019) and (b) adaptive policies such as Gu et al. (2017). The former are simple and effective, but have to aggressively predict future content due to diverging source-target word order; the latter do not anticipate, but suffer from unstable and inefficient training. To combine the merits of both approaches, we propose a simple supervised-learning framework to learn an adaptive policy from oracle READ/WRITE sequences generated from parallel text. At each step, such an oracle sequence chooses to WRITE the next target word if the available source sentence context provides enough information to do so, otherwise READ the next source word. Experiments on GermanEnglish show that our method, without retraining the underlying NMT model, can learn flexible policies with better BLEU scores and similar latencies compared to previous work.

研究动机与目标

  • 解决强化学习在训练同时翻译自适应策略时的不稳定性和低效性问题。
  • 克服固定延迟策略的局限性,后者因语言对之间的句法差异而需猜测未来内容。
  • 开发一种无需微调底层 NMT 模型即可学习灵活、可控策略的方法。
  • 使单一策略模型能够在推理时适应不同的延迟需求。
  • 从平行句子对中生成基于最优的 READ/WRITE 动作序列,用于监督策略训练。

提出的方法

  • 使用预训练的 NMT 模型为每对平行句子生成最优动作序列(READ/WRITE),其中动作由当前源语境是否足以预测下一个目标词来决定。
  • 当上下文不足以预测下一个目标词时定义为 READ 动作,当上下文足够充分时定义为 WRITE 动作。
  • 使用交叉熵损失在生成的动作序列上训练监督策略模型,直接基于当前源语境和目标语境预测下一步动作。
  • 通过调整阈值 ρ 控制推理时的延迟,该阈值决定在对下一个目标词的置信度达到何种水平时发出 WRITE 动作。
  • 推理时使用束搜索(beam search)结合学习到的策略,保持可控性与高效性。
  • 利用预训练的 NMT 模型进行解码,避免重新训练,同时实现更优性能。

实验结果

研究问题

  • RQ1监督学习框架能否在无需强化学习的情况下有效训练同时翻译的自适应策略?
  • RQ2从平行文本中生成的最优动作序列是否能带来优于基于强化学习或启发式方法的策略学习效果?
  • RQ3与固定延迟的 wait-k 策略相比,所提方法是否能在更低延迟下实现更高的翻译质量(BLEU)?
  • RQ4单一策略模型是否能在不重新训练的情况下泛化到不同的延迟需求?
  • RQ5在该设置下,监督学习的训练稳定性和效率与强化学习相比如何?

主要发现

  • 所提方法在低延迟下实现了高于 WIW、WID、基于强化学习以及推理时 wait-k 方法的 BLEU 分数,且无需微调底层 NMT 模型。
  • 该方法收敛速度更快、更稳定,使用单张 GPU 训练约 12 小时即可完成,而强化学习基线模型使用 8 张 GPU 耗时超过 600 小时,凸显了监督方法的效率优势。
  • 通过调整阈值 ρ,该方法在不同延迟设置下均保持优异性能,无需为不同延迟训练多个模型。
  • 训练过程稳定,未观察到显著发散或不稳定性,而强化学习基线偶尔虽取得高 BLEU 分数,但代价是极高的延迟。
  • 该方法优于推理时 wait-k 模型,后者此前报道存在小 k 值下输出过短或标点符号过多的问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。