Skip to main content
QUICK REVIEW

[论文解读] Structured-based Curriculum Learning for End-to-end English-Japanese Speech Translation

Takatomo Kano, Sakriani Sakti|arXiv (Cornell University)|Feb 13, 2018
Natural Language Processing Techniques参考文献 14被引用 7
一句话总结

本文提出一种基于结构化课程学习(CL)的方法,用于端到端英语-日语语音翻译,先在语音识别任务上训练基于注意力机制的编码器-解码器模型,随后逐步在机器翻译任务上继续训练,最后微调以实现直接的语音到文本翻译。该方法显著提升了标准端到端模型的翻译质量,其中最佳的CL模型在合成英语-日语数据集上的表现优于基于文本的MT系统和级联的ASR+MT系统。

ABSTRACT

Sequence-to-sequence attentional-based neural network architectures have been shown to provide a powerful model for machine translation and speech recognition. Recently, several works have attempted to extend the models for end-to-end speech translation task. However, the usefulness of these models were only investigated on language pairs with similar syntax and word order (e.g., English-French or English-Spanish). In this work, we focus on end-to-end speech translation tasks on syntactically distant language pairs (e.g., English-Japanese) that require distant word reordering. To guide the encoder-decoder attentional model to learn this difficult problem, we propose a structured-based curriculum learning strategy. Unlike conventional curriculum learning that gradually emphasizes difficult data examples, we formalize learning strategies from easier network structures to more difficult network structures. Here, we start the training with end-to-end encoder-decoder for speech recognition or text-based machine translation task then gradually move to end-to-end speech translation task. The experiment results show that the proposed approach could provide significant improvements in comparison with the one without curriculum learning.

研究动机与目标

  • 为解决在句法差异较大的语言对(如英语-日语)上训练端到端语音翻译模型的挑战,此类语言对需要长距离的词语重排。
  • 通过引入结构化课程学习策略,克服直接端到端训练在语音到文本翻译中出现的不稳定性和收敛性差的问题。
  • 通过避免级联的ASR和MT系统,减少自动语音识别(ASR)中的错误传播,并保留副语言信息。
  • 通过从简单任务逐步过渡到复杂任务,提升模型的泛化能力和训练稳定性。

提出的方法

  • 该方法采用结构化课程学习策略,首先在端到端自动语音识别(ASR)任务上开始训练,随后过渡到基于文本的机器翻译(MT)任务,最后在端到端语音翻译(ST)任务上进行微调。
  • 训练过程分阶段进行:首先在ASR任务上(源语言的语音到文本),然后在MT任务上(文本到文本翻译),最后在端到端ST任务上(目标语言的语音到文本)进行微调。
  • 探索了两种CL变体:快速路径(渐进式过渡)和慢速路径(更渐进的适应),后者表现出更好的收敛性。
  • 网络架构采用基于注意力机制的编码器-解码器,所有任务共享超参数,包括2层LSTM、512个隐藏单元,以及使用固定初始学习率0.001的Adam优化器。
  • CL模型结合了ASR和MT编码器与解码器的组件,其中ASR编码器作为去噪组件,防止MT阶段出现过拟合。
  • 训练过程通过softmax交叉熵损失进行监控,性能通过BLEU+1指标评估翻译质量。

实验结果

研究问题

  • RQ1基于结构化的课程学习能否提升在英语-日语端到端语音翻译中的训练稳定性和性能,尤其是在词序差异(SVO vs. SOV)构成主要挑战的情况下?
  • RQ2在端到端ST任务上微调之前,对ASR和MT任务进行预训练,是否能带来比直接端到端训练更好的泛化能力?
  • RQ3为何慢速路径CL策略优于快速路径?CL类型2为何在收敛上失败?
  • RQ4在CL框架中整合ASR和MT组件如何影响模型的鲁棒性和抗错误能力?
  • RQ5从简单任务逐步过渡到复杂任务的课程学习方法,是否能超越级联ASR+MT系统在语音翻译中的性能?

主要发现

  • 直接端到端ST模型的训练表现最差,从第1个epoch到第15个epoch,softmax交叉熵损失仅下降0.04,表明收敛性极差。
  • 基于CL的模型(CL类型1 - 慢速路径)取得了最佳翻译性能,其BLEU+1得分超过基于文本的MT系统和级联的ASR+MT系统。
  • CL类型1 - 快速路径模型相比直接ST基线有显著提升,证明了课程学习的有效性。
  • CL类型2模型未能收敛,可能是因为基于文本的MT编码器与基于语音的ASR编码器之间存在较大的分布偏移。
  • ASR系统达到了9.4%的词错误率,证实了语音识别预训练组件的质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。