Skip to main content
QUICK REVIEW

[论文解读] End-to-End Automatic Speech Translation of Audiobooks

Alexandre Bérard, Laurent Besacier|arXiv (Cornell University)|Feb 12, 2018
Natural Language Processing Techniques参考文献 20被引用 126
一句话总结

本文提出了一种用于英语到法语有声读物的端到端自动语音翻译(AST)模型,基于包含236小时对齐英语语音与法语翻译的增强版LibriSpeech语料库。该研究对比了级联的ASR+MT系统与端到端模型,后者在训练期间完全跳过源语言转录或仅在训练期间使用转录,结果表明预训练和多任务学习可提升性能,尽管在真实语音上级联系统仍优于端到端模型。

ABSTRACT

We investigate end-to-end speech-to-text translation on a corpus of audiobooks specifically augmented for this task. Previous works investigated the extreme case where source language transcription is not available during learning nor decoding, but we also study a midway case where source language transcription is available at training time only. In this case, a single model is trained to decode source speech into target text in a single pass. Experimental results show that it is possible to train compact and efficient end-to-end speech translation models in this setup. We also distribute the corpus and hope that our speech translation baseline on this corpus will be challenged in the future.

研究动机与目标

  • 在大规模真实世界有声读物语料库上研究端到端语音到文本翻译,该语料库包含平行语音与目标文本。
  • 比较在训练期间不使用源语言转录或仅在训练期间使用转录的端到端AST模型的性能。
  • 为未来基于新创建并公开可用的有声读物语料库的端到端AST研究建立强基准。
  • 评估预训练与多任务学习在提升紧凑型端到端AST模型性能方面的有效性。
  • 证明即使在源转录信息有限的情况下,端到端模型在真实语音上仍可实现具有竞争力的性能。

提出的方法

  • 通过将英语有声读物语音与法语电子书翻译对齐,扩充LibriSpeech语料库,生成236小时的平行语音与目标文本。
  • 使用结合卷积层与双向LSTM的混合语音编码器,从原始音频(MFCC)中提取分层特征。
  • 实现基于字符的解码器,采用条件LSTM与全局注意力机制,逐个令牌生成目标文本。
  • 使用单一编码器-解码器架构训练端到端AST模型,通过共享编码器与ASR、解码器与MT实现多任务学习。
  • 通过交替更新AST、ASR与MT任务实现多任务训练,其中60%的更新用于AST,各20%用于ASR与MT。
  • 使用变 dropout 与输入截断(语音1400帧,文本300字符)以管理训练稳定性与内存约束。

实验结果

研究问题

  • RQ1端到端语音到文本翻译模型是否能在不依赖推理阶段源语言转录的情况下,实现在真实有声读物语音上的有竞争力性能?
  • RQ2在训练期间可访问源语言转录是否能提升端到端AST模型的性能,相较于完全端到端设置?
  • RQ3预训练与多任务学习在大规模真实语音上对紧凑型端到端AST模型性能的提升程度如何?
  • RQ4端到端AST模型在真实有声读物语音上的性能与级联ASR+MT流水线相比如何?
  • RQ5所提出的增强版LibriSpeech语料库是否可作为未来端到端AST研究的可行且具有挑战性的基准?

主要发现

  • 在BTEC合成语料库上,级联ASR+MT系统取得43.8的BLEU分数,优于最佳端到端模型(37.9 BLEU)与预训练模型(40.4 BLEU)。
  • 在真实有声读物语料库(增强版LibriSpeech)上,级联模型取得15.8 BLEU,而最佳端到端模型达到15.5 BLEU,表明在具有挑战性的现实数据上表现强劲。
  • 预训练显著加速收敛:预训练模型在仅12.9万步后即达到13.3 BLEU,而端到端模型需36.9万步才达到该性能。
  • 当与预训练结合时,多任务训练未进一步提升性能,表明在此设置下仅预训练已足够实现更快收敛。
  • 使用基于字符的解码器相比先前工作有所改进:1040万参数的端到端模型在BTEC上取得31.3 BLEU,优于先前研究的29.1 BLEU。
  • 该语料库具有挑战性:即使Google Translate在LibriSpeech测试集上也仅取得22.2 BLEU,表明在真实有声读物语音上实现高质量翻译仍具难度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。