Skip to main content
QUICK REVIEW

[论文解读] Synchronous Speech Recognition and Speech-to-Text Translation with Interactive Decoding

Yuchen Liu, Jiajun Zhang|arXiv (Cornell University)|Dec 16, 2019
Natural Language Processing Techniques参考文献 27被引用 9
一句话总结

本文提出一种交互式、同步的端到端模型,用于联合自动语音识别(ASR)与语音到文本翻译(ST),通过交互注意力机制实现在两个任务之间的双向信息流动。通过允许每个任务通过等待-$k$策略关注对方生成的输出,该模型在不增加参数量的前提下,提升了ASR与ST的性能,在多个语言对的TED语音翻译基准上实现了最先进结果。

ABSTRACT

Speech-to-text translation (ST), which translates source language speech into target language text, has attracted intensive attention in recent years. Compared to the traditional pipeline system, the end-to-end ST model has potential benefits of lower latency, smaller model size, and less error propagation. However, it is notoriously difficult to implement such a model without transcriptions as intermediate. Existing works generally apply multi-task learning to improve translation quality by jointly training end-to-end ST along with automatic speech recognition (ASR). However, different tasks in this method cannot utilize information from each other, which limits the improvement. Other works propose a two-stage model where the second model can use the hidden state from the first one, but its cascade manner greatly affects the efficiency of training and inference process. In this paper, we propose a novel interactive attention mechanism which enables ASR and ST to perform synchronously and interactively in a single model. Specifically, the generation of transcriptions and translations not only relies on its previous outputs but also the outputs predicted in the other task. Experiments on TED speech translation corpora have shown that our proposed model can outperform strong baselines on the quality of speech translation and achieve better speech recognition performances as well.

研究动机与目标

  • 为解决端到端语音翻译中流水线和多任务学习方法的局限性,这些方法存在错误传播、缺乏跨任务信息共享以及效率低下等问题。
  • 克服两阶段模型效率低下的问题,这些模型按顺序处理识别与翻译,导致推理延迟并限制双向信息流动。
  • 在单一模型中实现实时同步、交互式地生成转录与翻译,通过相互监督提升ASR与ST的质量。
  • 设计一种等待-$k$策略,以在延迟与性能之间取得平衡,使翻译能访问更多转录上下文,同时保持实时处理能力。
  • 证明联合学习结合交互注意力优于强基线模型,包括流水线模型、端到端模型、多任务模型和两阶段模型。

提出的方法

  • 引入一种交互注意力机制,使ST解码器能够同时关注语音编码器和ASR生成的转录内容,反之亦然,即ASR解码器也关注ST的输出。
  • 为两个任务使用共享编码器,ASR与ST分别拥有独立的解码器,通过在每个解码步骤中交换隐藏状态实现交互注意力。
  • 应用等待-$k$策略,即ST解码器在ASR解码器启动后$k$步才开始生成输出,从而在翻译过程中访问更多已转录的词汇。
  • 采用多任务学习,共享编码器参数,但与标准多任务学习不同,通过注意力机制实现实时解码器之间的动态信息交换。
  • 使用联合损失函数进行端到端训练,结合ASR与ST目标,采用束搜索解码,确保两个任务之间的同步性。
  • 采用约束解码策略,确保转录与翻译以同步、交错的方式生成。

实验结果

研究问题

  • RQ1ASR与ST之间是否存在双向信息流,能够使两项任务的性能超越标准多任务学习?
  • RQ2采用等待-$k$策略的同步交互解码是否能在不降低识别性能的前提下提升翻译质量?
  • RQ3单一模型能否比两阶段或流水线系统更高效地联合生成转录与翻译?
  • RQ4等待-$k$策略如何影响端到端ST中延迟与翻译质量之间的权衡?
  • RQ5与独立的ASR或ST模型相比,交互注意力在多大程度上能减少错误传播?

主要发现

  • 所提出的交互学习模型在四种语言对(英德、英法、英中、英日)的语音识别与语音翻译任务中均达到最先进性能,优于流水线、端到端、多任务和两阶段基线模型。
  • 当$k=3$时,等待-$k$策略取得最佳整体性能,在英中翻译任务中,BLEU分数相比基线端到端模型最高提升2.1分。
  • 模型参数量为61.2M,与端到端和多任务模型相当,同时推理速度显著快于两阶段模型(11.98 vs. 7.44句每秒)。
  • 交互模型的训练速度为每秒4.23步,快于两阶段模型(1.13步每秒),且与端到端模型相当。
  • 案例研究显示,该模型能正确转录和翻译复杂短语如“the biggest challenges”和“brainstormed on solutions”,而基线模型因误识别或翻译错误而失败。
  • 通过利用相互上下文,模型减少了错误传播:转录内容辅助翻译,翻译内容则引导识别,尤其在声学上下文模糊时表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。