QUICK REVIEW
[论文解读] Simultaneous Speech-to-Speech Translation System with Neural Incremental ASR, MT, and TTS
Katsuhito Sudoh, Takatomo Kano|arXiv (Cornell University)|Nov 10, 2020
Natural Language Processing Techniques参考文献 31被引用 9
一句话总结
本文提出了一种用于英语到日语翻译的完全增量式神经语音到语音翻译系统,通过级联整合了神经增量自动语音识别(ASR)、机器翻译(MT)和文本到语音合成(TTS)模块。该系统在保持可接受的翻译质量的同时,实现了高达3秒的低处理延迟,标志着首次对具有延迟和质量指标的同步语音到语音翻译进行系统级评估。
ABSTRACT
This paper presents a newly developed, simultaneous neural speech-to-speech translation system and its evaluation. The system consists of three fully-incremental neural processing modules for automatic speech recognition (ASR), machine translation (MT), and text-to-speech synthesis (TTS). We investigated its overall latency in the system's Ear-Voice Span and speaking latency along with module-level performance.
研究动机与目标
- 开发一种实时、同步的语音到语音翻译系统,相比传统逐句处理方式,显著降低延迟。
- 通过在ASR、MT和TTS模块中实现增量处理,解决语音到语音翻译中高延迟的挑战。
- 在端到端翻译质量评估中,同时测量系统级延迟(耳-声跨度和说话延迟)与模块级性能。
- 研究ASR到MT的错误传播在实时环境中的影响,及其对翻译流畅性和充分性的影响。
提出的方法
- 系统采用三个完全增量式的神经模块级联:通过教师-学生蒸馏实现的增量ASR、使用wait-k解码的增量MT,以及基于音节短语边界触发的增量TTS。
- 每个模块以从左到右、符号同步的方式处理输入,实现最小等待时间的实时输出生成。
- ASR模块通过非增量教师模型进行训练,以提升增量推理性能。
- MT模块采用wait-k策略,延迟k个输入词元后开始解码,以平衡延迟与翻译质量。
- TTS模块在检测到下一个音节短语后启动合成,以最小化输出延迟。
- 系统级延迟通过耳-声跨度和说话延迟进行测量,模块级性能则通过WER、CER、BLEU和MOS进行评估。
实验结果
研究问题
- RQ1如何设计一个完全增量式的神经流水线,以实现实时、低延迟的同步语音到语音翻译?
- RQ2从增量ASR到增量MT的错误传播对翻译质量有何影响?
- RQ3增量MT中的wait-k策略如何影响延迟与翻译充分性之间的平衡?
- RQ4增量TTS在实时翻译中能在多大程度上保持自然性并最小化说话延迟?
- RQ5级联式增量语音到语音翻译系统的系统级延迟特性(耳-声跨度和说话延迟)如何?
主要发现
- 系统在所有模块中实现了最高约3秒的处理延迟,证明了实时同步翻译的可行性。
- 增量ASR的词错误率(WER)在Talk 1上为0.344,在Talk 2上为0.221,对应字符错误率(CER)分别为0.199和0.117。
- 增量MT的BLEU-4得分较低(Talk 1为3.5,Talk 2为4.9),表明由于领域和风格不匹配,自动评估面临显著挑战。
- 主观评估显示翻译充分性中等(1.76–1.94/5),流畅性中等(2.48–2.54/5),第二篇演讲的得分更高,表明性能具有领域依赖性。
- 增量TTS的平均意见得分(MOS)为2.34和2.55,表明自然度中等,第二篇演讲的得分更高。
- 翻译示例揭示了错误传播问题,例如将“dog”误译为“dark”,将“relief workers”误译为“another viewpoint”,凸显了实时上下文处理的挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。