[论文解读] Consecutive Decoding for Speech-to-text Translation
本文提出 COSTT,一种统一的端到端语音转文字翻译框架,采用连续解码机制,在单一解码器中联合生成源语音转录与目标语言翻译。通过利用预训练模型和辅助 CTC 监督,COSTT 减少了错误传播,并有效利用大规模平行机器翻译数据,在无需大量外部数据的情况下,在三个主要基准测试上实现了最先进性能。
Speech-to-text translation (ST), which directly translates the source language speech to the target language text, has attracted intensive attention recently. However, the combination of speech recognition and machine translation in a single model poses a heavy burden on the direct cross-modal cross-lingual mapping. To reduce the learning difficulty, we propose COnSecutive Transcription and Translation (COSTT), an integral approach for speech-to-text translation. The key idea is to generate source transcript and target translation text with a single decoder. It benefits the model training so that additional large parallel text corpus can be fully exploited to enhance the speech translation training. Our method is verified on three mainstream datasets, including Augmented LibriSpeech English-French dataset, IWSLT2018 English-German dataset, and TED English-Chinese dataset. Experiments show that our proposed COSTT outperforms or on par with the previous state-of-the-art methods on the three datasets. We have released our code at \url{https://github.com/dqqcasia/st}.
研究动机与目标
- 解决端到端语音转文字翻译模型中错误传播和数据利用有限的问题。
- 通过在单一框架内联合训练自动语音识别(ASR)与机器翻译(MT)组件,弥合级联式与端到端系统之间的差距。
- 在端到端 ST 训练中实现对大规模平行单语 MT 语料的有效利用,这在标准端到端模型中通常难以实现。
- 开发一种灵活的统一架构,在保持端到端优势的同时,融合级联系统的数据效率。
提出的方法
- COSTT 采用两阶段架构:第一阶段为声学-语义(AS)阶段,将语音特征编码为压缩表示;第二阶段为转录-翻译(TT)阶段。
- TT 阶段使用单一共享解码器,按连续序列生成源语言转录与目标语言翻译,实现联合建模。
- 模型在预训练阶段对音素级对齐应用 CTC 损失,以增强 ASR 监督,尽管推理阶段并不需要音素输出。
- 对解码器应用缩减操作,以降低计算成本并提升训练稳定性。
- 该框架支持解码器在 ASR 数据上预训练,并在 ST 数据上微调,从而实现从大规模 ASR 和 MT 语料中的迁移学习。
- 模型支持灵活推理:ASR 输出来自 TT 解码器的前半部分,而完整模型实现端到端 ST。
实验结果
研究问题
- RQ1统一的端到端框架能否在有效利用大规模平行 MT 数据的同时,联合建模语音识别与翻译?
- RQ2在单一解码器中采用连续解码是否相比级联或标准端到端模型能更有效地减少错误传播?
- RQ3在音素级对齐上应用辅助 CTC 监督是否能提升 ASR 质量,而无需在推理阶段显式输出音素?
- RQ4与级联式和端到端基线模型相比,所提框架在翻译质量与对转录错误的鲁棒性方面表现如何?
- RQ5模型在独立 ASR 和 MT 数据上预训练后,能在多大程度上受益,同时保持强大的 ST 性能?
主要发现
- COSTT 在三个主要基准测试上达到最先进性能:增强版 LibriSpeech 英法、IWSLT2018 英德和 TED 英中。
- 在增强版 LibriSpeech 英法测试集上,COSTT 的 BLEU 得分为 18.23,优于三阶段流水线(12.22)和两阶段流水线(17.58)。
- 在案例研究中,COSTT 正确翻译了基线模型漏译或误译的词汇,如 'yes' 和 'aboard',展现出更强的鲁棒性。
- 模型能从转录错误中恢复——例如将 'to day' 预测为 'today',但仍能生成正确翻译,表现出容错能力。
- CTC 监督与缩减操作的结合提升了训练稳定性,并实现了在 ASR 和 MT 数据上的有效预训练。
- COSTT 实现了大规模平行 MT 语料的利用,而这些语料在标准端到端 ST 模型中通常被低估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。