Skip to main content
QUICK REVIEW

[论文解读] The HW-TSC's Offline Speech Translation Systems for IWSLT 2021 Evaluation

Minghan Wang, Yuxia Wang|arXiv (Cornell University)|Aug 9, 2021
Natural Language Processing Techniques参考文献 20被引用 5
一句话总结

本论文提出了一种用于 IWSLT 2021 评估的级联式离线语音翻译系统,结合了说话人分割、使用源特定标签([LS]、[MC]、[CV])的多源训练 Transformer ASR 模型,以及在 WMT 预训练并经 TED 微调的 NMT 模型。该系统在 IWSLT 2021 测试集上取得了 24.6 的 BLEU 分数,证明了多源训练和领域特定微调的有效性。

ABSTRACT

This paper describes our work in participation of the IWSLT-2021 offline speech translation task. Our system was built in a cascade form, including a speaker diarization module, an Automatic Speech Recognition (ASR) module and a Machine Translation (MT) module. We directly use the LIUM SpkDiarization tool as the diarization module. The ASR module is trained with three ASR datasets from different sources, by multi-source training, using a modified Transformer encoder. The MT module is pretrained on the large-scale WMT news translation dataset and fine-tuned on the TED corpus. Our method achieves 24.6 BLEU score on the 2021 test set.

研究动机与目标

  • 开发一种基于级联架构的稳健离线语音翻译系统,用于 IWSLT 2021 评估。
  • 通过显式的数据源标记实现多源训练,提升 ASR 在多样化语音领域中的泛化能力。
  • 通过大规模 WMT 新闻数据预训练并结合 TED 语料微调,提升翻译质量。
  • 评估多源训练和领域特定微调对 ASR 与 MT 性能的影响。
  • 在使用受限和非受限资源的条件下,实现在 IWSLT 2021 测试集上的最先进性能。

提出的方法

  • 系统使用 LIUM SpkDiarization 进行说话人分割,随后采用基于 Transformer 的 ASR 模型,用 1D 卷积层替代词嵌入,以更好地建模音频特征。
  • 通过在 ASR 训练期间将源特定标签([LS]、[MC]、[CV])作为首个 token 注入,实现多源训练,使模型能够根据数据分布和风格进行条件化。
  • 在推理阶段,强制模型使用 [MC] 标签进行解码,以匹配 IWSLT 测试集的 TED 演讲风格。
  • MT 模型在 WMT 新闻平行语料和回译单语语料上进行预训练,随后在 TED 语料上进行微调以实现领域适应。
  • 最终系统采用模型集成,并通过 SLT.KIT 工具包进行评估,指标包括 BLEU、TER、BEER 和 CharacTER。
  • 所有模型均使用 Adam 优化器、学习率调度和 CMVN 归一化训练;ASR 使用频谱增强,训练使用 4 块 V100 GPU,共 50 个周期。

实验结果

研究问题

  • RQ1显式源标签的多源训练在多样化语音领域中如何提升 ASR 性能?
  • RQ2在大规模 WMT 数据上预训练并结合 TED 语料微调对语音翻译有何影响?
  • RQ3与端到端模型相比,该级联系统在 IWSLT 2021 测试集上的 BLEU 分数表现如何?
  • RQ4为何多源训练在 LibriSpeech 上性能下降,尽管其在 MuST-C 和 CoVoST 上表现提升?
  • RQ5领域特定微调在多大程度上提升了目标领域测试集上的翻译质量?

主要发现

  • 该系统在 IWSLT 2021 测试集上取得了 24.6 的 BLEU 分数,表明其在离线语音翻译任务中表现强劲。
  • 多源训练显著改善了 MuST-C(15.64 vs. 17.23)和 CoVoST(29.25 vs. 31.08)的 ASR WER,尤其在混合训练设置下;然而在 LibriSpeech 上性能下降(3.57 vs. 3.32)。
  • 在 TED 语料上微调 NMT 模型后,开发集 dev2010 的 BLEU 分数从 31.0 提升至 33.1,证实了领域适应的价值。
  • 采用多源标签训练的模型展现出更好的风格泛化能力,尤其得益于 MuST-C 与 CoVoST 在口语风格和标点处理上的相似性。
  • tst2018 上性能下降(29.9 BLEU)被归因于从讲座到 TED 演讲的领域偏移,凸显了分布外数据的挑战。
  • 集成两个微调后的 NMT 模型提升了翻译质量,表明在序列生成任务中模型平均具有优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。