Skip to main content
QUICK REVIEW

[论文解读] fairseq S2T: Fast Speech-to-Text Modeling with fairseq

Changhan Wang, Yun Tang|arXiv (Cornell University)|Oct 11, 2020
Natural Language Processing Techniques参考文献 42被引用 92
一句话总结

本文介绍了 fairseq S2T,这是 fairseq 的一个扩展,用于端到端语音转文本任务,具备可扩展的数据处理、多样的模型支持(RNN/Transformer/Conformer)、在线/离线推理,以及与 MT/LM 的多任务学习整合。

ABSTRACT

We introduce fairseq S2T, a fairseq extension for speech-to-text (S2T) modeling tasks such as end-to-end speech recognition and speech-to-text translation. It follows fairseq's careful design for scalability and extensibility. We provide end-to-end workflows from data pre-processing, model training to offline (online) inference. We implement state-of-the-art RNN-based, Transformer-based as well as Conformer-based models and open-source detailed training recipes. Fairseq's machine translation models and language models can be seamlessly integrated into S2T workflows for multi-task learning or transfer learning. Fairseq S2T documentation and examples are available at https://github.com/pytorch/fairseq/tree/master/examples/speech_to_text.

研究动机与目标

  • 通过利用大规模未标注数据和跨任务监督(MT/LM),推动 ASR 和 ST 的端到端一体化 S2S 建模。
  • 在可扩展、可扩展的框架中提供从数据预处理到训练与推理的端到端工作流。
  • 提供前沿模型支持(RNN、Transformer、Conformer)及可复现的详细训练方案。
  • 实现将 fairseq MT 模型和语言模型整合到 S2T 工作流中,以实现多任务和迁移学习。

提出的方法

  • 在 fairseq 中扩展包含 ASR 与 ST 的 S2T 任务。
  • 支持 RNN、Transformer 和 Conformer 架构,并为 ASR 提供 CTC 选项。
  • 提供在线线性同时 ST 的策略(单调注意力变体、wait-k、单调无限回看、单调多头注意力)。
  • 通过 PyKaldi 或 torchaudio 提取符合 Kaldi 的特征来实现数据预处理的自动化,支持可选的预计算和 ZIP 打包以提升 I/O 效率。
  • 提供文本数据分词选项(Moses、SentencePiece、subword-nmt、字节级 BPE、字节),以及基于 YAML 的数据配置。
  • 通过 simuleval 集成评估指标(WER、BLEU、chrF)和同时 ST 指标(AL、DAL),并提供 VizSeq 可视化和 TensorBoard 监控。
  • 利用基于 PyTorch 的可扩展训练(混合精度、多GPU、多机)并提供现成的训练方案。
  • 允许在 S2T 工作流中无缝重用 fairseq MT 模型和语言模型进行多任务或迁移学习。

实验结果

研究问题

  • RQ1在使用不同 backbone 模型的情况下,fairseq S2T 在端到端 ASR 和 ST 基准测试(如 LibriSpeech、MuST-C、CoVoST 2)上的表现如何?
  • RQ2与双语或单任务设置相比,多语言训练和跨任务监督是否能提升 S2T 的性能?
  • RQ3自监督特征(SSL,如 wav2vec)对多语言 S2T 性能和迁移能力有何影响?
  • RQ4在线并行 ST 模型在不同语言方向上如何权衡延迟(AL)与翻译质量?
  • RQ5与其他工具包相比,fairseq S2T 在可扩展性、可重复性以及与 MT/LM 模型的集成方面表现如何?

主要发现

  • Fairseq S2T 提供端到端的 S2T 工作流,且基于前沿的 RNN、Transformer 和 Conformer 模型。
  • 采用 wait-k 和单调注意力等策略的在线并行 ST 模型,在 MuST-C 上展示了具有竞争力的时延与准确率权衡。
  • 在多种语言上训练的多语言 S2T 模型在若干方向上能超越双语模型,显示出强迁移性。
  • 基于 Transformer 的 S2T 模型在 CoVoST 2 的 En–X 和 X–En 方向上优于基于 RNN 的模型,并在低资源和多语言设置中受自监督特征带来收益。
  • CW-Lg(基于 Conformer 的 wav2vec)在 LibriSpeech WER 上具有竞争力,显示出在 fairseq S2T 框架内强大的 ASR 性能。
  • fairseq S2T 集成 MT 和 LM 组件,以实现多任务学习和迁移学习,提升整体 S2T 性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。