[论文解读] Fused Acoustic and Text Encoding for Multimodal Bilingual Pretraining and Speech Translation
该论文提出了一种融合语音与文本掩码语言建模(Fused Acoustic and Text Masked Language Modeling, FAT-MLM)的统一表示学习框架,该框架联合编码来自多样化数据源(包括单语、语音识别和机器翻译语料)的语音与文本。通过在FAT-MLM上进行微调,端到端的融合语音与文本语音翻译(Fused Acoustic and Text Speech Translation, FAT-ST)模型实现了最先进性能,在三个语言对上BLEU分数最高提升+5.9,且推理速度更快、模型参数更小,优于级联系统。
Recently, representation learning for text and speech has successfully improved many language related tasks. However, all existing methods suffer from two limitations: (a) they only learn from one input modality, while a unified representation for both speech and text is needed by tasks such as end-to-end speech translation, and as a result,(b) they can not exploit various large-scale text and speech data and their performance is limited by the scarcity of parallel speech translation data.To address these problems, we propose a Fused Acoustic and Text Masked Language Model (FAT-MLM) which jointly learns a unified representation for both acoustic and text input from various types of corpora including parallel data for speech recognition and machine translation, and even pure speech and text data. Within this cross-modal representation learning framework, we further present an end-to-end model for Fused Acoustic and Text Speech Translation (FAT-ST). Experiments on three translation directions show that by fine-tuning from FAT-MLM, our proposed speech translation models substantially improve translation quality by up to +5.9 BLEU.
研究动机与目标
- 为解决现有预训练方法仅处理单一模态(语音或文本)的局限性,本工作提出一种面向两种模态的统一表示学习框架。
- 通过利用丰富的单语文本、语音识别和机器翻译数据,缓解平行语音翻译数据稀缺的问题。
- 通过共享的编码器-解码器架构,使端到端语音翻译模型能够从多样化预训练数据中获益。
- 在保持低延迟和更小模型尺寸的前提下,实现端到端语音翻译的最先进性能,优于级联系统。
提出的方法
- FAT-MLM通过在来自多种语料(包括平行语音翻译、语音识别和机器翻译数据)的混合语音与文本输入上进行掩码语言建模,联合预训练统一编码器。
- 该模型使用共享的基于Transformer的编码器处理声学特征和文本嵌入,并为两种模态分别设置掩码预测目标。
- 在FAT-MLM编码器之上构建了一个序列到序列的融合语音与文本语音翻译(Fused Acoustic and Text Speech Translation, FAT-ST)模型,实现语音识别与翻译的联合学习。
- FAT-ST模型采用多种目标进行训练:掩码声学建模、掩码文本建模以及序列到序列翻译损失。
- 在单语语音和文本数据上进行额外预训练,进一步提升泛化能力和性能。
- 该框架支持端到端训练并共享参数,相比级联系统具有更快的推理速度和更少的误差传播。
实验结果
研究问题
- RQ1统一表示模型能否有效从包括单语、语音识别和机器翻译数据在内的多种类型数据中同时学习语音与文本输入?
- RQ2与仅在稀缺平行语音翻译数据上训练的模型相比,对异构语音与文本数据进行联合预训练是否能提升端到端语音翻译性能?
- RQ3所提出的FAT-MLM框架能否使单一端到端模型在具备竞争力的性能与速度下同时完成语音识别与翻译?
- RQ4在额外非平行数据(如单语文本和语音)上进行预训练,对最终语音翻译性能的提升程度如何?
- RQ5所提出的FAT-ST模型是否在性能上可媲美强大多阶段级联系统,同时保持更低延迟和更小模型尺寸?
主要发现
- 在Must-C数据集上,FAT-ST在三种翻译方向上通过FAT-MLM微调后,相比基线模型BLEU分数最高提升+5.9。
- 该模型在英语到德语、英语到法语以及英语到中文的语音翻译任务中均达到最先进性能,优于强大多阶段基线模型。
- 通过在单语语音和文本数据上进行额外预训练,FAT-ST性能进一步提升+1.25 BLEU,证明了数据效率的优势。
- FAT-ST的解码速度接近级联系统2倍快,因为它避免了等待独立的自动语音识别(ASR)模块。
- 消融实验证实,所有组件——FAT-MLM预训练、共享编码器和多目标训练——对性能均有显著贡献。
- 在英语到中文任务中,FAT-ST达到25.49的字符级BLEU,优于先前模型(如ST*:22.07)和级联系统(21.36)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。