[论文解读] Multi-Modal Data Augmentation for End-to-End ASR
本文提出多模态数据增强(MMDA),一种端到端自动语音识别(ASR)框架,通过联合训练声学输入与合成符号输入(例如音素序列)来利用大规模文本语料提升性能。通过在声学与符号编码器之间共享注意力机制和解码器组件,MMDA 在基线模型基础上实现了最高达10%的相对词错误率(WER)降低,尤其在采用模拟音素时长的Rep-Phonestream增强方法时表现更优。
We present a new end-to-end architecture for automatic speech recognition (ASR) that can be trained using \emph{symbolic} input in addition to the traditional acoustic input. This architecture utilizes two separate encoders: one for acoustic input and another for symbolic input, both sharing the attention and decoder parameters. We call this architecture a multi-modal data augmentation network (MMDA), as it can support multi-modal (acoustic and symbolic) input and enables seamless mixing of large text datasets with significantly smaller transcribed speech corpora during training. We study different ways of transforming large text corpora into a symbolic form suitable for training our MMDA network. Our best MMDA setup obtains small improvements on character error rate (CER), and as much as 7-10\% relative word error rate (WER) improvement over a baseline both with and without an external language model.
研究动机与目标
- 通过利用大规模文本语料,在有限的语音数据集上提升端到端ASR的性能。
- 解决端到端模型与传统系统在较小基准数据集(如Librispeech和Fisher)上的性能差距。
- 通过将文本转化为模拟声学特征的符号化输入,探索ASR中的多模态数据增强方法。
- 在不修改解码流程的前提下,实现与外部语言模型的无缝集成。
- 探究合成符号化输入是否能提升端到端ASR的鲁棒性与泛化能力。
提出的方法
- MMDA模型采用两个独立编码器:一个用于声学特征,另一个用于符号化输入(如字符或音素序列),二者共享相同的注意力机制和解码器。
- 符号化输入通过三种方式生成:Charstream(原始字符)、Phonestream(通过G2P生成音素)以及Rep-Phonestream(基于真实语音统计建模音素时长的音素)。
- 增强编码器处理嵌入的符号化标记,并通过共享注意力机制将生成的上下文表征与声学表征进行融合。
- 采用多任务训练策略,使用配对数据进行训练:真实语音-转录对与合成文本-合成输入对,声学与符号化训练样本比例为1:1。
- 该框架支持在解码阶段集成外部语言模型,无需修改网络架构即可实现性能进一步提升。
- 模型采用交叉熵损失在输出序列上进行端到端训练,解码过程保持标准束搜索(beam search)与解码流水线不变。

实验结果
研究问题
- RQ1当与有限语音数据结合时,从大规模文本语料中提取的符号化输入是否能提升端到端ASR的性能?
- RQ2合成输入与真实声学特征的相似度在多大程度上影响ASR性能?
- RQ3通过符号化输入实现的多模态数据增强是否能减少产生非词汇词(如将'casino'误转为'accino')的错误类型?
- RQ4MMDA能否与外部语言模型有效结合,进一步降低WER与CER?
- RQ5合成输入表征方式的选择(如Charstream与Rep-Phonestream)如何影响模型的泛化能力与错误模式?
主要发现
- 在WSJ英文数据集上,Rep-Phonestream增强方法相较基线模型实现了2%的绝对WER降低与10%的相对WER降低,优于Charstream与Phonestream方法。
- 在WSJ开发集/测试集上,MMDA模型将无意义词错误减少了25%(基线为32.93%,MMDA为20.25%),表明其泛化能力更强。
- 结合外部语言模型后,Rep-Phonestream MMDA系统在WSJ测试集上达到6.7%的CER与16.0%的WER,相较基线实现10%的相对WER降低。
- 在意大利语(Voxforge)与西班牙语(HUB4)数据集上,采用Rep-Phonestream的MMDA分别将WER降低2.9与2.0个百分点,显示出跨语言的一致性增益。
- MMDA系统倾向于将整个错误单词替换为有效词汇(如'quota' → 'colors'),而基线模型则常通过字符级替换产生非词汇词。
- MMDA与RNNLM重排序相结合后,无意义错误率降至20.25%,表明两种方法具有互补效应。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。