[论文解读] Fine-tuning on Clean Data for End-to-End Speech Translation: FBK @ IWSLT 2018
本论文介绍了FBK在IWSLT 2018年英德语音翻译任务中采用的端到端语音翻译系统,该系统基于CNN-LSTM序列到序列模型,并在清洗后的训练数据上进行微调。通过采用两阶段数据清洗(基于强制对齐和帧-字符比),结合权重归一化、标签平滑、检查点平均和模型集成解码等方法,系统在测试集上取得了10.24的BLEU分数,单一模型也达到了9.70的BLEU分数。
This paper describes FBK's submission to the end-to-end English-German speech translation task at IWSLT 2018. Our system relies on a state-of-the-art model based on LSTMs and CNNs, where the CNNs are used to reduce the temporal dimension of the audio input, which is in general much higher than machine translation input. Our model was trained only on the audio-to-text parallel data released for the task, and fine-tuned on cleaned subsets of the original training corpus. The addition of weight normalization and label smoothing improved the baseline system by 1.0 BLEU point on our validation set. The final submission also featured checkpoint averaging within a training run and ensemble decoding of models trained during multiple runs. On test data, our best single model obtained a BLEU score of 9.7, while the ensemble obtained a BLEU score of 10.24.
研究动机与目标
- 仅使用官方IWSLT 2018训练数据,提升端到端英德语音翻译的性能。
- 通过识别并移除低质量的语音-转录对,减少模型收敛问题和训练噪声。
- 通过正则化技术和模型集成策略,提升模型的泛化能力和鲁棒性。
- 评估在低资源语音翻译设置下,数据质量与训练优化对翻译性能的影响。
提出的方法
- 应用两阶段数据清洗流程:首先移除强制对齐质量差的样本(使用Gentle和Kaldi),然后过滤掉帧-字符比率异常的样本。
- 使用fairseq工具包训练基于LSTM和CNN的序列到序列模型,其中CNN用于降低音频特征的时间分辨率。
- 通过权重归一化和标签平滑提升模型稳定性和性能,在验证集上使BLEU分数提升了1.0分。
- 对最后10个模型检查点进行平均,以提升泛化能力,超越单一最佳模型。
- 通过多个独立训练模型的集成解码进一步提升翻译质量。
- 在逐步更清洁的数据子集(并行集 → 清洗1 → 清洗2)上对预训练模型进行微调,以提升鲁棒性和性能。
实验结果
研究问题
- RQ1基于强制对齐和帧-字符比的数据清洗,对端到端语音翻译性能有何影响?
- RQ2在低资源设置下,权重归一化和标签平滑等正则化技术在多大程度上改善了模型收敛性和BLEU分数?
- RQ3在逐步更清洁的数据子集上进行微调,是否能持续提升性能,相比直接在完整噪声数据集上训练?
- RQ4检查点平均和集成解码在提升泛化能力和测试性能方面有多有效?
- RQ5在仅使用官方IWSLT 2018训练数据的前提下,模型架构和训练策略对BLEU分数有何影响?
主要发现
- 在清洗后的数据子集(清洗1和清洗2)上进行微调,使验证集BLEU从完整‘并行集’的4.66提升至9.69,证明了数据质量的价值。
- 权重归一化与标签平滑的结合使基线模型在验证集上提升了1.0的BLEU分数。
- 最佳单一模型在测试集上取得了9.70的BLEU分数,而四个模型的集成则在测试集上达到了10.24的BLEU分数。
- 从完整‘并行集’微调至‘清洗2’子集,相比直接在干净数据上训练,BLEU分数提升了0.94分。
- 检查点平均使最佳模型在验证集上的性能从10.63提升至10.90 BLEU。
- 四个模型的集成解码在验证集上取得了11.60 BLEU的分数,相比最佳单一模型提升了1.0 BLEU。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。