[论文解读] Self-Training for End-to-End Speech Translation
本文提出了一种端到端语音翻译的自训练框架,利用未标注语音中的伪标签,通过级联ASR+MT系统或端到端ST模型生成伪标签。在MuST-C英语-法语和英语-德语数据集上取得了最先进结果,分别比强基线半监督方法高出8.3和5.7 BLEU。
One of the main challenges for end-to-end speech translation is data scarcity. We leverage pseudo-labels generated from unlabeled audio by a cascade and an end-to-end speech translation model. This provides 8.3 and 5.7 BLEU gains over a strong semi-supervised baseline on the MuST-C English-French and English-German datasets, reaching state-of-the art performance. The effect of the quality of the pseudo-labels is investigated. Our approach is shown to be more effective than simply pre-training the encoder on the speech recognition task. Finally, we demonstrate the effectiveness of self-training by directly generating pseudo-labels with an end-to-end model instead of a cascade model.
研究动机与目标
- 通过利用未标注语音数据缓解端到端语音翻译中的数据稀缺问题。
- 探究使用级联(ASR+MT)模型和端到端模型生成合成训练标签的伪标签有效性。
- 证明自训练在ASR任务上优于传统的编码器预训练方法。
- 评估伪标签质量与模型架构扩展对性能的影响。
- 通过用端到端模型替代级联系统来生成伪标签,简化模型训练流程。
提出的方法
- 使用强级联ASR和MT系统从未标注语音中生成伪标签,然后在伪标签数据上微调端到端ST模型。
- 在相同未标注数据上训练端到端ST模型以生成伪标签,实现完全端到端的自训练。
- 对ST模型和伪标签生成模型均使用VggT和VggTLarge Transformer架构,共享编码器和解码器组件。
- 通过数据过滤去除极短或极长的语音片段,并使用SentencePiece进行子词分词,采用10,000词表的unigram模型。
- 在伪标签生成后,使用原始监督数据对最终ST模型进行微调,以提升泛化能力。
- 使用Adam优化器,并针对每种架构应用特定的学习率调度(LSTM:固定学习率;Transformer:原始调度)
实验结果
研究问题
- RQ1使用未标注语音生成的伪标签进行自训练,是否能在低资源和高资源设置下显著提升端到端语音翻译性能?
- RQ2伪标签的质量如何影响最终ST模型的性能?
- RQ3使用伪标签的自训练是否比在ASR任务上预训练编码器更有效?
- RQ4能否使用端到端ST模型生成伪标签,而非依赖级联ASR+MT系统?
- RQ5在伪标签数据上扩大模型规模是否能带来进一步的性能提升?
主要发现
- 使用级联模型生成的伪标签在MuST-C英语-法语上带来8.3 BLEU的提升,在英语-德语上带来5.7 BLEU的提升,达到最先进性能。
- 在高资源设置下(17,607小时LibriLight数据),伪标签方法在En-De上达到23.9 BLEU,比编码器预训练高出2.9 BLEU。
- 在高资源设置下,使用VggT端到端模型生成伪标签的表现优于级联模型0.7 BLEU。
- 伪标签质量直接影响性能:高质量ASR转录(7.3 WER)带来的BLEU分数高于低质量转录(27.7 WER)。
- 仅使用监督数据进行自训练(纯自训练)仍优于基线,表明端到端模型可自主启动训练过程。
- 该方法使得训练更大模型(如VggTLarge)成为可能,从而带来显著的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。