[论文解读] Speech Representation Learning Through Self-supervised Pretraining And Multi-task Finetuning
本文研究了监督式多任务学习(MTL)微调作为提升自监督语音表征学习的方法。通过在 SUPERB 基准的所有任务上联合微调预训练的 SSL 模型,作者表明 MTL 进一部提升了表征质量,尽管与仅使用 SSL 预训练相比,其在未见任务上的泛化能力仍有限。
Speech representation learning plays a vital role in speech processing. Among them, self-supervised learning (SSL) has become an important research direction. It has been shown that an SSL pretraining model can achieve excellent performance in various downstream tasks of speech processing. On the other hand, supervised multi-task learning (MTL) is another representation learning paradigm, which has been proven effective in computer vision (CV) and natural language processing (NLP). However, there is no systematic research on the general representation learning model trained by supervised MTL in speech processing. In this paper, we show that MTL finetuning can further improve SSL pretraining. We analyze the generalizability of supervised MTL finetuning to examine if the speech representation learned by MTL finetuning can generalize to unseen new tasks.
研究动机与目标
- 探究监督式多任务学习(MTL)微调是否能进一步改善通过自监督预训练(SSL)学习到的语音表征。
- 评估 MTL 微调表征在未包含于 MTL 训练中的下游未见任务上的泛化能力。
- 分析在 MTL 微调过程中,单个任务对其他任务性能的影响。
- 比较 SSL 预训练与 MTL 微调在学习可泛化语音表征方面的有效性。
提出的方法
- 采用在 SUPERB 基准上预训练的最先进 SSL 模型作为初始共享表征编码器。
- 通过在所有 10 个 SUPERB 任务上联合训练共享模型与各任务特定头,执行全部任务 MTL 微调。
- 通过在联合训练中每次排除一个任务,执行留一法 MTL 微调,以评估其对剩余任务的影响。
- 通过冻结留一法 MTL 中的共享模型并用其提取特征,评估任务迁移学习。
- 在下游任务训练中使用共享模型的固定表征,评估场景中模型参数保持冻结。
- 比较四种训练场景下的性能表现:SSL 预训练、全部任务 MTL、留一法 MTL 和任务迁移学习。
实验结果
研究问题
- RQ1监督式多任务学习微调能否进一步改善通过自监督预训练学习到的语音表征?
- RQ2在 MTL 微调过程中移除单个任务,会对剩余任务的性能产生何种影响?
- RQ3通过 MTL 学习到的表征在多大程度上能泛化到未参与 MTL 训练的新、未见下游任务?
- RQ4MTL 中哪些任务组合对彼此性能最有益或最不利?
主要发现
- 与仅使用 SSL 预训练相比,全部任务 MTL 微调在所有任务上均一致提升了性能,证明了 MTL 在提升表征质量方面的有效性。
- 留一法 MTL 分析显示,说话人识别任务(ASV、SID)通常会损害内容与语义任务(ASR、PR、SF)的性能,尤其是在联合训练时。
- 内容识别任务如 ASR 和 PR 在与说话人识别任务联合训练时受到最严重的负面影响,表明表征学习中存在潜在冲突。
- SD(说话人区隔)在与 ASV 和 SID 联合训练时受到显著损害,可能由于对帧级与话语级说话人嵌入存在冲突需求。
- 任务迁移学习表明,通过 MTL 微调的模型在先前被排除的任务上的表现,劣于通过 SSL 预训练微调的模型,表明其在未见任务上的泛化能力更弱。
- ASV 存在过拟合问题,但与 SID 联合训练显著缓解了该问题,表明任务间存在互补性优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。