[论文解读] u-HuBERT: Unified Mixed-Modal Speech Pretraining And Zero-Shot Transfer to Unlabeled Modality
u-HuBERT 提出了一种统一的自监督预训练框架,通过共享的掩码聚类预测目标与模态丢弃机制,同时利用单模态和多模态语音数据,使单一微调模型在语音、视觉及视听语音任务中均达到最先进性能,包括在 LRS3 上对未见模态实现零样本迁移,其 WER 分别为 1.2% / 1.4% / 27.2%。
While audio-visual speech models can yield superior performance and robustness compared to audio-only models, their development and adoption are hindered by the lack of labeled and unlabeled audio-visual data and the cost to deploy one model per modality. In this paper, we present u-HuBERT, a self-supervised pre-training framework that can leverage both multimodal and unimodal speech with a unified masked cluster prediction objective. By utilizing modality dropout during pre-training, we demonstrate that a single fine-tuned model can achieve performance on par or better than the state-of-the-art modality-specific models. Moreover, our model fine-tuned only on audio can perform well with audio-visual and visual speech input, achieving zero-shot modality generalization for multiple speech processing tasks. In particular, our single model yields 1.2%/1.4%/27.2% speech recognition word error rate on LRS3 with audio-visual/audio/visual input. Codes and models are available at https://github.com/facebookresearch/av_hubert
研究动机与目标
- 为解决特定模态语音模型存在的数据稀缺与部署成本问题,开发一种面向多种语音模态的统一预训练框架。
- 通过在预训练过程中学习模态无关表示,实现对未见模态的零样本迁移。
- 通过联合预训练单模态与多模态语音数据,提升低资源模态的性能。
- 证明仅在一个模态上微调的模型,无需重新训练即可有效泛化到其他模态。
- 验证模态丢弃在学习鲁棒、跨模态表示方面的有效性,适用于混合模态预训练。
提出的方法
- 提出一种统一的掩码聚类预测目标,将不同语音模态(音频、视觉、视听)的特征映射到共享的模态无关特征空间。
- 使用共享的码书为所有模态的掩码预测生成伪标签,实现单模态与多模态数据的联合预训练。
- 在预训练过程中应用模态丢弃,以模拟模态缺失,迫使模型学习对输入模态组成不变的表示。
- 在视听数据(LRS3)和未标注的纯音频数据(VC2-En)的组合上进行预训练,利用单模态音频数据的丰富性。
- 使用任意模态组合的标注数据对统一模型进行下游任务微调,实现对未见模态的零样本推理。
- 采用基于聚类的预测对比学习目标,以提升表示质量与跨模态泛化能力。
实验结果
研究问题
- RQ1一个在混合单模态与多模态语音数据上预训练的单一自监督模型,能否实现与特定模态模型相当的性能?
- RQ2模态丢弃在实现模型学习模态无关表示以支持零样本迁移方面有多有效?
- RQ3在额外未标注的单模态数据(如纯音频)上进行预训练,是否能提升视觉语音等低资源模态的性能?
- RQ4仅在音频上微调的模型,能否在不重新训练的情况下有效泛化到视听与视觉语音输入?
- RQ5与特定模态预训练相比,数据分布与训练时长对混合模态预训练性能的影响如何?
主要发现
- u-HuBERT 在 LRS3 上实现 1.2% WER 的视听语音识别性能,与最先进特定模态模型相当或更优。
- 在纯音频输入上实现 1.4% WER,在纯视觉输入上实现 27.2% WER,展现出强大的零样本迁移性能。
- 在视听与纯音频数据(600K 次更新)上联合预训练,优于仅在视听数据上预训练的基线方法,在所有三种模态上均表现更优。
- 模态丢弃对学习模态无关特征至关重要,缺乏该机制的模型无法泛化到未见的模态组合。
- 随着训练时间延长,模型性能持续提升;而特定模态预训练因数据限制,性能更早达到饱和。
- 统一框架使单一微调模型能在所有模态组合上表现良好,包括对未见模态的零样本推理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。