[论文解读] Jointly Learning Visual and Auditory Speech Representations from Raw Data
RAVEn 是一种自监督、多模态框架,通过使用带有动量编码器的非对称掩码预测,直接从原始视频和音频中联合学习视觉和听觉语音表征。它在视觉语音识别(在完整数据集上 LRS3 的 WER 为 23.1%)和听觉语音识别方面均取得了最先进性能,即使在极少标注数据下也优于先前方法,包括仅使用 30 小时标注数据即超越了在 90,000 小时非公开数据上训练的半监督方法。
We present RAVEn, a self-supervised multi-modal approach to jointly learn visual and auditory speech representations. Our pre-training objective involves encoding masked inputs, and then predicting contextualised targets generated by slowly-evolving momentum encoders. Driven by the inherent differences between video and audio, our design is asymmetric w.r.t. the two modalities' pretext tasks: Whereas the auditory stream predicts both the visual and auditory targets, the visual one predicts only the auditory targets. We observe strong results in low- and high-resource labelled data settings when fine-tuning the visual and auditory encoders resulting from a single pre-training stage, in which the encoders are jointly trained. Notably, RAVEn surpasses all self-supervised methods on visual speech recognition (VSR) on LRS3, and combining RAVEn with self-training using only 30 hours of labelled data even outperforms a recent semi-supervised method trained on 90,000 hours of non-public data. At the same time, we achieve state-of-the-art results in the LRS3 low-resource setting for auditory speech recognition (as well as for VSR). Our findings point to the viability of learning powerful speech representations entirely from raw video and audio, i.e., without relying on handcrafted features. Code and models are available at https://github.com/ahaliassos/raven.
研究动机与目标
- 开发一种统一的自监督方法,无需手工设计特征即可学习视觉和听觉语音表征。
- 通过利用原始数据中的联合音视频自监督,解决低资源语音识别的挑战。
- 消除对多阶段预训练或视觉与听觉语音识别分别处理策略的需求。
- 通过非对称跨模态学习提升下游视觉和听觉语音识别的性能。
- 证明强大的语音表征可完全从原始感官输入中学习,无需事先的语言或声学监督。
提出的方法
- RAVEn 使用学生-教师对比学习框架,对音频和视频流均采用动量平均的目标编码器。
- 音频流预测来自音频和视觉动量编码器的目标(跨模态与同模态学习),而视觉流仅预测听觉目标(跨模态学习),反映出音频中信息含量更高。
- 掩码输入被送入学生编码器,其从未掩码输入的缓慢更新动量编码器中预测上下文表征。
- 该方法采用轻量级的 Transformer 基预测器,回归动量编码器的输出,实现端到端的自监督预训练。
- 预训练在单阶段内对原始视频和音频进行,随后在下游 ASR 和 VSR 任务上使用极少标注数据进行微调。
- 该框架支持监督微调和自训练,增强了低资源环境下的性能。
实验结果
研究问题
- RQ1是否可以使用单阶段自监督方法,从原始音频和视频中无需手工特征直接学习鲁棒的视觉和听觉语音表征?
- RQ2非对称学习(即音频流预测两种模态,而视觉流仅预测音频)是否相比对称或单模态方法能提升性能?
- RQ3RAVEn 是否能在极低标注数据下于视觉和听觉语音识别中均取得最先进性能?
- RQ4在原始数据上预训练在视频转语音合成等下游任务中的性能提升程度如何?
- RQ5在低资源设置下,RAVEn 与依赖外部 ASR 模型或大规模伪标签方法相比表现如何?
主要发现
- 在使用全部 433 小时数据微调时,RAVEn 在 LRS3 上的视觉语音识别 WER 达到 23.1%,创下新最先进纪录。
- 仅使用 30 小时标注数据并结合自训练,RAVEn 在 VSR 中达到 23.8% WER,优于近期在 90,000 小时非公开数据上训练的半监督方法。
- 在听觉语音识别方面,RAVEn 的性能与 AV-HuBERT 相当或更优,且未使用任务特定的预训练或手工特征。
- RAVEn 预训练显著提升了视频转语音合成性能,相比从零开始训练,PESQ 提升 0.04,STOI 提升 0.03,ESTOI 提升 0.06。
- 该方法展现出强大的泛化能力,在低资源 VSR 中达到 47.0% WER,在低资源 ASR 中达到 4.7% WER(使用基础模型)。
- 转录错误主要为音似替换(例如 'were taken' → 'we’re taking'),表明模型有效捕捉了语音和语义结构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。