[论文解读] VisualVoice: Audio-Visual Speech Separation with Cross-Modal Consistency
VisualVoice 提出了一种多任务学习框架,通过使用未标注视频联合优化音视频语音分离与跨模态人脸-语音嵌入学习。通过利用面部外观作为语音特征的先验(补充唇部运动线索),该方法在五个基准数据集上实现了最先进性能,并提升了无监督跨模态说话人验证效果。
We introduce a new approach for audio-visual speech separation. Given a video, the goal is to extract the speech associated with a face in spite of simultaneous background sounds and/or other human speakers. Whereas existing methods focus on learning the alignment between the speaker's lip movements and the sounds they generate, we propose to leverage the speaker's face appearance as an additional prior to isolate the corresponding vocal qualities they are likely to produce. Our approach jointly learns audio-visual speech separation and cross-modal speaker embeddings from unlabeled video. It yields state-of-the-art results on five benchmark datasets for audio-visual speech separation and enhancement, and generalizes well to challenging real-world videos of diverse scenarios. Our video results and code: http://vision.cs.utexas.edu/projects/VisualVoice/.
研究动机与目标
- 解决在嘈杂、多说话人环境中利用视觉与音频线索分离目标说话人语音的挑战。
- 克服现有音视频语音分离方法仅依赖唇部运动的局限性,这些方法在遮挡或非正面对焦情况下可能失效。
- 利用面部外观特征(如性别、年龄、国籍)作为语音特征(如音高、音色)的先验,以提升分离的鲁棒性。
- 在无身份或属性标注的情况下,以自监督方式联合学习语音分离与跨模态说话人嵌入。
- 展示在真实世界、多样化视频场景中的泛化能力,并提升无监督跨模态说话人验证性能。
提出的方法
- 训练一个多任务网络,从完全未标注的视频中联合执行音视频语音分离与跨模态人脸-语音嵌入学习。
- 使用对比损失强制说话人面部与分离出的语音之间保持一致性,确保语音与视觉身份匹配。
- 将来自 CNN 主干网络的面部外观特征,与来自 3D-CNN 或类似模型的唇部运动特征,以及音频特征(频谱图)在统一编码器中融合。
- 应用掩码头以基于音视频一致性预测时间-频率掩码,用于隔离目标说话人的语音。
- 通过结合语音分离损失(如 SI-SDR)与跨模态对比损失,端到端优化整个网络。
- 通过仅依赖视觉与音频信号而无需身份监督,实现对未见说话人的零样本泛化能力。
实验结果
研究问题
- RQ1在唇部运动不可靠的情况下(如遮挡或非正面对焦),面部外观能否为语音特征提供有用的先验?
- RQ2与单任务训练相比,联合学习语音分离与跨模态嵌入在两项任务上是否均能提升性能?
- RQ3在无身份标签的情况下,跨模态人脸-语音嵌入在多大程度上能泛化到未见说话人?
- RQ4引入跨模态一致性损失是否能增强在存在遮挡或非正面对焦等挑战性真实场景下的鲁棒性?
- RQ5所提出的框架是否能在无监督跨模态说话人验证方面超越现有方法?
主要发现
- VisualVoice 在五个音视频语音分离与增强基准数据集上均达到最先进性能,在干净与嘈杂条件下均优于先前方法。
- 在 VoxCeleb1 测试集上,跨模态说话人验证的 AUC 达到 84.9,EER 为 23.6,显著优于先前最先进方法 Learnable-Pins(73.8 AUC,34.1 EER),尤其在未见-未听配对中表现更优。
- 跨模态人脸-语音嵌入损失在视觉上差异较大的说话人或唇部运动可见度差的情况下(如非正面对焦)带来最大的性能提升。
- 学习到的嵌入的 t-SNE 可视化显示,即使训练过程中未提供任何属性或身份监督,嵌入仍能按性别和身份形成清晰聚类。
- 联合训练语音分离任务可提升跨模态嵌入质量,表明两项任务之间存在相互促进关系。
- 由于面部外观先验的鲁棒性,该模型在包含遮挡、姿势不规则和复杂背景的真实世界视频中表现出良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。