[论文解读] Selective Listening by Synchronizing Speech with Lips
该论文提出了一种自监督的音视频说话人分离模型,利用唇部运动作为视觉吸引子,实现在无需预先录入语音参考的情况下实现选择性听觉。通过利用语音与唇部动作的同步性作为自监督预训练信号,该重入模型在目标说话人分离任务中达到最先进性能,尤其在视觉遮挡和跨域条件下表现优异。
A speaker extraction algorithm seeks to extract the speech of a target speaker from a multi-talker speech mixture when given a cue that represents the target speaker, such as a pre-enrolled speech utterance, or an accompanying video track. Visual cues are particularly useful when a pre-enrolled speech is not available. In this work, we don't rely on the target speaker's pre-enrolled speech, but rather use the target speaker's face track as the speaker cue, that is referred to as the auxiliary reference, to form an attractor towards the target speaker. We advocate that the temporal synchronization between the speech and its accompanying lip movements is a direct and dominant audio-visual cue. Therefore, we propose a self-supervised pre-training strategy, to exploit the speech-lip synchronization cue for target speaker extraction, which allows us to leverage abundant unlabeled in-domain data. We transfer the knowledge from the pre-trained model to the attractor encoder of the speaker extraction network. We show that the proposed speaker extraction network outperforms various competitive baselines in terms of signal quality, perceptual quality, and intelligibility, achieving state-of-the-art performance.
研究动机与目标
- 为解决单通道语音分离中的鸡尾酒会问题,且无需预先录入语音参考。
- 利用视觉线索——特别是唇部运动——作为鲁棒的、实时的听觉注意力吸引子,用于说话人分离。
- 开发一种基于语音-唇部同步的自监督预训练策略,以利用大规模未标注的域内数据。
- 在视觉输入不可靠或不匹配的视觉遮挡和跨数据集场景下,提升模型泛化能力。
- 通过在深度学习框架中同步音视频流,模拟人类基于重入的跨模态注意力机制。
提出的方法
- 提出一种自监督预训练策略,利用语音-唇部同步作为监督信号,从未配对的未标注数据中学习鲁棒的音视频表征。
- 设计一种受埃德曼重入理论启发的重入模型,通过双向注意力机制动态同步音频与视觉流。
- 使用目标说话人的面部轨迹作为辅助参考(吸引子),而非预先录入的语音信号,实现在人机交互中的实时、自注册。
- 将预训练的音视频模型的知识迁移至说话人分离网络的吸引子编码器中,以提升目标说话人的隔离效果。
- 采用时间域语音分离方法,使用类似U-Net的架构,重建目标说话人的语音,同时保持感知质量。
- 引入一种数据增强策略,在训练过程中随机遮蔽面部轨迹,以模拟视觉遮挡,提升对跟踪失败的鲁棒性。
实验结果
研究问题
- RQ1语音-唇部同步能否作为自监督信号,用于在无需标注语音参考的情况下预训练说话人分离模型?
- RQ2在无预先录入语音的情况下,视觉面部轨迹作为目标说话人分离的吸引子有多有效?
- RQ3在面部部分或完全被遮挡的视觉遮挡条件下,该重入模型的性能能维持到何种程度?
- RQ4该模型在跨域场景下的泛化能力如何,例如从录音室录制的视频数据到真实环境中的非受限视频数据?
- RQ5与现有说话人分离基线方法相比,该方法在信号质量、可懂度和感知质量方面是否具有优势?
主要发现
- 在使用遮挡数据进行训练的情况下,重入模型在VoxCeleb2-2mix-occl测试集上达到10.27 dB SI-SDRi和0.909 PESQ,优于所有基线模型。
- 即使仅有效视觉时长为10%(即语音中仅有10%的时段面部未被遮挡),重入模型仍可实现接近7 dB的SI-SDRi,表现出对部分遮挡的强鲁棒性。
- 在LRS2和LRS3真实视频数据集上,重入模型分别达到12.66 dB SI-SDRi和1.036 PESQ,各项指标均优于TDSE-I和MuSE-I。
- 在Grid和TCD-TIMIT录音室数据集上,重入模型达到14.96 dB SI-SDRi和1.118 PESQ,展现出强大的跨域泛化能力,尽管在Grid数据集上MuSE-I在SI-SDRi和PESQ指标上略胜一筹。
- 使用遮挡数据训练的模型泛化能力显著优于未使用遮挡数据训练的模型,且在所有评估设置中,重入模型均保持最高的性能优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。