[论文解读] Exploring Deep Learning for Joint Audio-Visual Lip Biometrics
本文提出 DeepLip,一种基于深度学习的音视频唇部生物识别系统,通过融合基于卷积神经网络(CNN)的视觉特征与基于时延神经网络(TDNN)的音频特征,实现说话人认证。该系统在测试数据上通过分数融合实现 0.75% 的等错误率(EER),相比最佳单模态基线模型性能提升超过 50%。
Audio-visual (AV) lip biometrics is a promising authentication technique that leverages the benefits of both the audio and visual modalities in speech communication. Previous works have demonstrated the usefulness of AV lip biometrics. However, the lack of a sizeable AV database hinders the exploration of deep-learning-based audio-visual lip biometrics. To address this problem, we compile a moderate-size database using existing public databases. Meanwhile, we establish the DeepLip AV lip biometrics system realized with a convolutional neural network (CNN) based video module, a time-delay neural network (TDNN) based audio module, and a multimodal fusion module. Our experiments show that DeepLip outperforms traditional speaker recognition models in context modeling and achieves over 50% relative improvements compared with our best single modality baseline, with an equal error rate of 0.75% and 1.11% on the test datasets, respectively.
研究动机与目标
- 为解决在唇部生物识别中用于训练深度学习模型的大规模音视频(AV)数据库缺乏的问题。
- 开发一种鲁棒的、端到端的深度学习框架,用于联合音视频唇部生物识别,利用语音与视觉唇部运动中互补的说话人特征。
- 通过特征融合与分数融合策略建立基线系统,使其在说话人验证任务中优于单模态方法。
- 通过实证评估证明深度特征在 AV 唇部生物识别中优于手工设计特征。
提出的方法
- 通过整合公开数据集(包括用于音频的 VoxCeleb 和用于视频的 LOMBARDGRID),构建了一个中等规模的 AV 数据库,以支持深度学习训练。
- 设计基于 CNN 的视频模块,从视频序列中的唇部区域提取时空特征,替代传统的人工特征工程。
- 实现基于 TDNN 的音频模块,用于建模语音信号中的长期时序依赖关系,并优化说话人嵌入的提取。
- 采用早期融合(通过拼接仅音频与仅视频的嵌入向量实现特征融合)与晚期融合(通过分数平均实现)进行多模态融合。
- 使用余弦相似度进行评估,避免在域外测试集上使用 PLDA 时出现的过拟合问题。
- 采用基于 VoxCeleb 数据的迁移学习方法对仅音频模型进行预训练与微调,提升其性能,作为强基线模型。
实验结果
研究问题
- RQ1深度学习模型能否有效从联合音视频唇部序列中提取具有判别性的说话人特征?
- RQ2与单模态系统相比,音频与视觉模态的融合是否能在唇部生物识别中带来显著的性能提升?
- RQ3在相同数据集上,基于深度学习的 AV 唇部生物识别性能与传统的 GMM-UBM 和 E-TDNN 基线相比如何?
- RQ4在说话人认证任务中,音频与视觉模态在多大程度上提供了互补信息?
- RQ5是否可以通过简单的分数融合或特征融合策略实现显著的性能提升,而无需复杂的多模态对齐?
主要发现
- 所提出的 DeepLip 系统在使用分数融合的 test1 数据集上实现了 0.75% 的等错误率(EER),相比最佳单模态基线模型性能提升超过 50%。
- 特征融合将 test1 上的 EER 降低至 0.84%,test2 上降低至 1.11%,证实了音频与视觉语音特征的互补性。
- 仅视频系统(MCNN)在 test1 上实现 5.73% 的 EER,在 test2 上实现 8.65% 的 EER,优于传统 GMM-UBM 基线(test1 为 17.20%,test2 为 13.50%),甚至在 test1 上超越了仅音频的 E-TDNN 模型。
- 通过迁移学习增强的仅音频系统在 test1 上实现 1.98% 的 EER,在 test2 上实现 2.12% 的 EER,成为最佳单模态基线。
- PLDA 在 test1 上提升了性能(仅视频系统 EER 从 5.73% 降至 2.70%),但在 test2 上出现过拟合,因此采用余弦相似度作为最终评估方法具有合理性。
- 结果证实,视觉语音包含丰富的说话人特异性信息,且深度学习能够有效利用这些信息实现生物识别认证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。