[论文解读] A Multi-View Approach To Audio-Visual Speaker Verification
本文提出了一种多视角音视频说话人验证系统,通过共享分类器将音频和视频流映射到共享嵌入空间,实现在仅一种模态可用时的跨模态验证。在VoxCeleb1上的跨模态测试中,该方法实现了28.0%的EER,优于此前在该具有挑战性场景下的方法,同时在标准音视频融合设置下也达到了0.7%的EER。
Although speaker verification has conventionally been an audio-only task, some practical applications provide both audio and visual streams of input. In these cases, the visual stream provides complementary information and can often be leveraged in conjunction with the acoustics of speech to improve verification performance. In this study, we explore audio-visual approaches to speaker verification, starting with standard fusion techniques to learn joint audio-visual (AV) embeddings, and then propose a novel approach to handle cross-modal verification at test time. Specifically, we investigate unimodal and concatenation based AV fusion and report the lowest AV equal error rate (EER) of 0.7% on the VoxCeleb1 dataset using our best system. As these methods lack the ability to do cross-modal verification, we introduce a multi-view model which uses a shared classifier to map audio and video into the same space. This new approach achieves 28% EER on VoxCeleb1 in the challenging testing condition of cross-modal verification.
研究动机与目标
- 通过在真实世界场景中利用互补的音频和视觉模态,提升说话人验证性能,尤其在某一模态缺失或退化的情况下。
- 解决跨模态验证的挑战,即在测试时音频和视频输入在模态可用性上不匹配。
- 开发一个统一的模型,支持单模态、多模态和跨模态验证的单一框架。
- 在VoxCeleb数据集上,于标准音视频融合和具有挑战性的跨模态验证设置中均实现最先进性能。
提出的方法
- 通过共享分类器层训练多视角模型,将音频和视频嵌入映射到同一空间,实现跨模态匹配。
- 单模态编码器(音频和视频)分别训练,随后通过共享分类器组合,以对齐不同模态的嵌入。
- 系统使用对比损失或类似目标,确保匹配的说话人对(音频-视频)在共享空间中距离接近。
- 在标准验证设置中,应用音频单模态和视频单模态系统的得分融合以提升性能。
- 通过从验证对的每一侧移除一个模态来评估跨模态验证,模拟真实世界中的缺失数据场景。
- 模型在VoxCeleb2上训练,在VoxCeleb1测试集上评估,并对模态可用性和融合策略进行了消融研究。
实验结果
研究问题
- RQ1当验证对的一侧仅提供音频或视频时,能否有效学习到共享嵌入空间,以实现跨模态说话人验证?
- RQ2在标准音视频验证中,所提出的多视角模型与单模态和晚期融合基线相比表现如何?
- RQ3对音频和视频编码器进行共享训练对单模态性能有何影响?如何缓解性能下降?
- RQ4在极端条件下(如跨模态测试中音频和视频流均出现未见说话人),模型表现如何?
- RQ5在部分模态缺失的场景下,单模态系统得分融合是否比嵌入的线性平均更有效?
主要发现
- 所提出的多视角模型在VoxCeleb1的具有挑战性的跨模态验证设置中实现了28.0%的等错误率(EER),即每对验证样本中仅一端提供音频或视频。
- 通过融合单模态系统与中层AV融合系统的得分,该模型在VoxCeleb1上实现了0.7%的最低报告音视频EER。
- 多视角模型的单模态音频性能(VC1上为6.1% EER)相比独立系统(2.0% EER)略有下降,可能由于共享嵌入维度和去除批量归一化所致。
- 多视角模型的单模态视频性能(VC1上为3.7% EER)几乎与独立系统(3.4% EER)持平,表明共享训练带来的性能下降可忽略。
- 多视角模型中音频和视频相似度得分的融合将VC1上的EER降低至1.8%,优于单一单模态系统。
- 在跨模态设置中,该模型优于先前工作如[15]、[16]和[17],在VC1上实现28.0%的EER,尽管评估划分非标准,但性能与现有方法相当或更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。