[论文解读] On Learning Associations of Faces and Voices
本文提出了一种跨模态表征学习框架,通过基于三元组损失的协同嵌入模型对人脸与语音特征进行对齐,在将未见过的人脸与对应语音匹配的任务中达到人类水平的性能。该方法学习到共享语义空间表征,其与性别、年龄和语音音高等人口统计属性相关联,通过大规模人工研究和在新型多样化音视频数据集上的计算评估得到验证。
In this paper, we study the associations between human faces and voices. Audiovisual integration, specifically the integration of facial and vocal information is a well-researched area in neuroscience. It is shown that the overlapping information between the two modalities plays a significant role in perceptual tasks such as speaker identification. Through an online study on a new dataset we created, we confirm previous findings that people can associate unseen faces with corresponding voices and vice versa with greater than chance accuracy. We computationally model the overlapping information between faces and voices and show that the learned cross-modal representation contains enough information to identify matching faces and voices with performance similar to that of humans. Our representation exhibits correlations to certain demographic attributes and features obtained from either visual or aural modality alone. We release our dataset of audiovisual recordings and demographic annotations of people reading out short text used in our studies.
研究动机与目标
- 探究机器是否能够学习将未见过的人脸与对应语音关联,以模拟人类的感知能力。
- 利用更大、更丰富的非名人音视频录音数据集,建立更准确的人类表现基线。
- 学习人脸与语音的共享嵌入空间,以捕捉重叠的感知与人口统计信息。
- 评估模型在人脸-语音匹配任务中的表现,并分析其与人口统计和语音特征属性的相关性。
- 发布一个新型、多样化的带人口统计注释的音视频录音数据集,以供未来研究使用。
提出的方法
- 采用基于三元组损失的深度学习框架,训练人脸与语音表征的共享嵌入空间,通过余弦距离实现直接比较。
- 人脸特征通过微调的VGG16网络提取,语音特征通过预训练的SoundNet模型提取。
- 模型在VoxCeleb数据集上进行训练,因其规模较大;而人类研究则在新收集的181名非名人的数据集上进行。
- 通过零样本人脸-语音匹配任务评估所学表征,即模型需从候选者中选择与给定语音最匹配的人脸。
- 对两种模态均应用数据增强,包括随机裁剪、旋转、翻转,以及亮度/对比度和音频音量的抖动。
- 使用t-SNE可视化和有监督分类分析所学表征的结构与信息内容。
实验结果
研究问题
- RQ1机器是否能够在将未见过的人脸与对应语音关联的任务中达到人类水平的性能?
- RQ2所学的跨模态表征与性别、年龄和种族等人口统计属性的相关性如何?
- RQ3表征在多大程度上捕捉了语音音高和语音特征等语音特征?
- RQ4在多样化、非名人的数据集上,模型的性能与人类基线表现相比如何?
- RQ5架构选择与表征维度对匹配准确率的影响如何?
主要发现
- 该模型在人脸-语音匹配任务中的表现与人类受试者相当,表明机器能够以人类水平的准确度学习人脸与语音的关联。
- 所学表征与性别表现出强烈相关性,这在有监督实验中通过高分类精度得到证实,性别是最具判别力的人口统计属性。
- 年龄和语音音高与表征呈中等程度相关,尽管由于嵌入空间中年龄过渡平滑,年龄分类精度较低。
- 模型性能在不同全连接层维度下均表现稳健,且在512维表示后无显著提升。
- t-SNE可视化显示,表征空间按性别和种族组织,同时呈现连续的年龄趋势,表明存在有意义的语义聚类。
- 尽管在VoxCeleb上进行训练,模型在新非名人数据集上仍表现出良好泛化能力,证实了所学表征的可迁移性与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。