[论文解读] Kinship Verification from Videos using Spatio-Temporal Texture Features and Deep Learning
本文提出了一种基于视频的亲缘关系验证方法,结合了时空纹理特征(LBP、LPQ、BSIF在三个正交平面上)与预训练卷积神经网络(CNN)的深度特征。在UvA-NEMO Smile数据集上,通过特征融合,该方法实现了90.98%的平均验证准确率,相较于最先进方法在特定亲缘类型上最高提升了23%。
Automatic kinship verification using facial images is a relatively new and challenging research problem in computer vision. It consists in automatically predicting whether two persons have a biological kin relation by examining their facial attributes. While most of the existing works extract shallow handcrafted features from still face images, we approach this problem from spatio-temporal point of view and explore the use of both shallow texture features and deep features for characterizing faces. Promising results, especially those of deep features, are obtained on the benchmark UvA-NEMO Smile database. Our extensive experiments also show the superiority of using videos over still images, hence pointing out the important role of facial dynamics in kinship verification. Furthermore, the fusion of the two types of features (i.e. shallow spatio-temporal texture features and deep features) shows significant performance improvements compared to state-of-the-art methods.
研究动机与目标
- 通过利用视频序列而非静态图像,探究面部动态在亲缘关系验证中的作用。
- 探索时空纹理特征(LBP、LPQ、BSIF在TOP上)在捕捉与亲缘关系相关的面部模式方面的有效性。
- 评估预训练卷积神经网络(CNN)在视频背景下用于亲缘关系验证的深度特征表现。
- 通过浅层时空特征与深度特征的晚期融合,提升验证准确率。
- 证明基于视频的亲缘关系验证相较于基于图像的方法具有优越性。
提出的方法
- 利用眼睛坐标进行人脸检测、分割与对齐,以标准化视频帧中的面部区域。
- 从视频序列的三个正交平面(TOP)中提取时空纹理特征(LBP、LPQ、BSIF),以建模面部动态。
- 使用预训练的卷积神经网络(CNN)从单个面部帧中提取深度特征。
- 通过简单求和的方式在得分层面融合时空特征与深度特征,以结合其判别能力。
- 使用支持向量机(SVM)对融合后的特征向量进行分类,实现亲缘关系验证。
- 在UvA-NEMO Smile视频数据库上,采用标准的亲缘关系验证协议与ROC分析进行评估。
实验结果
研究问题
- RQ1与静态图像相比,使用视频序列是否能提升亲缘关系验证的性能?
- RQ2时空纹理特征(LBP、LPQ、BSIF在TOP上)在捕捉与亲缘关系相关的面部动态方面有多有效?
- RQ3预训练CNN提取的深度特征是否能在视频亲缘关系验证中超越手工设计特征?
- RQ4将浅层时空特征与深度特征进行融合,是否能显著提升性能,超过单一特征类型?
- RQ5在存在较大年龄或性别差异的不同亲缘类型(如M-S、F-D)中,性能表现如何变化?
主要发现
- 基于视频的亲缘关系验证显著优于基于静态图像的方法,证明了面部动态在亲缘关系识别中的重要性。
- 从预训练CNN中提取的深度特征在UvA-NEMO Smile数据集全集上实现了89.79%的平均验证准确率,超越了所有先前方法。
- 时空纹理特征与深度特征的融合实现了90.98%的平均准确率,相比之前最先进方法提升了超过18%。
- 在最具挑战性的亲缘类型中观察到最大的性能提升:M-S(提升4.8%)与F-D(提升3.4%),表明该方法对性别与年龄差异具有鲁棒性。
- 在M-S关系子集上,所提方法达到了90.49%的准确率,相较于最佳先前方法(Dibeklioglu et al.)提升了23%。
- 即使在静态图像设置下,深度特征的表现也优于空间纹理特征与从视频中提取的时空特征,凸显其强大的判别能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。