Skip to main content
QUICK REVIEW

[论文解读] Cross-database non-frontal facial expression recognition based on transductive deep transfer learning

Keyu Yan, Wenming Zheng|arXiv (Cornell University)|Nov 30, 2018
Face and Expression Recognition参考文献 22被引用 6
一句话总结

本文提出一种基于VGGface16-Net的归纳式深度迁移学习框架,用于解决跨数据库非正面面部表情识别问题,联合学习判别性特征并预测未标注目标样本的标签。该方法在Multi-PIE数据集上达到66.85%的最先进准确率,在BU-3DEF数据集上达到66.05%,优于现有的迁移学习方法。

ABSTRACT

Cross-database non-frontal expression recognition is a very meaningful but rather difficult subject in the fields of computer vision and affect computing. In this paper, we proposed a novel transductive deep transfer learning architecture based on widely used VGGface16-Net for this problem. In this framework, the VGGface16-Net is used to jointly learn an common optimal nonlinear discriminative features from the non-frontal facial expression samples between the source and target databases and then we design a novel transductive transfer layer to deal with the cross-database non-frontal facial expression classification task. In order to validate the performance of the proposed transductive deep transfer learning networks, we present extensive crossdatabase experiments on two famous available facial expression databases, namely the BU-3DEF and the Multi-PIE database. The final experimental results show that our transductive deep transfer network outperforms the state-of-the-art cross-database facial expression recognition methods.

研究动机与目标

  • 解决跨数据库非正面面部表情识别的挑战,即训练和测试数据来自不同数据库且存在分布偏移。
  • 克服传统FER方法假设训练集与测试集数据分布一致的局限性。
  • 开发一种深度迁移学习框架,联合优化未标注目标样本的特征学习与标签预测。
  • 提升在标准FER数据集中代表性不足的非正面面部表情的识别性能。
  • 证明深度特征(VGG)在复杂多视角面部表情识别任务中显著优于手工设计特征(SIFT、LBP)。

提出的方法

  • 将预训练的VGGface16-Net作为共享特征提取器,从源域和目标域的非正面面部表情数据中学习非线性判别性特征。
  • 设计一种新型归纳式迁移层,联合优化已标注源样本和未标注目标样本的损失函数。
  • 采用联合优化策略,在最小化源数据分类损失的同时,预测并优化未标注目标样本的标签。
  • 在训练过程中利用全部源域和目标域数据(包括未标注目标样本),以提升域适应性和特征泛化能力。
  • 通过联合损失函数端到端训练模型,平衡源数据的分类准确率与目标数据的标签预测置信度。
  • 将该框架应用于两个公开数据库:BU-3DEF(作为源或目标)和Multi-PIE(作为目标或源),实现跨数据库评估。

实验结果

研究问题

  • RQ1归纳式深度迁移学习框架是否能在跨数据库非正面面部表情识别任务中超越现有最先进方法?
  • RQ2当在BU-3DEF与Multi-PIE数据库之间迁移时,该方法在成像条件和非正面姿态差异较大的情况下表现如何?
  • RQ3在非正面表情识别任务中,使用深度特征(VGGface16-Net)是否显著优于传统手工设计特征(SIFT、LBP)?
  • RQ4在训练过程中引入未标注目标样本在多大程度上提升了模型的泛化能力和识别准确率?
  • RQ5为何在该框架中,NE(中性)表情特别难以识别?

主要发现

  • 当将Multi-PIE作为目标数据库、BU-3DEF作为源数据库时,所提出的TDTL模型识别准确率达到66.85%,优于所有对比的最先进方法。
  • 当BU-3DEF作为目标、Multi-PIE作为源时,模型识别准确率达到66.05%,表明其在不同数据库方向下均具有鲁棒性。
  • TDTL方法的F1-score达到0.6547(以Multi-PIE为目标)和0.5309(以BU-3DEF为目标),表明其在所有表情类别中均表现优异。
  • 基于VGG的特征在准确率和F1-score上均显著优于SIFT和LBP特征,凸显深度特征在捕捉复杂非正面面部模式方面的优势。
  • NE(中性)表情最难识别,可能因其分布与其它表情过于相似,尤其在BU-3DEF目标设置下更为明显。
  • TDTL框架表明,通过联合优化源数据与未标注目标数据,可有效提升域适应能力与识别鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。