[论文解读] Dual Variational Generation for Low-Shot Heterogeneous Face Recognition
本文提出双变分生成(DVG),一种新颖的框架,通过噪声生成多样化、身份一致的异质人脸图像对(如NIR-to-VIS),采用双变分自编码器实现。通过强制潜在空间分布对齐和成对身份保持,DVG显著减小域差距,并提升少样本异质人脸识别性能,在四个基准测试中取得最先进结果,包括在CASIA NIR-VIS 2.0数据集上使用LightCNN-29实现99.8%的Rank-1准确率。
Heterogeneous Face Recognition (HFR) is a challenging issue because of the large domain discrepancy and a lack of heterogeneous data. This paper considers HFR as a dual generation problem, and proposes a novel Dual Variational Generation (DVG) framework. It generates large-scale new paired heterogeneous images with the same identity from noise, for the sake of reducing the domain gap of HFR. Specifically, we first introduce a dual variational autoencoder to represent a joint distribution of paired heterogeneous images. Then, in order to ensure the identity consistency of the generated paired heterogeneous images, we impose a distribution alignment in the latent space and a pairwise identity preserving in the image space. Moreover, the HFR network reduces the domain discrepancy by constraining the pairwise feature distances between the generated paired heterogeneous images. Extensive experiments on four HFR databases show that our method can significantly improve state-of-the-art results. The related code is available at https://github.com/BradyFU/DVG.
研究动机与目标
- 解决由于配对训练数据有限以及模态间存在巨大域差距,导致的少样本异质人脸识别(HFR)挑战。
- 克服条件图像到图像转换方法的局限性,这些方法生成的样本类内多样性低,且缺乏身份一致性。
- 开发一种无条件、双生成框架,从噪声中生成大规模、身份保持的异质图像对,用于数据增强。
- 通过约束生成图像对之间的成对特征距离,减少HFR中的域差异。
- 为HFR提供一种新视角,将其视为双生成问题,实现具有丰富多样性与身份一致性的数据增强。
提出的方法
- 提出双变分自编码器(DVAE),在共享潜在空间中建模配对异质人脸图像(如NIR与VIS)的联合分布。
- 通过最小化配对图像潜在分布之间的KL散度,在潜在空间中强制实现分布对齐。
- 在图像空间中应用成对身份保持损失,确保生成的图像对保持相同身份。
- 通过从标准高斯分布采样噪声,并同时复制生成两种模态,生成新的配对图像。
- 利用生成的配对图像通过成对特征距离约束训练HFR网络,以减少域差异。
- 将DVG框架与预训练的识别主干网络(如LightCNN)集成,联合优化生成与识别过程。
实验结果
研究问题
- RQ1从噪声无条件、双图像生成是否能产生适合HFR数据增强的多样化、身份一致的异质人脸图像对?
- RQ2强制潜在空间分布对齐与成对身份保持是否能提升少样本HFR设置下的识别泛化能力?
- RQ3所提出的DVG框架是否在类内多样性与身份一致性方面优于现有条件图像到图像转换方法?
- RQ4在训练数据有限的情况下,DVG在减少异质人脸模态(如NIR、VIS、素描)之间的域差异方面是否有效?
- RQ5DVG是否能泛化到标准NIR-VIS与素描-照片任务之外的其他少样本识别场景?
主要发现
- 在CASIA NIR-VIS 2.0数据集中,DVG使用LightCNN-29实现99.8%的Rank-1准确率和99.8%的VR@FAR=0.1%,显著优于基线模型LightCNN-29(99.2%和98.8%)及最先进方法。
- 在Oulu-CASIA NIR-VIS数据集中,DVG将VR@FAR=0.1%从先前最先进水平的84.9%提升至92.9%,展现出在少样本设置下的强大性能。
- 在IIIT-D Viewed Sketch数据集中,DVG实现96.99%的Rank-1准确率和97.86%的VR@FAR=1%,大幅优于RCN与MC-CNN。
- 在NJU-ID数据集中,DVG相较基线模型LightCNN-29,Rank-1准确率提升5.5%,VR@FAR=1%提升6.2%。
- 在Multi-PIE数据集中,DVG在±90°姿态下Rank-1准确率提升18.5%,在±75°姿态下提升4.3%,显示出对姿态变化的强鲁棒性。
- 定性结果表明,DVG生成的图像对具有多样的姿态与表情,而条件方法则倾向于保留输入属性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。