[论文解读] Exploring Disentangled Feature Representation Beyond Face Identification
该论文提出身份蒸馏与消散自编码器(D²AE),一种最小监督框架,通过对抗性训练两个分支来学习解耦的人脸特征:一个分支用于蒸馏身份特异性特征以实现验证,另一个分支用于消除身份信息,捕捉互补属性和差异。该方法在LFW上实现了最先进的99.80%准确率,并支持在身份和属性任务间具有强泛化能力的无监督语义人脸编辑。
This paper proposes learning disentangled but complementary face features with minimal supervision by face identification. Specifically, we construct an identity Distilling and Dispelling Autoencoder (D2AE) framework that adversarially learns the identity-distilled features for identity verification and the identity-dispelled features to fool the verification system. Thanks to the design of two-stream cues, the learned disentangled features represent not only the identity or attribute but the complete input image. Comprehensive evaluations further demonstrate that the proposed features not only maintain state-of-the-art identity verification performance on LFW, but also acquire competitive discriminative power for face attribute recognition on CelebA and LFWA. Moreover, the proposed system is ready to semantically control the face generation/editing based on various identities and attributes in an unsupervised manner.
研究动机与目标
- 在仅使用身份标签的最小监督下,学习解耦且互补的人脸特征。
- 通过同时学习身份蒸馏特征与身份消散特征,提升特征表示的泛化性与完整性。
- 在无需微调的情况下,实现对下游任务(如人脸属性识别和无监督人脸编辑)的零样本迁移。
- 提供一个统一的端到端框架,在保持高精度身份验证的同时,捕捉个体内差异与属性级变化。
- 通过对抗性监督与可视化,探索特征的可解释性与解耦质量。
提出的方法
- D²AE框架采用双流自编码器架构:一个分支通过身份分类损失学习身份蒸馏特征,另一个分支通过对抗训练学习身份消散特征,以欺骗身份分类器。
- 身份消散分支使用对抗损失(L_I^adv)进行训练,以促使特征提取器生成对身份预测无信息的表征。
- 重建损失(L_H)确保自编码器在潜在空间中保留完整的输入图像信息,维持表征的完整性。
- 模型仅通过身份监督进行端到端训练,无需额外的属性或其他任务标注。
- 通过组合身份蒸馏与身份消散分支,形成解耦特征,实现身份特异性与属性特异性表征的分离。
- 通过操纵解耦组件,该框架支持无须重训练或控制单元的语义人脸编辑。
实验结果
研究问题
- RQ1是否仅通过身份监督即可学习解耦的人脸特征,而无需显式标注属性或其他因素?
- RQ2对身份消散特征进行对抗性训练是否能提升学习表征的完整性和泛化能力?
- RQ3解耦特征在保持身份验证的最先进性能的同时,能在多大程度上实现零样本属性识别?
- RQ4解耦特征是否能支持无监督的、语义层面的人脸编辑,如保持身份不变的属性修改?
- RQ5身份蒸馏与身份消散组件在不同下游任务(如身份验证与属性分类)中分别发挥何种不同作用?
主要发现
- D²AE模型在LFW人脸验证基准上达到99.80%的准确率,优于大多数单模型的最先进方法。
- 在CelebA与LFWA属性识别基准上,D²AE表现具有竞争力,LFWA平均准确率达83.1%,CelebA达83.1%,表明其具备强大的解耦能力。
- 消融实验表明,若移除身份对抗损失(L_I^adv)或重建损失(L_H),性能显著下降,验证了二者关键作用。
- 在ID无关属性(如‘微笑’和‘涂口红’)上,身份消散特征(D²AE-𝒫)优于身份蒸馏特征(D²AE-𝒯);而在ID相关属性(如‘男性’和‘黑发’)上则相反。
- 该模型支持高效的语义人脸编辑:通过操纵解耦组件,用户可实现无需训练控制模块的身份保持属性迁移与插值。
- t-SNE可视化显示,解耦特征在属性上可被轻易分离,证实其可解释性与解耦质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。