[论文解读] Aggregation via Separation: Boosting Facial Landmark Detector with Semi-Supervised Style Translation
该论文提出了一种半监督的面部关键点检测框架,通过条件变分自编码器将面部图像解耦为风格空间和结构空间,再通过风格迁移生成合成的风格增强图像以提升检测性能。该方法在WFLW、300W、COFW和AFLW数据集上取得了最先进结果,尤其在低数据设置下表现优异,在10%训练数据下相较完全监督基线模型的相对性能提升最高达94.94%。
Facial landmark detection, or face alignment, is a fundamental task that has been extensively studied. In this paper, we investigate a new perspective of facial landmark detection and demonstrate it leads to further notable improvement. Given that any face images can be factored into space of style that captures lighting, texture and image environment, and a style-invariant structure space, our key idea is to leverage disentangled style and shape space of each individual to augment existing structures via style translation. With these augmented synthetic samples, our semi-supervised model surprisingly outperforms the fully-supervised one by a large margin. Extensive experiments verify the effectiveness of our idea with state-of-the-art results on WFLW, 300W, COFW, and AFLW datasets. Our proposed structure is general and could be assembled into any face alignment frameworks. The code is made publicly available at https://github.com/thesouthfrog/stylealign.
研究动机与目标
- 解决在光照、遮挡和图像质量等非约束环境因素下面部关键点检测器性能下降的问题。
- 在不依赖额外标注或数据的情况下,提升关键点检测器的泛化能力和鲁棒性。
- 探索通过解耦表示实现的半监督学习在少样本面部对齐中的潜力。
- 开发一种可泛化的框架,可集成到现有面部对齐架构中。
提出的方法
- 使用带有KL散度和跳跃连接的条件变分自编码器,将面部图像分解为解耦的风格空间与结构空间。
- 通过将给定的面部结构与从训练好的风格空间中采样的多样化风格重新组合,实现风格迁移。
- 通过将真实面部图像转换为新风格并保持面部几何结构,生成合成训练数据。
- 在真实数据与合成数据上联合训练半监督关键点检测器,利用一致性正则化提升泛化能力。
- 采用更强的基线模型(SAN)和ResNet-18,在不同数据比例和风格增强因子下评估性能。
- 通过分析合成数据数量与风格多样性对模型收敛与性能的影响,控制领域偏移问题。
实验结果
研究问题
- RQ1将面部图像的风格与结构解耦,是否能提升在环境变化下的面部关键点检测鲁棒性?
- RQ2在低数据设置下,通过风格增强的合成数据实现半监督学习,在面部对齐任务中效果如何?
- RQ3为最大化性能而不因合成纹理过拟合,最优的每张图像风格增强数量是多少?
- RQ4所提方法是否能在多样化的基准上泛化,并可集成到现有面部对齐框架中?
- RQ5解耦质量如何影响生成的风格增强图像的真实感与实用性?
主要发现
- 在10%训练数据下,该方法在300W数据集上相较基线模型实现了94.94%的相对性能提升,展现出极强的数据效率。
- 在50%训练数据下,基线模型(SAN)已达到最先进性能,而所提方法在WFLW数据集上进一步提升了15.38%。
- 当每张图像的风格增强数量超过8组时,性能增益开始减弱,k=32时出现因过拟合于合成数据而导致的性能下降。
- 随着训练数据增多,解耦质量提升,能捕捉到更复杂的风格因素,如遮挡与纹理退化。
- 该方法泛化能力良好,在WFLW、300W、COFW和AFLW基准上均优于先前最先进模型。
- 该框架与多种面部对齐架构兼容,并在基线模型较强时仍能显著提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。