[论文解读] Unsupervised Learning of Landmarks based on Inter-Intra Subject Consistencies
本文提出了一种无监督的人脸关键点检测方法,通过使用主体映射模块和循环一致性图像转换,同时强制实现跨主体和跨主体内的一致性。通过利用辅助图像引导结构变换,并在不同主体之间以及同一主体内部强制执行关键点一致性,该模型在MAFL和AFLW数据集上实现了最先进性能,关键点定位的准确性和稳定性均更优。
We present a novel unsupervised learning approach to image landmark discovery by incorporating the inter-subject landmark consistencies on facial images. This is achieved via an inter-subject mapping module that transforms original subject landmarks based on an auxiliary subject-related structure. To recover from the transformed images back to the original subject, the landmark detector is forced to learn spatial locations that contain the consistent semantic meanings both for the paired intra-subject images and between the paired inter-subject images. Our proposed method is extensively evaluated on two public facial image datasets (MAFL, AFLW) with various settings. Experimental results indicate that our method can extract the consistent landmarks for both datasets and achieve better performances compared to the previous state-of-the-art methods quantitatively and qualitatively.
研究动机与目标
- 解决完全监督人脸关键点检测中高标注成本和主观性的问题。
- 通过强制不同主体间的语义一致性,提升无监督关键点发现性能。
- 通过循环一致图像转换框架,增强主体内关键点一致性。
- 在保持高定位准确率的同时,减少对人工标注关键点的依赖。
- 开发一种自监督方法,使其在多样化的人脸外观和姿态下具有良好泛化能力。
提出的方法
- 该方法使用主体映射模块,基于来自不同主体的辅助图像提取的关键点热图,对输入图像进行变换。
- 采用双路径循环一致设计:从前向翻译将输入图像转换为变换图像,再通过反向翻译重建原始图像,从而强制实现主体内一致性。
- 通过高斯类似函数从特征图生成关键点热图,作为图像变换的结构引导。
- 模型通过重建损失和感知损失(使用VGG-16)的组合进行训练,以保留语义和结构细节。
- 网络端到端可训练,关键点检测器与主干网络联合优化,以在不同主体间预测一致且语义有意义的关键点。
- 该方法利用图像重建作为自监督信号,通过跨主体和主体内变换循环强制实现结构一致性。
实验结果
研究问题
- RQ1在无监督人脸关键点检测中,能否在无需人工标注标签的情况下有效强制实现跨主体关键点一致性?
- RQ2引入循环一致翻译路径在多大程度上提升了主体内关键点定位的稳定性?
- RQ3使用来自不同主体的辅助图像在多大程度上增强了检测关键点的语义一致性?
- RQ4结合感知损失和重建损失是否比仅使用重建损失带来更好的关键点定位效果?
- RQ5在低数据设置下,模型表现如何?其在多样化人脸数据集上是否具备良好的泛化能力?
主要发现
- 所提方法在MAFL数据集上平均误差为3.08,在AFLW数据集上为6.20(K=10个关键点),优于以往最先进方法。
- 在AFLW数据集上,该方法在K=50时性能优于Jakab等人[11]和Sanchez等人[12],表明其在高关键点数量下具有更强鲁棒性。
- 模型在低数据设置下表现出强泛化能力,即使仅使用100张训练图像,性能也接近饱和,且各次运行的标准差较低。
- 定性结果表明,预测的关键点更稳定且语义更合理(如眼角、鼻尖等),而基线方法常将关键点预测在头发或颈部区域。
- 消融实验表明,结合感知损失与重建损失可获得最佳性能,且VGG-16在特征提取方面优于VGG-19。
- 模型在不同主体间关键点位置漂移减少,尤其在额头和眼周区域表现更优,尽管在遮挡或姿态变化下仍存在轻微方差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。