[论文解读] Domain adaptation for holistic skin detection
本文提出了一种新颖的领域自适应策略,结合迁移学习与伪标签法,利用基于U-Net的全卷积网络(FCNs)实现整体皮肤检测,表明即使在目标领域中仅有极少或没有标注数据,整体CNN方法仍优于局部区域基于的模型。该方法在干净数据集上相比最先进像素级方法,F1分数最高提升73%,在跨领域场景中仍保持显著优势(13–60%),挑战了关于CNN泛化能力与实时性能的普遍批评。
Human skin detection in images is a widely studied topic of Computer Vision for which it is commonly accepted that analysis of pixel color or local patches may suffice. This is because skin regions appear to be relatively uniform and many argue that there is a small chromatic variation among different samples. However, we found that there are strong biases in the datasets commonly used to train or tune skin detection methods. Furthermore, the lack of contextual information may hinder the performance of local approaches. In this paper we present a comprehensive evaluation of holistic and local Convolutional Neural Network (CNN) approaches on in-domain and cross-domain experiments and compare with state-of-the-art pixel-based approaches. We also propose a combination of inductive transfer learning and unsupervised domain adaptation methods, which are evaluated on different domains under several amounts of labelled data availability. We show a clear superiority of CNN over pixel-based approaches even without labelled training samples on the target domain. Furthermore, we provide experimental support for the counter-intuitive superiority of holistic over local approaches for human skin detection.
研究动机与目标
- 为应对深度CNN在皮肤检测中通常被认为需要大量标注数据的批评,提出一种在目标领域中仅有极少或无标注数据时仍有效的领域自适应策略。
- 评估并比较在多样化数据集上,整体(FCN/U-Net)与局部(基于区域)CNN方法在皮肤分割中的表现。
- 挑战当前普遍认为像素级颜色模型优于深度学习用于皮肤检测的观点,尤其是在跨领域设置中。
- 评估现有皮肤检测数据集的泛化能力,以及无监督领域自适应在缓解领域偏移方面的作用。
提出的方法
- 结合归纳性迁移学习(从ImageNet微调)与伪标签法,为未标注的目标领域数据生成合成标签。
- 采用U-Net架构作为整体FCN-based分割模型,实现全图上下文理解,并在推理速度上优于基于区域的方法。
- 通过在源数据集上训练并在目标数据集上使用伪标签样本进行适应,实现在跨领域场景中的领域自适应。
- 采用两阶段训练流程:首先在ImageNet上预训练,然后在源领域数据上微调,接着对目标领域数据进行伪标签生成,并在仅有少量标注样本的情况下重新训练。
- 使用F1分数在四个基准数据集(SFA、Pratheepan、VPU和LFW)上评估性能,涵盖不同水平的标注目标数据。
- 采用基于度量的方法评估源域与目标域之间的分布偏移,旨在防止负迁移。
实验结果
研究问题
- RQ1在皮肤分割任务中,整体FCN-based方法是否优于局部基于区域的CNN模型,尤其是在跨领域条件下?
- RQ2当目标领域中缺乏或仅有极少标注数据时,迁移学习与伪标签法的结合是否能显著提升皮肤检测性能?
- RQ3在F1分数与在多样化数据集上的泛化能力方面,最先进像素级皮肤检测方法与基于深度学习的方法相比如何?
- RQ4关于CNN的常见批评(如泛化能力差、推理时间高)在真实世界皮肤检测场景中在多大程度上成立?
主要发现
- 基于U-Net的整体FCN方法相比最先进像素级方法,平均F1分数提升30%,在干净的SFA数据集上提升达73%。
- 在无目标领域标注数据的跨领域设置中,所提出的领域自适应方法在同质SFA数据集上使F1分数相比像素级方法提升60%,在异质Pratheepan数据集上提升13%。
- 整体FCN方法在GTX-1080Ti上每帧预测时间为80ms,实现每秒12.5帧,适用于实时应用——这与关于CNN推理速度的普遍批评相矛盾。
- 研究发现,即使局部基于区域的方法在完全监督下训练,整体方法仍表现更优,表明上下文建模对皮肤检测更为有效。
- 迁移学习与伪标签法的结合在所有领域中均显著提升了性能,即使仅标注10%的目标数据,性能增益依然持续存在。
- 结果表明,CNN在皮肤检测中泛化失败并非本质问题,因为该方法在包括高领域偏移的数据集在内的多样化数据集中均表现出良好泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。