[论文解读] Towards a General Model of Knowledge for Facial Analysis by Multi-Source Transfer Learning
本文提出了一种两阶段多源迁移学习框架,用于面部分析,首先通过共享自编码器将多个预训练模型融合为共享嵌入表示,然后将该知识蒸馏到轻量级学生模型中。所得到的模型在15项多样化的面部分析任务上实现了最先进性能,参数量仅为200万(比教师模型少75倍),展示了卓越的泛化能力与实际部署可行性。
This paper proposes a step toward obtaining general models of knowledge for facial analysis, by addressing the question of multi-source transfer learning. More precisely, the proposed approach consists in two successive training steps: the first one consists in applying a combination operator to define a common embedding for the multiple sources materialized by different existing trained models. The proposed operator relies on an auto-encoder, trained on a large dataset, efficient both in terms of compression ratio and transfer learning performance. In a second step we exploit a distillation approach to obtain a lightweight student model mimicking the collection of the fused existing models. This model outperforms its teacher on novel tasks, achieving results on par with state-of-the-art methods on 15 facial analysis tasks (and domains), at an affordable training cost. Moreover, this student has 75 times less parameters than the original teacher and can be applied to a variety of novel face-related tasks.
研究动机与目标
- 为解决将多个预训练面部分析模型的知识融合为单一通用模型的挑战。
- 开发一种高效的多源知识融合方法,在保留互补信息的同时减少冗余。
- 构建一个轻量级、可部署的学生模型,使其在多样化面部分析任务上的泛化能力优于其教师模型。
- 在涵盖多个领域和模态的15项多样化面部分析任务上验证该方法。
提出的方法
- 在无监督大规模数据集上训练共享自编码器,将多个源模型嵌入表示投影到统一的低维共同表示空间。
- 融合过程使用可学习的组合算子,利用自编码器的瓶颈层从多个源表示中生成紧凑且信息丰富的嵌入。
- 应用知识蒸馏,将融合后的集成教师模型的知识转移到轻量级学生卷积神经网络中。
- 学生模型通过模仿融合教师在目标任务上的输出进行训练,实现在极低参数量下的高性能表现。
- 将压缩与蒸馏分离为两个独立阶段,提升了训练稳定性和性能。
- 通过在15项面部分析任务上的消融研究评估该方法,包括人脸识别、属性预测和情绪分析。
实验结果
研究问题
- RQ1能否从多个预训练面部分析模型中学习到一个统一的嵌入表示,以提升在多样化任务上的泛化能力?
- RQ2通过共享自编码器融合多个源模型是否优于朴素拼接或选择性模型选择基线方法?
- RQ3能否从融合的多源教师模型中进行知识蒸馏,得到一个轻量级学生模型,使其在新任务上的性能超越教师模型?
- RQ4融合嵌入的维度如何影响重建准确率和下游迁移性能?
- RQ5在扩展到大量源任务和目标任务时,训练效率与模型性能之间的权衡如何?
主要发现
- 所提出的模型在15项多样化面部分析任务(包括人脸识别、属性预测和情绪分析)上实现了与最先进方法相当的性能。
- 蒸馏后的学生模型仅包含200万个参数(为原始教师模型的1/75),却在大多数目标任务上超越了教师模型。
- 使用共享自编码器的融合方法(记为$\mathcal{G}$)显著优于朴素拼接和模型选择基线方法,尤其在低资源目标领域表现更优。
- 消融研究证实,对源嵌入进行降维可提升泛化能力,且最优嵌入尺寸因任务而异。
- 两阶段训练流程(先压缩后蒸馏)的性能优于端到端微调,且总训练时间相比暴力模型组合方法减少了4倍。
- 该方法实现了高效的迁移学习:在无监督数据集上的训练耗时约70小时,但后续迁移步骤远快于从零开始训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。