[论文解读] Beyond Domain Adaptation: Unseen Domain Encapsulation via Universal Non-volume Preserving Models
本文提出通用非体积保持(UNVP)模型,使深度神经网络在训练过程中无需目标域数据即可泛化到未见域。通过迭代地将来自未见域的困难、虚构样本加入训练数据,UNVP在手写数字、人脸和行人识别任务中提升了对多样化分布的性能,优于ADDa和ADA等最先进方法在热成像和红外图像等未见域上的表现。
Recognition across domains has recently become an active topic in the research community. However, it has been largely overlooked in the problem of recognition in new unseen domains. Under this condition, the delivered deep network models are unable to be updated, adapted or fine-tuned. Therefore, recent deep learning techniques, such as: domain adaptation, feature transferring, and fine-tuning, cannot be applied. This paper presents a novel Universal Non-volume Preserving approach to the problem of domain generalization in the context of deep learning. The proposed method can be easily incorporated with any other ConvNet framework within an end-to-end deep network design to improve the performance. On digit recognition, we benchmark on four popular digit recognition databases, i.e. MNIST, USPS, SVHN and MNIST-M. The proposed method is also experimented on face recognition on Extended Yale-B, CMU-PIE and CMU-MPIE databases and compared against other the state-of-the-art methods. In the problem of pedestrian detection, we empirically observe that the proposed method learns models that improve performance across a priori unknown data distributions.
研究动机与目标
- 解决领域自适应方法在训练期间需要标注目标域数据的局限性。
- 使深度学习模型能够泛化到事先未知的未见领域,如热成像或红外图像。
- 开发一种通用的、端到端可训练的框架,兼容任意CNN架构,以提升领域泛化能力。
- 通过迭代数据增强建模领域分布变化,消除对领域特定微调或适应的需求。
提出的方法
- 提出一种通用非体积保持(UNVP)层,通过非体积保持方式学习扭曲特征空间,以建模领域分布变化。
- 引入一种迭代数据增强方法,基于当前模型预测生成来自未见领域的困难、虚构样本。
- 结合对数似然损失和ℓ2损失进行端到端训练,同时优化分类准确率和对领域分布变化的鲁棒性。
- 采用生成机制,在训练期间模拟具有挑战性的未见领域样本,以提升泛化能力。
- 可无缝集成到任意CNN框架中,以端到端方式实现即插即用的性能提升。
- 借鉴通用背景模型(UBM)的见解,但用基于深度神经网络的方法替代高斯混合模型(GMM),以实现领域表示学习。
实验结果
研究问题
- RQ1深度学习模型是否能在训练过程中完全不访问目标域数据的情况下泛化到未见领域?
- RQ2如何训练模型以应对未知的领域分布变化,如光照变化、模态变化(如RGB到热成像)或图像分布变化?
- RQ3通过使用来自未见领域的困难、虚构样本进行迭代数据增强,是否能超越传统领域自适应技术提升泛化性能?
- RQ4通用的、非体积保持变换在多种未见领域上的识别任务中,能在多大程度上提升性能?
- RQ5所提出的方法是否兼容现有CNN架构,并支持端到端训练?
主要发现
- 在Extended Yale-B数据集上,该方法在黑暗光照条件下实现了70.09%的人脸识别准确率,优于Pure-CNN(49.15%)和ADA(53.08%)。
- 在CMU-PIE数据集上,该方法在黑暗光照条件下达到67.87%的准确率,优于Pure-CNN(62.87%)和ADA(62.69%)。
- 在CMU-MPIE数据集上,该方法在黑暗条件下实现了98.25%的准确率,显著优于Pure-CNN(95.18%)和ADA(96.08%)。
- 在热成像行人检测任务中,该方法将mAP从基线的53.64%提升至53.83%(300个提议),证明了其在未见模态中的有效性。
- 在手写数字识别任务中,该方法在MNIST上达到99.17%准确率,在USPS上为78.85%,在SVHN上为40.22%,在MNIST-M上为60.51%,展现出在多样化数字数据集上的强大泛化能力。
- 该方法在未见领域上优于ADDA和ADA,即使ADDA在训练过程中需要目标域数据,凸显了其在零样本领域泛化方面的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。