Skip to main content
QUICK REVIEW

[论文解读] Learning from Extrinsic and Intrinsic Supervisions for Domain Generalization

Shujun Wang, Lequan Yu|arXiv (Cornell University)|Jul 18, 2020
Domain Adaptation and Few-Shot Learning参考文献 52被引用 14
一句话总结

该论文提出EISNet,一种领域泛化框架,通过在多任务学习范式中联合利用外在监督(通过动量度量学习的图像关系)和内在自监督(补丁顺序预测),实现了SOTA性能,且训练时间显著减少。通过集成K个最难负样本挖掘和动量更新的内存库,EISNet在VLCS和PACS基准上达到最先进性能。

ABSTRACT

The generalization capability of neural networks across domains is crucial for real-world applications. We argue that a generalized object recognition system should well understand the relationships among different images and also the images themselves at the same time. To this end, we present a new domain generalization framework that learns how to generalize across domains simultaneously from extrinsic relationship supervision and intrinsic self-supervision for images from multi-source domains. To be specific, we formulate our framework with feature embedding using a multi-task learning paradigm. Besides conducting the common supervised recognition task, we seamlessly integrate a momentum metric learning task and a self-supervised auxiliary task to collectively utilize the extrinsic supervision and intrinsic supervision. Also, we develop an effective momentum metric learning scheme with K-hard negative mining to boost the network to capture image relationship for domain generalization. We demonstrate the effectiveness of our approach on two standard object recognition benchmarks VLCS and PACS, and show that our methods achieve state-of-the-art performance.

研究动机与目标

  • 解决深度神经网络在未见领域测试时因领域偏移导致泛化能力差的挑战。
  • 在训练过程中无需访问目标领域数据的情况下提升模型鲁棒性。
  • 通过结合图像间关系与图像内自监督,增强特征的可区分性和可迁移性。
  • 开发一种高效、低计算量的领域泛化框架,可在多样化领域间良好扩展。

提出的方法

  • EISNet采用多任务学习框架,结合监督分类、动量度量学习和自监督的补丁顺序预测任务。
  • 动量更新的编码器维护一个特征嵌入的内存库,以稳定训练并提升特征一致性。
  • 采用K个最难负样本挖掘方法,从内存库中选择信息量丰富的困难三元组,以优化度量学习中的三元组损失。
  • 自监督辅助任务预测图像补丁的相对空间顺序,促使模型学习结构和上下文不变性。
  • 动量更新系数δ控制内存库的一致性,δ = 0.999被证明可获得最佳性能。
  • 该框架具有灵活性,可适配多种主干网络,包括AlexNet。

实验结果

研究问题

  • RQ1结合外在图像关系与内在自监督是否能提升在未见领域的泛化能力?
  • RQ2基于动量的度量学习结合K个最难负样本挖掘对特征紧凑性和泛化能力有何影响?
  • RQ3内存库大小和动量系数对模型性能与训练稳定性有何影响?
  • RQ4图像内部的自监督能否与图像间关系互补,以增强特征可区分性?
  • RQ5与现有领域泛化方法相比,该方法在效率和准确性方面表现如何?

主要发现

  • EISNet在VLCS和PACS基准上实现SOTA性能,优于现有领域泛化方法。
  • 在PACS Sketch数据集上,使用K个最难负样本选择器的模型达到70.25%准确率,较半困难选择器提升2.70%。
  • 最优负样本数量K为256;当K=512时性能下降,因计算负担过重。
  • 与SOTA方法MASF相比,该方法将训练时间减少超过91%,单张TITAN XP GPU仅需1.5小时。
  • t-SNE可视化结果表明,EISNet学习到的特征簇在各类间更具可区分性且分离更清晰。
  • 动量更新系数δ = 0.999时性能最佳,表明快速更新内存库可提升特征一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。