Skip to main content
QUICK REVIEW

[论文解读] A Fourier-based Framework for Domain Generalization

Qinwei Xu, Ruipeng Zhang|arXiv (Cornell University)|May 24, 2021
Domain Adaptation and Few-Shot Learning参考文献 44被引用 11
一句话总结

本文提出了一种基于傅里叶变换的框架 FACT,用于领域泛化,通过强调傅里叶域中的相位信息来提升模型的鲁棒性。通过使用振幅混合数据增强和协同教师正则化,该方法促使模型关注语义丰富的相位分量,在 Digits-DG、PACS 和 OfficeHome 基准上实现了最先进性能。

ABSTRACT

Modern deep neural networks suffer from performance degradation when evaluated on testing data under different distributions from training data. Domain generalization aims at tackling this problem by learning transferable knowledge from multiple source domains in order to generalize to unseen target domains. This paper introduces a novel Fourier-based perspective for domain generalization. The main assumption is that the Fourier phase information contains high-level semantics and is not easily affected by domain shifts. To force the model to capture phase information, we develop a novel Fourier-based data augmentation strategy called amplitude mix which linearly interpolates between the amplitude spectrums of two images. A dual-formed consistency loss called co-teacher regularization is further introduced between the predictions induced from original and augmented images. Extensive experiments on three benchmarks have demonstrated that the proposed method is able to achieve state-of-the-arts performance for domain generalization.

研究动机与目标

  • 解决深度学习中的领域偏移问题,即模型在分布外测试数据上性能下降的问题。
  • 通过在无需目标领域标注数据的情况下泛化到未见的目标领域,克服领域自适应的局限性。
  • 探索一种新颖的基于傅里叶变换的视角,假设相位信息携带不变的高层语义。
  • 开发一种数据增强与正则化策略,隐式且显式地促使模型关注相位信息。
  • 证明从相位分量学习可实现零样本设置下在多样化领域间的更好泛化性能。

提出的方法

  • 提出振幅混合(amplitude mix),一种基于傅里叶变换的数据增强技术,通过线性插值两个图像的振幅谱,同时保留其相位分量。
  • 引入协同教师正则化(co-teacher regularization),一种双一致性损失,利用动量更新的教师网络强制原始图像与振幅扰动图像之间的预测一致性。
  • 使用傅里叶变换将图像分解为振幅谱和相位谱,将相位视为语义内容的主要来源。
  • 训练模型以最小化原始图像与增强图像之间的预测差异,隐式推动模型更多依赖于相位衍生的特征。
  • 以端到端自监督方式应用该框架,无需目标领域标注。
  • 理论分析表明,振幅扰动可降低分类器对基于振幅特征的依赖,从而增强对基于相位特征的依赖。

实验结果

研究问题

  • RQ1傅里叶域中的相位信息能否作为鲁棒的、领域不变的信号,以提升领域泛化中的泛化能力?
  • RQ2在保持相位不变的同时扰动振幅的数据增强方法是否能在未见领域上带来更好的泛化性能?
  • RQ3通过强制原始图像与增强图像之间预测一致性的协同教师正则化是否能进一步提升鲁棒性?
  • RQ4与依赖振幅或空间特征相比,模型对相位信息的依赖在泛化性能方面有何差异?
  • RQ5仅由相位重建的图像中内在的语义内容是什么?其与边缘和轮廓等物体级结构有何关联?

主要发现

  • FACT 在三个标准领域泛化基准(Digits-DG、PACS 和 OfficeHome)上实现了最先进性能。
  • 仅由相位重建的图像与拉普拉斯边缘图之间的余弦相似度高达 0.914,表明相位编码了边缘等关键结构线索。
  • 消融实验确认,振幅混合与协同教师正则化均对性能提升至关重要,任一组件的消融均导致显著性能下降。
  • 理论分析支持假设:振幅扰动可减少分类器对基于振幅特征的依赖,从而增强对基于相位特征的依赖。
  • 经 FACT 训练的模型由于更专注于相位衍生的、领域不变的语义结构,因此在未见领域中泛化能力更强。
  • 视觉检查与定量分析均表明,相位信息保留了物体轮廓与空间关系,这些是跨领域语义理解的关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。