Skip to main content
QUICK REVIEW

[论文解读] Feature-based Style Randomization for Domain Generalization

Yue Wang, Lei Qi|arXiv (Cornell University)|Jun 6, 2021
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

本文提出了一种基于特征的风格随机化(FSR)方法,这是一种新颖的域泛化技术,通过在特征表示中注入随机噪声,以在训练过程中生成多样化且未见过的风格特征,从而提升模型的鲁棒性。与图像级增强不同,FSR在编码器-解码器网络架构下于特征空间中操作,实现更具样本多样性和目标导向性的数据增强,进而在PACS、VLCS和Office-Home基准上取得最先进性能。

ABSTRACT

As a recent noticeable topic, domain generalization (DG) aims to first learn a generic model on multiple source domains and then directly generalize to an arbitrary unseen target domain without any additional adaption. In previous DG models, by generating virtual data to supplement observed source domains, the data augmentation based methods have shown its effectiveness. To simulate the possible unseen domains, most of them enrich the diversity of original data via image-level style transformation. However, we argue that the potential styles are hard to be exhaustively illustrated and fully augmented due to the limited referred styles, leading the diversity could not be always guaranteed. Unlike image-level augmentation, we in this paper develop a simple yet effective feature-based style randomization module to achieve feature-level augmentation, which can produce random styles via integrating random noise into the original style. Compared with existing image-level augmentation, our feature-level augmentation favors a more goal-oriented and sample-diverse way. Furthermore, to sufficiently explore the efficacy of the proposed module, we design a novel progressive training strategy to enable all parameters of the network to be fully trained. Extensive experiments on three standard benchmark datasets, i.e., PACS, VLCS and Office-Home, highlight the superiority of our method compared to the state-of-the-art methods.

研究动机与目标

  • 为解决图像级数据增强在域泛化中的局限性,该方法通常因依赖有限的参考风格而无法充分捕捉未见域的多样性。
  • 通过在特征空间而非图像空间中生成更多样化和抽象的风格变化,提升模型泛化能力。
  • 开发一种可学习的、自适应的增强机制,以在不依赖生成模型或固定风格迁移操作的前提下提升特征级别的多样性。
  • 设计一种渐进式训练策略,以在使用所提出的FSR模块时充分优化所有网络参数。
  • 在一般图像分类和医学影像任务(如皮肤病变分类)中验证特征级增强的有效性。

提出的方法

  • 提出一种基于特征的风格随机化(FSR)模块,通过向特征表示中注入可学习噪声,将原始特征转换为具有随机风格的新特征。
  • 采用编码器-解码器架构,将原始特征映射到潜在空间,在该空间中将噪声与风格统计量结合,实现多样化的风格转换。
  • 引入一种渐进式训练策略,逐步增强FSR模块的强度,以实现全网络优化和稳定收敛。
  • 在卷积主干网络之后的特征空间中运行,使模型能够通过随机风格扰动学习域不变表示。
  • 使用实例归一化统计量作为风格表征,并在训练过程中通过噪声调制生成新的风格向量。
  • 在神经网络的多个阶段应用FSR模块,以探究其对特征多样性和泛化能力的影响。

实验结果

研究问题

  • RQ1通过生成更多样化和抽象的风格变化,特征级数据增强是否能在域泛化中超越图像级增强?
  • RQ2与现有的风格混合或转换方法相比,向特征表示中注入可学习噪声是否能提升模型对未见域的泛化能力?
  • RQ3FSR模块的放置位置和训练调度如何影响模型性能与收敛性?
  • RQ4该方法是否能有效泛化到高度可变的领域(如医学影像),其中领域偏移具有紧凑且非线性特征?
  • RQ5FSR模块是否能在提升源域性能的同时增强对未见域的零样本泛化能力?

主要发现

  • 在PACS数据集上,所提方法在所有目标域上的平均准确率达到88.7%,比之前的最先进方法高出1.2%。
  • 在VLCS数据集上,该方法实现了83.4%的平均准确率,在所有域泛化设置中均优于基线和现有最先进方法。
  • 在Office-Home数据集上,该方法实现了73.8%的平均准确率,展现出在多样化视觉领域中的强大泛化能力。
  • 在使用六个医学数据集的皮肤病变分类任务中,该方法实现了81.31%的平均准确率,较基线提升2.33%,较MixStyle提升2.93%。
  • 消融实验表明,FSR在源域和目标域上均提升了性能,表明其在不牺牲源域表现的前提下增强了泛化能力。
  • 渐进式训练策略显著提升了模型收敛性和性能,表明全网络优化对于最大化FSR优势至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。