Skip to main content
QUICK REVIEW

[论文解读] On the Limitations of General Purpose Domain Generalisation Methods

Henry Gouk, Bohdal, Ondrej|arXiv (Cornell University)|Feb 1, 2022
Domain Adaptation and Few-Shot Learning被引用 5
一句话总结

本文提出了一种基于模型Rademacher复杂度的领域泛化(DG)学习理论泛化界,揭示了DG性能由经验风险与模型复杂度之间的权衡所决定。研究表明,基于领域划分的交叉验证结合正则化经验风险最小化优于基于实例的验证方法,并通过隐式控制模型复杂度实现了更强的泛化能力。

ABSTRACT

We investigate the fundamental performance limitations of learning algorithms in several Domain Generalisation (DG) settings. Motivated by the difficulty with which previously proposed methods have in reliably outperforming Empirical Risk Minimisation (ERM), we derive upper bounds on the excess risk of ERM, and lower bounds on the minimax excess risk. Our findings show that in all the DG settings we consider, it is not possible to significantly outperform ERM. Our conclusions are limited not only to the standard covariate shift setting, but also two other settings with additional restrictions on how domains can differ. The first constrains all domains to have a non-trivial bound on pairwise distances, as measured by a broad class of integral probability metrics. The second alternate setting considers a restricted class of DG problems where all domains have the same underlying support. Our analysis also suggests how different strategies can be used to optimise the performance of ERM in each of these DG setting. We also experimentally explore hypotheses suggested by our theoretical analysis.

研究动机与目标

  • 为解决通用领域泛化(DG)方法中缺乏原则性理论理解的问题,这些方法通常基于启发式设计。
  • 探究尽管经过大量开发,现有DG方法为何在性能上表现不一致,特别是与简单经验风险最小化(ERM)基线相比时。
  • 阐明在分布偏移条件下,模型复杂度与正则化在跨领域泛化中的作用。
  • 确定最优的模型选择策略——领域划分交叉验证与实例划分交叉验证——以实现稳健的DG性能。
  • 证明DG中的性能波动可由对模型复杂度的隐式或显式控制来解释,而不仅仅是网络架构或优化差异所致。

提出的方法

  • 提出一种新颖的DG泛化界,将模型在未见领域上的性能与模型的Rademacher复杂度联系起来,捕捉了对训练领域过拟合的现象。
  • 推导出经验风险与模型复杂度之间的理论权衡,类似于标准i.i.d.学习中的偏差-方差权衡。
  • 使用线性模型和现成的自监督特征(如DINO、ViT)来隔离并度量模型复杂度,避免神经网络的随机性影响。
  • 采用留一域排除交叉验证作为模型选择目标,以直接优化领域泛化性能。
  • 在DomainBed基准上,使用正则化(C)的线性SVM作为模型复杂度的代理,比较领域划分与实例划分验证策略。
  • 分析在多个数据集(PACS、VLCS、OfficeHome等)上,超参数选择(C)与泛化性能之间的关系。

实验结果

研究问题

  • RQ1作为Rademacher复杂度度量的模型复杂度,如何影响领域泛化中的泛化性能?
  • RQ2为何许多最先进DG方法无法超越经过良好调优的ERM基线?这是否可由隐式正则化或复杂度控制来解释?
  • RQ3与实例划分交叉验证相比,领域划分交叉验证是否是实现未见领域稳健泛化的更优模型选择目标?
  • RQ4与标准域内性能相比,领域泛化所需的最优正则化程度是多少?
  • RQ5DG方法的性能波动是否可一致地由其诱导的模型复杂度来解释,而非仅由网络架构或优化差异所致?

主要发现

  • 所提出的泛化界表明,未见领域性能受域内性能加上两项模型复杂度项的约束,将DG与偏差-方差权衡联系起来。
  • 在所有数据集上,包括RotatedMNIST、PACS、VLCS、OfficeHome和Terra Incognita,领域划分交叉验证始终选择更强的正则化(更低的C值),并实现比实例划分验证更高的准确率。
  • 在DINO特征上,领域划分验证在VLCS上实现了80.4%的准确率(log C = -1.04),而实例划分验证在log C = -0.87时达到80.5%,表明更强正则化带来更好的泛化性能。
  • 在SVIRO上,领域划分验证实现了97.2%的准确率(log C = 0.21),优于实例划分验证的95.3%(log C = 4.85),表明在强正则化下仍具持续优势。
  • SOTA DG方法的性能波动在很大程度上可由其隐式或显式控制的模型复杂度来解释,而不仅仅是架构创新所致。
  • 结果与Gulrajani & Lopez-Paz(2021)的发现相矛盾,后者认为实例划分验证更优,本文将此差异归因于深度神经网络中超参数调优的不准确性和随机性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。