[论文解读] Causal Balancing for Domain Generalization
本文提出Causal Balancing,一种新颖的域泛化方法,通过两步小批量采样策略将有偏的数据分布转化为无虚假相关性的平衡分布。该方法利用变分自编码器识别潜在协变量,并将训练样本匹配到最近的潜在聚类,从而在不同环境中实现极小化最大值最优的贝叶斯分类器,在DomainBed基准上超越20个基线模型,达到最先进性能。
While machine learning models rapidly advance the state-of-the-art on various real-world tasks, out-of-domain (OOD) generalization remains a challenging problem given the vulnerability of these models to spurious correlations. We propose a balanced mini-batch sampling strategy to transform a biased data distribution into a spurious-free balanced distribution, based on the invariance of the underlying causal mechanisms for the data generation process. We argue that the Bayes optimal classifiers trained on such balanced distribution are minimax optimal across a diverse enough environment space. We also provide an identifiability guarantee of the latent variable model of the proposed data generation process, when utilizing enough train environments. Experiments are conducted on DomainBed, demonstrating empirically that our method obtains the best performance across 20 baselines reported on the benchmark.
研究动机与目标
- 为解决机器学习中因环境间虚假相关性导致的分布外(OOD)泛化失败问题。
- 构建一种原则性、非线性的因果框架,实现在无需严格线性假设条件下的极小化最大值最优泛化。
- 通过潜在变量建模将观测数据分布转化为平衡且无虚假相关性的分布,以识别并消除虚假相关性。
- 在足够多训练环境的条件下,提供潜在混淆因子可识别性及所得分类器最优性的理论保证。
- 设计一种轻量化、灵活的采样策略,可无缝集成至现有深度学习模型与域泛化方法中。
提出的方法
- 训练变分自编码器(VAE)以建模观测数据分布,并从输入X中推断潜在协变量Z。
- 基于其潜在表征Z对训练样本进行聚类,通过选择距离每个聚类中心最近的样本,构建平衡的小批量数据。
- 所构建的平衡小批量确保每个潜在聚类内各类别Y均匀分布,从而降低虚假相关性。
- 该方法依赖于因果机制P(X|Y,Z)在不同环境中的不变性,假设Y → X,且Z为与领域相关的混淆因子。
- 理论分析表明,在平衡分布上训练的贝叶斯最优分类器在所有环境中均为极小化最大值最优。
- 该方法为即插即用型,仅需修改小批量采样策略,无需更改模型架构或损失函数。
实验结果
研究问题
- RQ1一种无虚假相关性的平衡数据分布,能否导致分布外泛化下的极小化最大值最优分类器?
- RQ2在非线性设定下,负责虚假相关性的潜在混淆因子Z,是否能从足够多的训练环境集合中被识别?
- RQ3一种简单、非侵入性的采样策略,能否在不修改模型或损失函数的前提下有效消除虚假相关性?
- RQ4在分布外泛化性能方面,所提出方法与现有域泛化基线相比表现如何?
- RQ5在真实世界数据集中,当其底层因果假设被违反时,该方法的鲁棒性如何?
主要发现
- 在所提出的平衡分布上训练的贝叶斯最优分类器,在所有环境中均为极小化最大值最优,为分布外泛化提供了理论基础。
- 在足够多训练环境可用时,所提出假设下潜在混淆因子Z可被识别。
- 该方法在DomainBed基准上实现最先进性能,超越了20个现有基线,在多个数据集和设置下表现优异。
- 实证结果表明性能显著提升,尤其在PACS和OfficeHome等具有挑战性的基准上,准确率较之前方法提升超过2%。
- 该方法对假设违反具有鲁棒性,实证结果表明即使真实世界数据不完全符合假设的因果结构,其性能依然强劲。
- 轻量级、基于采样的方法可无缝集成至复杂模型与现有域泛化框架中,无需修改架构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。