[论文解读] Selecting Data Augmentation for Simulating Interventions
本文提出一种因果框架,用于指导领域泛化中的数据增强,表明有效的增强通过模拟干预削弱了领域与标签之间的虚假相关性。通过使用领域分类器选择那些破坏领域特异性特征但不影响与标签相关特征的增强方法,该方法在多个基准测试中优于现有的领域泛化技术。
Machine learning models trained with purely observational data and the principle of empirical risk minimization \citep{vapnik_principles_1992} can fail to generalize to unseen domains. In this paper, we focus on the case where the problem arises through spurious correlation between the observed domains and the actual task labels. We find that many domain generalization methods do not explicitly take this spurious correlation into account. Instead, especially in more application-oriented research areas like medical imaging or robotics, data augmentation techniques that are based on heuristics are used to learn domain invariant features. To bridge the gap between theory and practice, we develop a causal perspective on the problem of domain generalization. We argue that causal concepts can be used to explain the success of data augmentation by describing how they can weaken the spurious correlation between the observed domains and the task labels. We demonstrate that data augmentation can serve as a tool for simulating interventional data. We use these theoretical insights to derive a simple algorithm that is able to select data augmentation techniques that will lead to better domain generalization.
研究动机与目标
- 解决由于观测数据中领域与标签之间存在虚假相关性而导致领域泛化模型失效的问题。
- 弥合理论性领域泛化方法与医学影像和机器人学等应用领域中基于启发式的数据增强实践之间的差距。
- 将数据增强形式化为仅使用观测数据模拟干预的工具,其基础是因果推断。
- 开发一种实用算法,用于选择能够通过削弱领域特异性混杂因素来提升泛化能力的数据增强技术。
提出的方法
- 引入干预增强等变性,形式化数据增强与领域变量上的 do-计算干预之间的关系。
- 使用带有隐性混杂因子的结构因果模型(SCM)来建模领域(d)与标签(y)之间的虚假相关性,其中 d 会影响与 y 无因果关系的高层特征(hd)。
- 提出一种选择算法,利用领域分类器评估每种增强方法在多大程度上降低了高层特征(hd)对领域变量 d 的预测能力。
- 将数据增强作为对对称群(如颜色抖动、旋转)的随机抽样来应用,确保变换仅作用于标签 y 的非后代节点,以保留与任务相关的特征。
- 仅使用所选增强方法通过经验风险最小化(ERM)训练模型,避免破坏性组合损害与标签相关的特征。
- 在三个基准测试上评估该方法:PACS、Colored MNIST 和 Rotated MNIST,与 10 种 SOTA 领域泛化方法进行比较。
实验结果
研究问题
- RQ1在缺乏 do-计算干预的情况下,能否对数据增强作为模拟干预的方法进行形式化证明?
- RQ2如何选择数据增强技术,以削弱领域与标签之间的虚假相关性,同时不损害与任务相关的特征?
- RQ3在存在隐性混杂因子的情况下,数据增强通过何种因果机制改善领域泛化?
- RQ4基于领域分类器性能选择增强方法,是否能带来比标准或无指导增强更好的泛化效果?
主要发现
- 所提方法 DA(数据增强选择)在所有三个基准测试中均取得最高平均准确率:PACS 上为 74.9%,Colored MNIST 上为 74.1%,Rotated MNIST 上为 95.9%。
- DA 在 'sketch' 和 'art painting' 测试领域中显著优于 ERM 和所有 10 种 SOTA 领域泛化方法,其中颜色和风格是虚假线索。
- 将所有数据增强技术一并使用时,PACS 上准确率下降 16.1%,Colored MNIST 上下降 8.7%,Rotated MNIST 上下降 25.4%,表明盲目增强会损害性能。
- 消融研究证实,某些增强方法(如 PACS 中的随机旋转)即使标签保持不变,也会破坏与方向相关的有用特征。
- 该方法成功识别出:在 'sketch' 领域中,颜色扰动可削弱虚假相关性,而颜色与类别身份无关。
- 因果框架解释了为何某些增强方法会失效:它们破坏了与标签 y 因果关联的特征(hy),即使标签本身未改变。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。