[论文解读] Robust Generalization despite Distribution Shift via Minimum Discriminating Information
该论文提出了一种基于最小差异信息的分布鲁棒优化框架,用于在已知测试分布部分结构知识的情况下建模分布偏移。通过结合最小差异信息原理、分布鲁棒优化与大偏差界限,该方法在分布偏移下实现了可证明的鲁棒泛化,在偏差分类与离策略评估任务中均优于现有方法。
Training models that perform well under distribution shifts is a central challenge in machine learning. In this paper, we introduce a modeling framework where, in addition to training data, we have partial structural knowledge of the shifted test distribution. We employ the principle of minimum discriminating information to embed the available prior knowledge, and use distributionally robust optimization to account for uncertainty due to the limited samples. By leveraging large deviation results, we obtain explicit generalization bounds with respect to the unknown shifted distribution. Lastly, we demonstrate the versatility of our framework by demonstrating it on two rather distinct applications: (1) training classifiers on systematically biased data and (2) off-policy evaluation in Markov Decision Processes.
研究动机与目标
- 解决现实世界机器学习应用中因分布偏移导致的模型性能下降问题。
- 开发一种基于部分结构知识与最小差异信息原理的建模未知测试分布的系统性方法。
- 利用大偏差理论,为分布偏移下的模型泛化提供显式边界。
- 在两类不同应用中验证该框架的有效性:偏差数据分类与马尔可夫决策过程中的离策略评估。
- 通过理论保证确保所得分布鲁棒优化模型的统计最优性。
提出的方法
- 通过最小化训练分布与未知测试分布之间的Kullback-Leibler散度来建模未知的偏移测试分布,同时施加编码先验结构知识的约束条件。
- 采用分布鲁棒优化(DRO)方法,在由最小差异信息原理定义的模糊集上最小化最坏情况下的期望损失。
- 利用大偏差结果推导泛化边界,确保在未知偏移分布下的性能保证。
- 通过凸对偶与加速一阶方法高效求解所得优化问题。
- 将该方法应用于两个不同场景:(1) 在已知人口统计分布偏移的系统性偏差数据上训练分类器;(2) 在已知行为策略约束的马尔可夫决策过程中进行离策略评估。
- 该框架实现为基于最小差异信息的DRO(MDI-DRO),其被证明具有统计最优性与计算高效性。
实验结果
研究问题
- RQ1当仅掌握关于偏移的部分结构信息时,如何建模未知的偏移测试分布?
- RQ2能否基于最小差异信息原理,为分布偏移下的机器学习模型推导出显式的泛化边界?
- RQ3在偏差数据与离策略评估任务中,所提出的MDI-DRO框架相较于现有方法在鲁棒性与泛化性能方面表现如何?
- RQ4在存在分布偏移与有限训练样本的情况下,所得DRO模型的统计最优性如何?
- RQ5MDI-DRO框架在实际中是否可高效求解,其计算保证为何?
主要发现
- MDI-DRO框架通过结合最小差异信息与分布鲁棒优化,实现了可证明的鲁棒泛化,确保在未知分布偏移下的性能保证。
- 该方法基于大偏差理论推导出显式泛化边界,对所有与先验结构约束一致的未知偏移分布均成立。
- 在m=6的合成偏差分类任务中,MDI-DRO在1000次独立实验中均优于现有方法,在测试准确率与鲁棒性方面表现更优。
- 在库存控制模型的离策略评估中,MDI-DRO在估计分布偏移下的长期平均成本方面优于基线方法,表现更优。
- 该框架中的优化问题可通过凸对偶与加速一阶方法高效求解,支持实际部署。
- DRO预测器具有连续性与良好行为特性,其证明基于Berge最大值定理与目标函数的连续性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。