[论文解读] Learn to Expect the Unexpected: Probably Approximately Correct Domain Generalization
该论文提出了一种新颖的 Probably Approximately Correct (PAC) 域泛化框架,其中学习算法在来自元分布的多个不同域的数据集上进行训练,从而能够泛化到未见过的域。该方法在三种设置下使用鲁棒特征选择和高效算法——Massart 噪声、决策树和特征选择——通过过滤掉虚假相关性,实现了改进的跨域泛化,且在训练集之外的 100所大学的网页上进行了实证验证。
Domain generalization is the problem of machine learning when the training data and the test data come from different data domains. We present a simple theoretical model of learning to generalize across domains in which there is a meta-distribution over data distributions, and those data distributions may even have different supports. In our model, the training data given to a learning algorithm consists of multiple datasets each from a single domain drawn in turn from the meta-distribution. We study this model in three different problem settings---a multi-domain Massart noise setting, a decision tree multi-dataset setting, and a feature selection setting, and find that computationally efficient, polynomial-sample domain generalization is possible in each. Experiments demonstrate that our feature selection algorithm indeed ignores spurious correlations and improves generalization.
研究动机与目标
- 将域泛化形式化为数据域上的元分布,以实现对未见域泛化能力的理论分析。
- 解决当训练数据和测试数据来自具有潜在不相交支撑的不同域时,学习鲁棒模型的挑战。
- 开发计算高效的算法,实现在不依赖域特定特征的前提下跨域泛化。
- 通过实证验证,证明过滤掉在域之间方差较高的特征可提升在未见大学上的性能。
提出的方法
- 通过数据分布上的元分布对域泛化进行建模,其中训练数据由多个特定域的数据集组成。
- 提出一种从多域 Massart 噪声学习到标准 PAC 学习(在随机分类噪声下)的约化方法。
- 设计了一种 $O(n + s)$ 时间复杂度的高效算法,用于在假设目标树中每个域的所有样本均属于单个叶节点的条件下,进行 PAC 学习决策树。
- 提出一种特征选择算法(FSUS),基于跨域的相关性鲁棒性选择特征,对相关系数标准差较高的特征施加惩罚。
- 使用正则化得分 $s_k = | ho_k| - \alpha \cdot \text{stdev}(\rho_k^1, \dots, \rho_k^d)$ 来识别在域之间具有预测力的特征。
- 在来自 4 所大学的网页数据集上实证评估该方法,测试对象为 100 所未见大学,采用平衡误差率作为评估指标。
实验结果
研究问题
- RQ1在域可能具有不同支撑和噪声率的多域设置下,能否实现计算高效的域泛化?
- RQ2如何设计一种特征选择方法,以识别并剔除在域之间变化的虚假相关性?
- RQ3能否通过利用数据中域特定的结构,降低在域偏移下决策树学习的复杂度?
- RQ4特征相关性在域之间的鲁棒性是否与在未见域上的泛化性能提升相关?
- RQ5与标准 PAC 学习相比,域的元分布模型能否提供更强的样本内和样本外泛化保证?
主要发现
- 所提出的特征选择算法(FSUS)在所有分类器和特征数量下,均优于标准基线,尤其在多域训练时表现更优。
- 该算法自动识别并剔除了虚假特征(如与下载时间相关的词语 '19'),通过惩罚相关性在域间变化的高方差。
- 在网页数据集上,该方法在 100 所未见大学上的泛化性能优于基线,尽管训练集不包含这些机构的数据。
- 决策树算法实现了 $O(n + s)$ 的运行时间,相较于在相同结构假设下的 $n^{O(\log s)}$ 基线有显著提升。
- 验证误差估计(K=1 到 4)显示,在不同数量的训练域下均表现出一致的性能提升,表明对域划分具有鲁棒性。
- 调节正则化参数 $\alpha$ 对性能影响极小,表明该方法稳定且对超参数选择不敏感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。