[论文解读] Self-training Avoids Using Spurious Features Under Domain Shift
该论文表明,在大规模领域偏移下,使用未标注的目标数据进行自训练可以避免学习虚假特征(即在源域中存在相关性但在目标域中不存在的相关性)。对于具有高斯虚假特征和对数凹信号特征的线性模型,当使用足够准确的源分类器进行初始化时,即使在存在不良局部极小值的非凸设置下,自训练仍会收敛到虚假特征权重为零的解。
In unsupervised domain adaptation, existing theory focuses on situations where the source and target domains are close. In practice, conditional entropy minimization and pseudo-labeling work even when the domain shifts are much larger than those analyzed by existing theory. We identify and analyze one particular setting where the domain shift can be large, but these algorithms provably work: certain spurious features correlate with the label in the source domain but are independent of the label in the target. Our analysis considers linear classification where the spurious features are Gaussian and the non-spurious features are a mixture of log-concave distributions. For this setting, we prove that entropy minimization on unlabeled target data will avoid using the spurious feature if initialized with a decently accurate source classifier, even though the objective is non-convex and contains multiple bad local minima using the spurious features. We verify our theory for spurious domain shift tasks on semi-synthetic Celeb-A and MNIST datasets. Our results suggest that practitioners collect and self-train on large, diverse datasets to reduce biases in classifiers even if labeling is impractical.
研究动机与目标
- 理解为何自训练和熵最小化在存在大规模领域偏移的无监督领域自适应中仍能有效工作。
- 分析自训练避免学习虚假特征的条件,这些虚假特征在源域中与标签相关,但在目标域中无关。
- 在存在多个局部极小值的非凸设置下,为自训练建立理论保证。
- 验证当标注数据稀缺时,大规模且多样化的未标注数据集仍能减少模型偏差。
提出的方法
- 形式化定义了一种结构化的领域偏移设置,其中虚假特征在源域中与标签相关,但在目标域中为独立。
- 分析了具有高斯虚假特征和来自对数凹分布混合的信号特征的线性分类问题。
- 证明了在两种条件下,通过熵最小化或伪标签法进行的自训练会收敛到虚假特征系数为零的解:信号分布充分分离,且初始源分类器具有足够准确性。
- 在包含多层神经网络的半合成Celeb-A和MNIST数据集上实证验证了结果。
- 采用熵最小化和一种随机伪标签变体,其中伪标签在每次SGD步骤后更新。
- 应用置信度阈值和批量重采样技术,以模拟实际的自训练流水线。
实验结果
研究问题
- RQ1在何种条件下,自训练可以避免学习在源域中与标签相关但在目标域中无关的虚假特征?
- RQ2在存在大规模领域偏移和非凸损失曲面的情况下,熵最小化或伪标签法能否收敛至贝叶斯最优解?
- RQ3使用源分类器进行初始化在多大程度上影响最终模型对虚假特征的依赖?
- RQ4当缺乏标注数据时,大规模且多样化的未标注数据集在多大程度上有助于减少模型偏差?
主要发现
- 当使用足够准确的源分类器进行初始化时,使用未标注目标数据的自训练会收敛到虚假特征权重为零的解。
- 在单变量高斯信号设置下,自训练收敛至贝叶斯最优解。
- 在包含性别-发色虚假相关性的半合成Celeb-A数据集中,目标域准确率从81%提升至88%。
- 在高斯混合实验中,熵最小化和伪标签法均将目标准确率从95.9%提升至97.5%,并将虚假特征权重从0.33降低至0。
- 尽管损失曲面为非凸且包含利用虚假特征的不良局部极小值,理论保证依然成立。
- 实证结果表明,更频繁的伪标签更新(例如30轮,每轮10个周期)优于较少轮次但训练时间更长的设置,与熵最小化的行为一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。