[论文解读] Incorporating Unlabeled Data into Distributionally Robust Learning
本文提出了一种分布鲁棒学习框架,通过利用未标记数据来约束对手的可行分布集合,从而提升泛化保证,并在传统方法失效的情况下实现可信预测。通过利用未标记数据,基于Wasserstein距离和最优传输方法对模糊集进行细化,该方法获得了更紧致的性能边界,并在主动学习和鲁棒分类任务中优于标准方法。
We study a robust alternative to empirical risk minimization called distributionally robust learning (DRL), in which one learns to perform against an adversary who can choose the data distribution from a specified set of distributions. We illustrate a problem with current DRL formulations, which rely on an overly broad definition of allowed distributions for the adversary, leading to learned classifiers that are unable to predict with any confidence. We propose a solution that incorporates unlabeled data into the DRL problem to further constrain the adversary. We show that this new formulation is tractable for stochastic gradient-based optimization and yields a computable guarantee on the future performance of the learned classifier, analogous to -- but tighter than -- guarantees from conventional DRL. We examine the performance of this new formulation on 14 real datasets and find that it often yields effective classifiers with nontrivial performance guarantees in situations where conventional DRL produces neither. Inspired by these results, we extend our DRL formulation to active learning with a novel, distributionally-robust version of the standard model-change heuristic. Our active learning algorithm often achieves superior learning performance to the original heuristic on real datasets.
研究动机与目标
- 解决分布鲁棒学习(DRL)中模糊集过于宽泛的问题,该问题会导致无效预测且缺乏置信度。
- 通过利用未标记数据来约束对手的可行分布集合,改进DRL中的泛化保证。
- 构建一种适用于DRL中未标记数据的可计算优化框架,以实现可计算的、非平凡的性能边界。
- 通过引入一种分布鲁棒的模型变化启发式方法,将所提出的DRL框架扩展至主动学习,提升样本效率。
- 通过实证结果证明,所提方法在14个真实数据集上可生成有效分类器,并具备非平凡的性能保证,而传统DRL方法因模糊集过宽而失效。
提出的方法
- 构建一个分布鲁棒学习问题,其中对手的模糊集受到两重约束:围绕标记数据经验分布的Wasserstein球,以及由未标记数据导出的边缘分布约束。
- 利用最优传输和Wasserstein距离定义模糊集,确保集合中的分布与标记数据接近,并与未标记数据的特征分布保持一致。
- 引入DRL问题的对偶形式,使能使用未标记数据进行基于随机梯度的优化,从而收紧对手的约束条件。
- 通过在受限模糊集上计算最坏情况下的期望损失,构建一种分布鲁棒的主动学习启发式方法,选择在分布漂移下可能引发最大模型变化的样本。
- 采用Adam优化器配合自适应学习率和批量处理,高效求解对偶优化问题。
- 通过Clopper-Pearson区间估计标签概率边界,并利用二分查找确定维持可行性的最小Wasserstein半径,从而在保证鲁棒性的同时避免过度保守。
实验结果
研究问题
- RQ1能否利用未标记数据来约束分布鲁棒学习中对手的模糊集,以提升预测置信度?
- RQ2与传统DRL相比,引入未标记数据是否能带来更紧致、非平凡的泛化保证?
- RQ3所提出的DRL框架能否扩展至主动学习并实现更高的样本效率?
- RQ4所提出的分布鲁棒主动学习启发式方法相较于标准启发式方法和随机采样,性能表现如何?
- RQ5在何种场景下,所提方法能生成有效分类器,而传统DRL因模糊集过宽而失效?
主要发现
- 所提方法在14个真实数据集上实现了非平凡的性能保证,而传统DRL因模糊集过宽导致边界无效。
- 引入未标记数据显著收紧了对手的可行分布集合,使分类器能够做出自信预测,而非分配均匀的类别概率。
- 所提出的分布鲁棒主动学习启发式方法在预测置信度提升方面优于均匀随机采样和标准模型变化启发式方法。
- 在主动学习评估中,所提方法的置信度曲线下方面积是基线方法的100倍,表明其具有更高的样本效率。
- 该方法保持了可计算性与可扩展性,通过Adam优化器和对偶形式实现随机梯度下降求解。
- 通过使用置信区间估计标签概率并自适应选择半径,确保了鲁棒性,同时维持了可行性与计算效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。