[论文解读] Robust Learning from Untrusted Sources
本文提出了一种鲁棒学习框架,通过使用参考数据集自动为多个不可信数据源分配自适应权重,以最小化泛化误差的上界。该方法结合统计学习理论并支持局部信任度估计,在多种数据污染类型下均优于朴素聚合方法和鲁棒基线,即使在高数据污染情况下也能实现更优的准确率。
Modern machine learning methods often require more data for training than a single expert can provide. Therefore, it has become a standard procedure to collect data from external sources, e.g. via crowdsourcing. Unfortunately, the quality of these sources is not always guaranteed. As additional complications, the data might be stored in a distributed way, or might even have to remain private. In this work, we address the question of how to learn robustly in such scenarios. Studying the problem through the lens of statistical learning theory, we derive a procedure that allows for learning from all available sources, yet automatically suppresses irrelevant or corrupted data. We show by extensive experiments that our method provides significant improvements over alternative approaches from robust statistics and distributed optimization.
研究动机与目标
- 解决来自多个不可信、可能被污染的数据源时训练可靠模型的挑战。
- 开发一种方法,自动识别并降低低质量或恶意数据的权重,而无需对全部数据进行检查。
- 在无法集中收集或检查数据的分布式或隐私受限环境中确保鲁棒性。
- 通过使用源特定的信任评分最小化期望损失的上界,提升泛化能力。
提出的方法
- 该方法基于统计学习理论,推导出在加权经验风险上训练的预测器的期望损失的理论上界。
- 提出一种信任度量,通过将每个数据源与一个小的可信参考数据集进行比较,来量化其可靠性。
- 通过近似最小化推导出的泛化误差上界来学习源权重,优先选择与参考数据更接近的源。
- 信任度量可在每个源本地计算,或通过基于梯度的优化实现,支持隐私保护和分布式部署。
- 该方法可无缝集成到标准分布式学习框架中,支持集中式和去中心化训练。
- 该方法与底层学习算法无关,适用于一般的监督学习任务。
实验结果
研究问题
- RQ1当数据质量不确定且隐私限制导致数据访问受限时,如何从多个不可信数据源中实现鲁棒学习?
- RQ2为不可信数据源分配自适应权重的学习方法,能提供哪些理论保证?
- RQ3基于与参考数据集比较的信任度量,能否在分布式环境中有效抑制被污染或无关的数据?
- RQ4在各种污染类型下,该方法与朴素聚合(全部数据)或仅使用参考数据的训练相比表现如何?
- RQ5该方法在不共享原始数据的前提下,能在多大程度上部署于隐私保护或分布式学习环境中?
主要发现
- 所提出的方法在全部85个预测任务中,始终优于使用全部数据训练(在污染情况下性能下降)和仅使用参考数据集训练的方法。
- 在20%标签偏差情况下,该方法在n=10时实现了85项任务中的85次正确预测,显著优于基线方法(Feng et al., 2014)的5次和(Yin et al., 2018)的25次正确预测。
- 在标签打乱的情况下,该方法在n=10时实现了84次正确预测,优于(Pregibon, 1982)的47次和(Yin et al., 2018)的17次。
- 在图像模糊的情况下,该方法在n=10时实现了84次正确预测,优于(Pregibon, 1982)的57次和(Yin et al., 2018)的15次。
- 该方法在多种污染类型下表现出鲁棒性——包括标签偏差、标签打乱、图像模糊、死像素和RGB通道互换——在多个基线方法中持续表现更优。
- 即使在高污染水平(p=0.2)下,该方法仍保持高性能,且在数据分布或私密环境下无准确率下降,证实了其可扩展性和隐私合规性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。