[论文解读] A Unified Framework for Task-Driven Data Quality Management
该论文提出 DataSifter,一种面向统一数据质量管理的任务驱动、模型无关框架,通过学习的数据效用模型将数据选择建模为优化问题。该方法在包括后门检测、数据去偏和噪声标签去除在内的多种数据质量管理(DQM)任务中,超越了现有的基于数据估值的方法——尤其是 Shapley 值方法,实现了最先进性能,同时通过支配分析提供了理论上的最坏情况性能保证。
High-quality data is critical to train performant Machine Learning (ML) models, highlighting the importance of Data Quality Management (DQM). Existing DQM schemes often cannot satisfactorily improve ML performance because, by design, they are oblivious to downstream ML tasks. Besides, they cannot handle various data quality issues (especially those caused by adversarial attacks) and have limited applications to only certain types of ML models. Recently, data valuation approaches (e.g., based on the Shapley value) have been leveraged to perform DQM; yet, empirical studies have observed that their performance varies considerably based on the underlying data and training process. In this paper, we propose a task-driven, multi-purpose, model-agnostic DQM framework, DataSifter, which is optimized towards a given downstream ML task, capable of effectively removing data points with various defects, and applicable to diverse models. Specifically, we formulate DQM as an optimization problem and devise a scalable algorithm to solve it. Furthermore, we propose a theoretical framework for comparing the worst-case performance of different DQM strategies. Remarkably, our results show that the popular strategy based on the Shapley value may end up choosing the worst data subset in certain practical scenarios. Our evaluation shows that DataSifter achieves and most often significantly improves the state-of-the-art performance over a wide range of DQM tasks, including backdoor, poison, noisy/mislabel data detection, data summarization, and data debiasing.
研究动机与目标
- 解决现有数据质量管理(DQM)方案在机器学习模型无关、任务无关以及对多样化数据缺陷应对无效等方面的局限性。
- 克服基于流行数据估值的 DQM 方法(如使用 Shapley 值的方法)在最坏情况下的性能保证较差的问题。
- 开发一种可扩展的、多用途的 DQM 框架,适用于多种机器学习模型和数据质量问题,包括对抗攻击、标签噪声和偏见。
- 基于支配分析,构建一个理论框架,用于严格比较不同 DQM 策略的最坏情况性能。
- 实现对未见数据点的数据效用估计,以支持数据获取决策和子集选择。
提出的方法
- 将 DQM 建模为一个最优数据选择问题,目标是最大化下游机器学习任务的性能。
- 利用小规模验证集,通过 DeepSet(一种集合函数学习架构)学习数据效用模型,以预测数据子集的贡献。
- 通过最大化学习到的效用模型来优化数据子集选择,实现模型无关且任务驱动的选择。
- 采用可扩展的采样方法估计数据效用,减少在大规模数据集上进行完整微调的需求。
- 提出一种基于支配分析的理论框架,以严格比较不同 DQM 策略的最坏情况性能。
- 利用效用模型估计未见数据点的效用,从而在可扩展性上超越传统基于估值的方法。
实验结果
研究问题
- RQ1统一的、任务驱动的 DQM 框架是否能在多种数据质量问题上超越现有的基于数据估值的方法?
- RQ2在实际场景中,基于 Shapley 值的 DQM 策略的最坏情况性能与替代方法相比如何?
- RQ3学习到的数据效用模型在数据选择中,相较于在完整数据集上重新训练,能在多大程度上提升可扩展性和泛化能力?
- RQ4基于支配分析的所提理论框架是否能为 DQM 策略提供有意义的性能保证?
- RQ5DataSifter 的模型无关设计是否能在不同机器学习模型和数据缺陷类型上保持强大性能?
主要发现
- 在后门检测、噪声/错误标签检测、数据摘要和数据去偏任务中,DataSifter 显著优于最先进的基于数据估值的 DQM 方法。
- 尽管 Shapley 值方法广受欢迎,但理论分析(基于支配分析)表明,其在某些实际场景中可能选择到最差的数据子集。
- 在 10,000 个被污染的 CIFAR-10 子集上,DataSifter 在单张 GPU 上 5 小时内即实现优越性能,而 LOO、Least Core 和大多数 Shapley 变体在 24 小时内未能完成计算。
- DataSifter 的学习效用模型能够准确估计未见数据点的效用,而传统基于估值的方法则需要在完整数据集上重新训练。
- 该框架在八个不同数据集和六个不同 DQM 任务中均达到最先进性能,展现出强大的鲁棒性和泛化能力。
- 实证结果证实,DataSifter 的效用学习模型泛化能力良好,可在无需在大规模数据集上完整微调的情况下实现高效子集选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。