Skip to main content
QUICK REVIEW

[论文解读] Fix your Models by Fixing your Datasets

Atindriyo Sanyal, Vikram Chatterji|arXiv (Cornell University)|Dec 15, 2021
Big Data and Business Intelligence被引用 4
一句话总结

本文提出一种以数据为中心的框架,通过系统性地识别噪声标签并选择最具信息量的样本进行标注,以提升机器学习模型性能。结合置信度-确定性方法与基于确定性的方法,该方法降低了标注成本并提升了准确率——在去噪后,毒性数据集的F1最高达到99.7%,企业数据集达到92.7%。

ABSTRACT

The quality of underlying training data is very crucial for building performant machine learning models with wider generalizabilty. However, current machine learning (ML) tools lack streamlined processes for improving the data quality. So, getting data quality insights and iteratively pruning the errors to obtain a dataset which is most representative of downstream use cases is still an ad-hoc manual process. Our work addresses this data tooling gap, required to build improved ML workflows purely through data-centric techniques. More specifically, we introduce a systematic framework for (1) finding noisy or mislabelled samples in the dataset and, (2) identifying the most informative samples, which when included in training would provide maximal model performance lift. We demonstrate the efficacy of our framework on public as well as private enterprise datasets of two Fortune 500 companies, and are confident this work will form the basis for ML teams to perform more intelligent data discovery and pruning.

研究动机与目标

  • 解决机器学习工作流中缺乏系统性数据质量工具的问题,该问题导致数据清洗和标注过程低效且依赖人工。
  • 通过识别并移除错误标注的数据,而非盲目扩大数据集规模,降低模型训练成本并提升泛化能力。
  • 通过选择最能提升模型性能的信息量最大的样本,优化有限的标注预算。
  • 通过以数据为中心的技术,实现在生产环境中可扩展、自动化的数据可观测性。
  • 在公共数据集和私有企业数据集上验证框架的实际适用性,证明其在现实场景中的影响。

提出的方法

  • 使用依赖数据的置信度-确定性度量,结合模型置信度(μ)与预测间隔(δ),对每个样本的误标可能性进行评分。
  • 基于倒数第二轮训练周期的输出,将最低置信度-确定性评分的第90百分位数作为噪声标签候选。
  • 采用数据无关的方法,利用置信学习估计类别条件联合分布(Q),并通过高置信度分数识别错误标注样本。
  • 对未标注数据应用核心集选择(core-set selection),以识别多样化且高影响力的样本,从而在最小标注预算下提升模型性能。
  • 利用预训练基线模型的模型嵌入计算核心集多样性,确保覆盖决策边界和稀有聚类。
  • 将两种方法整合进一个流水线,支持迭代式数据去噪与选择性标注,最大限度减少人工干预,同时最大化性能提升。

实验结果

研究问题

  • RQ1在不修改模型架构的前提下,如何系统性地检测机器学习数据集中存在噪声或错误标注的样本?
  • RQ2在真实数据集中,依赖数据的方法与非依赖数据的方法在识别标签错误方面的相对有效性如何?
  • RQ3如何最优地分配有限的标注预算,以最大化模型性能的提升?
  • RQ4核心集选择是否能在捕捉多样化、高信息量样本方面优于基于确定性的采样方法?
  • RQ5在生产环境中,以数据为中心的技术在多大程度上可降低标注成本,同时提升模型准确率与鲁棒性?

主要发现

  • 置信度-确定性方法在Newsgroup20数据集中识别出2,032个错误标注样本,减少了由错误标签引发的性能下降,F1提升至98.9%。
  • 基于确定性的方法在Toxicity数据集中实现了99.7%的F1,优于基线模型,展现出在噪声真实数据上的强大泛化能力。
  • 核心集采样在Newsgroup20数据集中仅使用300个选定样本即达到0.52的F1,优于随机采样与基于确定性的采样,能更有效地捕捉多样化数据区域。
  • 在私有企业数据集上,该框架分别将错误标注样本减少382例和117例,去噪后准确率分别提升至92.7%和86.3%。
  • 核心集方法捕捉到了嵌入空间右上区域中此前未见的聚类,相较于基于确定性的采样,展现出更优的多样性。
  • 该框架通过支持更小但质量更高的数据集,显著减少了模型训练时间与标注成本,且未牺牲性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。