Skip to main content
QUICK REVIEW

[论文解读] Optimizing Data Collection for Machine Learning

Rafid Mahmood, James M. Lucas|arXiv (Cornell University)|Oct 3, 2022
Adversarial Robustness in Machine Learning被引用 11
一句话总结

本文提出了一种面向机器学习的最优数据收集框架,将数据收集建模为一个序列决策问题,以最小化预期未来成本并满足性能目标。通过采用梯度下降动态确定多个数据源的数据收集数量的Learn-Optimize-Collect(LOC)框架,与基线估计方法相比,失败率最高降低2倍,同时显著降低数据收集成本,实现近乎零的失败率。

ABSTRACT

Modern deep learning systems require huge data sets to achieve impressive performance, but there is little guidance on how much or what kind of data to collect. Over-collecting data incurs unnecessary present costs, while under-collecting may incur future costs and delay workflows. We propose a new paradigm for modeling the data collection workflow as a formal optimal data collection problem that allows designers to specify performance targets, collection costs, a time horizon, and penalties for failing to meet the targets. Additionally, this formulation generalizes to tasks requiring multiple data sources, such as labeled and unlabeled data used in semi-supervised learning. To solve our problem, we develop Learn-Optimize-Collect (LOC), which minimizes expected future collection costs. Finally, we numerically compare our framework to the conventional baseline of estimating data requirements by extrapolating from neural scaling laws. We significantly reduce the risks of failing to meet desired performance targets on several classification, segmentation, and detection tasks, while maintaining low total collection costs.

研究动机与目标

  • 为解决在确定机器学习模型所需数据量和数据类型时缺乏系统性指导的问题,避免数据过度或不足收集。
  • 将数据收集形式化为一个最优控制问题,综合考虑收集成本、性能目标、时间范围以及失败惩罚。
  • 开发一种可扩展的、基于梯度的方法,动态确定多个数据源(如标注数据、未标注数据、合成数据)的数据收集数量。
  • 将方法推广至多源、多成本设置,涵盖半监督学习和长尾学习等场景。
  • 通过实证结果证明,所提方法可在保持低总数据收集成本的同时,降低未能达成性能目标的风险。

提出的方法

  • 将数据收集建模为一个序列最优控制问题,通过多轮决策最小化预期总成本。
  • 提出Learn-Optimize-Collect(LOC)框架,利用梯度下降计算每轮应收集的最优数据量 $ q^*_t $。
  • 通过向量化数据收集与性能扩展的公式,将框架推广至具有不同成本和性能影响的多变量数据源。
  • 采用幂律函数或其他回归函数建模性能随数据规模的变化,利用自助抽样方法处理估计中的不确定性。
  • 迭代求解优化问题:每轮数据收集后,重新估计性能,更新不确定性,并重新优化下一轮的数据收集步骤。
  • 支持单源和多源数据收集,包括合成数据、未标注数据和长尾数据,具有不同的成本和性能特征。

实验结果

研究问题

  • RQ1如何将机器学习中的数据收集形式化为一个考虑成本、时间与性能目标的最优决策问题?
  • RQ2性能外推中的不确定性对数据收集决策有何影响?如何缓解这种影响?
  • RQ3基于梯度的优化框架能否在最小化总数据收集成本的同时,降低未能达成性能目标的风险?
  • RQ4与基线估计技术(如幂律外推)相比,所提方法在失败率和成本效率方面表现如何?
  • RQ5该框架在具有不同成本和性能贡献的数据源组合中,其泛化能力如何?

主要发现

  • 在分类、分割和检测任务中,LOC相较于基线估计方法,将平均失败率降低了约2倍。
  • 平均而言,当使用三个或更多轮次收集时,LOC在大多数任务中实现了近乎零的失败率(最低可达0%),同时保持了较低的成本比率。
  • 当 $ T = 5 $ 时,LOC相较于Mahmood等人 [2] 的校正因子基线,成本比率最高降低了整整一个数量级,尤其在分割和检测任务中表现显著。
  • 在CIFAR-100分类任务中,LOC将失败率从基线的14%($ T = 1 $)降低至4%,并在 $ T = 3 $ 和 $ T = 5 $ 时降至0%,且成本比率仅略有上升。
  • LOC在非分类任务(如BDD100K、nuScenes、VOC)中优于校正因子基线,后者需要预先数据进行调优,凸显了本方法更广泛的应用潜力。
  • 该方法在多源设置中表现出良好的泛化能力,包括未标注数据、合成数据和长尾数据,其成本与性能扩展行为各不相同。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。