Skip to main content
QUICK REVIEW

[论文解读] Impact of Biases in Big Data

Patrick Glauner, Petko Valtchev|arXiv (Cornell University)|Mar 2, 2018
Imbalanced Data Classification Techniques参考文献 21被引用 9
一句话总结

本文系统性地回顾了大数据机器学习中的两类主要偏差——类别不平衡与协变量偏移,表明仅增加数据量并不能确保模型的可靠性。文章提出利用马修斯相关系数(MCC)和决策树来量化协变量偏移的检测方法,并采用实例加权和 Heckman 方法等校正技术,证明数据代表性比数据量更为关键。

ABSTRACT

The underlying paradigm of big data-driven machine learning reflects the desire of deriving better conclusions from simply analyzing more data, without the necessity of looking at theory and models. Is having simply more data always helpful? In 1936, The Literary Digest collected 2.3M filled in questionnaires to predict the outcome of that year's US presidential election. The outcome of this big data prediction proved to be entirely wrong, whereas George Gallup only needed 3K handpicked people to make an accurate prediction. Generally, biases occur in machine learning whenever the distributions of training set and test set are different. In this work, we provide a review of different sorts of biases in (big) data sets in machine learning. We provide definitions and discussions of the most commonly appearing biases in machine learning: class imbalance and covariate shift. We also show how these biases can be quantified and corrected. This work is an introductory text for both researchers and practitioners to become more aware of this topic and thus to derive more reliable models for their learning problems.

研究动机与目标

  • 提高研究人员和实践者对机器学习中数据偏差影响的认识。
  • 识别并定义最常见的数据偏差,特别是类别不平衡与协变量偏移。
  • 提供可量化的检测方法,用于识别训练数据与测试数据分布中的偏差。
  • 提出实例加权和 Heckman 方法等校正技术,以减轻偏差的影响。
  • 论证数据代表性比数据量更关键,对模型可靠性具有决定性影响。

提出的方法

  • 使用马修斯相关系数(MCC)量化训练数据与测试数据之间协变量偏移的程度。
  • 通过引入二元标签(s=1 表示训练数据,s=0 表示测试数据),应用决策树学习来区分训练与测试数据的分布。
  • 采用密度估计进行实例加权,以在模型训练过程中校正协变量偏移。
  • 将 Heckman 方法适配于线性回归,以校正训练数据中的选择偏差,但该方法仅适用于线性模型。
  • 分析全局学习器与局部学习器的区别:全局学习器依赖于 P(X),而局部学习器仅依赖于 P(Y|X),因此对协变量偏移的敏感性较低。
  • 提出对神经网络各层输入进行归一化,以缓解内部协变量偏移,提升训练收敛性并减少过拟合。

实验结果

研究问题

  • RQ1类别不平衡与协变量偏移如何影响机器学习模型的可靠性与泛化能力?
  • RQ2哪些指标能够有效量化现实世界数据集中协变量偏移的存在与严重程度?
  • RQ3在多大程度上,数据代表性可以超越数据量,从而提升模型性能?
  • RQ4在训练过程中,如何校正深度神经网络中的内部协变量偏移等偏差?
  • RQ5现有校正技术(如 Heckman 方法)在非线性学习场景下的局限性是什么?

主要发现

  • 1936 年《文学摘要》的选举预测失败,是由于样本存在偏差(仅包含汽车拥有者与电话用户),尽管回收了 230 万个回复,这说明数据量无法弥补代表性不足的问题。
  • 乔治·盖洛普仅通过 3,000 名精心挑选的受访者便实现了准确预测,凸显了无偏采样相较于大规模但不具代表性的数据的重要性。
  • 将马修斯相关系数(MCC)应用于训练以区分训练与测试数据的决策树,可提供协变量偏移程度的定量度量。
  • 全局学习器(如决策树与软间隔支持向量机)对协变量偏移敏感,而局部学习器(如逻辑回归与硬间隔支持向量机)则不敏感。
  • 通过密度估计进行实例加权,以及 Heckman 方法,均可用于校正协变量偏移,但后者仅限于线性模型。
  • 深度网络中的内部协变量偏移会减缓训练速度并增加过拟合风险,但通过每层输入的归一化可有效缓解,从而提升收敛性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。