Skip to main content
QUICK REVIEW

[论文解读] Sampling To Improve Predictions For Underrepresented Observations In Imbalanced Data

Rune D. Kjærsgaard, Manja Gersholm Grønberg|arXiv (Cornell University)|Nov 17, 2021
Imbalanced Data Classification Techniques参考文献 7被引用 4
一句话总结

本文提出基于采样的数据增强方法,以提升模型在数据分布不均的生产数据中对代表性不足的输入区域的性能,采用三种策略:在数据边缘附近随机采样、在高密度区域随机采样,以及基于密度的加权采样。结果表明,尽管整体RMSE略微增加约3%,但所有方法均显著改善了低密度、代表性不足的观测值预测效果——尤其是基于密度的采样方法——表明在数据分布不均的情况下,需要采用更公平的评估方法。

ABSTRACT

Data imbalance is common in production data, where controlled production settings require data to fall within a narrow range of variation and data are collected with quality assessment in mind, rather than data analytic insights. This imbalance negatively impacts the predictive performance of models on underrepresented observations. We propose sampling to adjust for this imbalance with the goal of improving the performance of models trained on historical production data. We investigate the use of three sampling approaches to adjust for imbalance. The goal is to downsample the covariates in the training data and subsequently fit a regression model. We investigate how the predictive power of the model changes when using either the sampled or the original data for training. We apply our methods on a large biopharmaceutical manufacturing data set from an advanced simulation of penicillin production and find that fitting a model using the sampled data gives a small reduction in the overall predictive performance, but yields a systematically better performance on underrepresented observations. In addition, the results emphasize the need for alternative, fair, and balanced model evaluations.

研究动机与目标

  • 解决在受控条件下采集、变化有限的不平衡生产数据中,代表性不足的输入区域预测性能较差的挑战。
  • 探究采样策略是否能够重新平衡输入空间,从而提升模型在罕见或边缘情况观测值上的泛化能力。
  • 评估在具有连续目标变量的回归任务中,整体模型性能与对代表性不足数据点的公平性之间的权衡。
  • 证明在数据分布不均的场景下,聚焦于代表性不足区域的替代评估指标对于实现公平的模型评估至关重要。

提出的方法

  • 提出三种采样策略:(a) 在输入超矩形内随机采样,随后选择最近邻;(b) 在超矩形内随机采样,随后对最近的5个邻居特征取平均;(c) 使用到最近邻的倒数距离作为采样权重,进行基于密度的采样。
  • 将这些采样方法应用于生成一个更均衡的新训练集,新数据集大小为原始训练集的20%(其中10%来自边缘采样,10%来自高密度区域采样)。
  • 在采样后的训练数据上训练线性回归模型,并与在完整原始训练集上训练的模型进行比较,使用测试集上的均方根误差(RMSE)作为评估指标。
  • 使用主成分分析(PCA)可视化数据分布,识别低密度(代表性不足)区域,特别是与生物制药批次中工艺偏差相关的区域。
  • 通过训练集中第100个最近邻的平均距离来衡量代表性不足程度,距离越大表示密度越低、代表性越不足。
  • 比较完整数据模型与采样模型在测试数据上的残差,重点关注代表性不足区域的性能差异。

实验结果

研究问题

  • RQ1能否通过重新平衡输入空间的采样策略,提升在数据分布不均的回归数据中代表性不足观测值的预测性能?
  • RQ2与在完整原始数据集上训练的模型相比,基于采样数据训练的模型在整体RMSE和代表性不足区域的性能表现如何?
  • RQ3在随机边缘采样、随机高密度区域采样和基于密度的采样三种策略中,哪一种在整体性能与对低密度区域的公平性之间实现了最优权衡?
  • RQ4标准RMSE在不平衡测试集上的评估在多大程度上掩盖了代表性不足数据点的差性能?需要何种替代评估方法?

主要发现

  • 基于密度的采样方法在三种采样策略中取得了最低的整体RMSE,表明其在输入空间中具有更好的泛化能力。
  • 在完整的不平衡测试集上,所有采样方法相比完整数据模型均导致约3%的RMSE上升,表明整体性能存在轻微但可测量的权衡。
  • 在代表性最不足的10%观测值(以到100个最近邻的平均距离衡量)中,所有采样策略相比完整数据模型均显著降低了RMSE,表明在低密度区域的性能得到改善。
  • PCA可视化显示,代表性不足的观测值集中于低密度区域,主要来自出现工艺偏差的批次(如第91–100批),这些区域从采样中获得了最大的性能提升。
  • 基于密度的采样方法在低密度区域表现出最一致的改进,特别是在PCA投影的左上角和右下角边缘区域,其残差始终低于完整数据模型。
  • 结果凸显了在不平衡数据上使用标准RMSE评估的严重局限性:它倾向于偏向代表性过高的区域,可能掩盖代表性不足但可能更为关键的观测值的差性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。