[论文解读] VOS: a Method for Variational Oversampling of Imbalanced Data
本文提出 VOS(变分过采样),一种新颖的生成式过采样方法,利用变分自编码器(VAEs)为类别不平衡的数据集合成少数类样本。通过学习少数类数据的潜在分布并生成逼真的合成样本,VOS 在欺诈检测和癌症图像分类任务中显著优于 SMOTE 和 ADASYN,实现了最先进的 F1 分数和精确率。
Class imbalanced datasets are common in real-world applications that range from credit card fraud detection to rare disease diagnostics. Several popular classification algorithms assume that classes are approximately balanced, and hence build the accompanying objective function to maximize an overall accuracy rate. In these situations, optimizing the overall accuracy will lead to highly skewed predictions towards the majority class. Moreover, the negative business impact resulting from false positives (positive samples incorrectly classified as negative) can be detrimental. Many methods have been proposed to address the class imbalance problem, including methods such as over-sampling, under-sampling and cost-sensitive methods. In this paper, we consider the over-sampling method, where the aim is to augment the original dataset with synthetically created observations of the minority classes. In particular, inspired by the recent advances in generative modelling techniques (e.g., Variational Inference and Generative Adversarial Networks), we introduce a new oversampling technique based on variational autoencoders. Our experiments show that the new method is superior in augmenting datasets for downstream classification tasks when compared to traditional oversampling methods.
研究动机与目标
- 为解决现实世界数据集中类别不平衡的问题,其中少数类误分类会带来高业务和医疗风险。
- 开发一种生成式过采样方法,其生成的合成少数类样本质量高于传统方法(如 SMOTE 和 ADASYN)。
- 探索变分推断与 VAE 在表格数据和图像数据中少数类数据增强中的应用。
- 评估 VOS 在提升不平衡数据集上分类指标(如 F1 分数、精确率和准确率)方面的有效性。
- 证明该方法在不同分类器(如逻辑回归、MLP、随机森林、CNN)和数据类型(表格数据和图像)中的泛化能力。
提出的方法
- VOS 采用两阶段 VAE 架构:第一编码器将输入特征映射到潜在空间 $ z_1 $,第二编码器将 $ z_1 $ 映射到优化后的潜在空间 $ z_2 $,并利用目标响应条件化 $ z_2 $。
- 模型通过变分推断进行训练,以最大化少数类数据对数似然的下界,从而实现生成过程的端到端学习。
- 通过从 $ z_2 $ 中学习到的先验分布采样,经生成器网络解码,并重构到原始特征空间,生成合成少数类样本。
- 对于图像数据,VOS 生成的展平向量在输入 CNN 分类器前被重新塑形为 3D 图像张量。
- 该方法引入了 sample_weight 参数(合成样本设为 0.2),以防止下游训练过程中对生成数据的过拟合。
- 该方法被扩展至多分类场景,并在多种分类器(包括逻辑回归、MLP、随机森林和 CNN)上进行了测试。
实验结果
研究问题
- RQ1基于变分自编码器的生成模型是否能在类别不平衡数据集的分类性能上优于传统过采样方法(如 SMOTE 和 ADASYN)?
- RQ2VOS 在不同下游分类器(如逻辑回归、MLP、随机森林和 CNN)上的表现如何?
- RQ3在欺诈检测和癌症诊断等高风险应用中,VOS 对少数类预测的 F1 分数和精确率提升程度如何?
- RQ4与标准 VAE 相比,VAE 中采用的两阶段潜在结构是否能提升生成少数类样本的质量与多样性?
- RQ5该方法在不同数据模态(如表格数据和高维图像数据)上的泛化能力如何?
主要发现
- 在欺诈检测数据集上,VOS+LR 的 F1 分数达到 0.852,精确率为 0.802,显著优于 SMOTE+LR(F1:0.852,精确率:0.105)和 ADASYN+LR(F1:0.852,精确率:0.035)。
- 对于 MLP 分类器,VOS+MLP 的 F1 分数为 0.863,精确率为 0.830,优于 SMOTE+MLP(F1:0.852,精确率:0.236)和 ADASYN+MLP(F1:0.863,精确率:0.230)。
- 在随机森林实验中,VOS+RF 的 F1 分数为 0.773,精确率为 0.667,优于 SMOTE+RF(F1:0.891,精确率:0.905)和 ADASYN+RF(F1:0.878,精确率:0.878),尽管未使用过采样的随机森林表现也相当。
- 在 BreakHis 图像数据集上,VOS+CNN 的 F1 分数为 0.965,准确率为 0.943,显著优于基线 CNN(F1:0.926,准确率:0.900)。
- VOS 在逻辑回归和 MLP 上对精确率和 F1 分数的提升最为显著,表明其在少数类区分方面表现更优。
- 使用 sample_weight(合成数据设为 0.2)对结果影响极小,表明该方法对类别权重调整具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。