[论文解读] Transfer-Learning Oriented Class Imbalance Learning for Cross-Project Defect Prediction
本文提出了一种面向迁移学习的跨项目缺陷预测方法TOMOFWTNB,同时解决类别不平衡与特征重要性问题。通过引入一种新型少数类过采样技术(TOMO),减少源项目与目标项目之间的分布差异,并将特征加权整合到朴素贝叶斯分类器中,该方法在最先进方法的基础上,使G-Measure至少提升27.8%,MCC至少提升71.5%。
Cross-project defect prediction (CPDP) aims to predict defects of projects lacking training data by using prediction models trained on historical defect data from other projects. However, since the distribution differences between datasets from different projects, it is still a challenge to build high-quality CPDP models. Unfortunately, class imbalanced nature of software defect datasets further increases the difficulty. In this paper, we propose a transferlearning oriented minority over-sampling technique (TOMO) based feature weighting transfer naive Bayes (FWTNB) approach (TOMOFWTNB) for CPDP by considering both classimbalance and feature importance problems. Differing from traditional over-sampling techniques, TOMO not only can balance the data but reduce the distribution difference. And then FWTNB is used to further increase the similarity of two distributions. Experiments are performed on 11 public defect datasets. The experimental results show that (1) TOMO improves the average G-Measure by 23.7\%$\sim$41.8\%, and the average MCC by 54.2\%$\sim$77.8\%. (2) feature weighting (FW) strategy improves the average G-Measure by 11\%, and the average MCC by 29.2\%. (3) TOMOFWTNB improves the average G-Measure value by at least 27.8\%, and the average MCC value by at least 71.5\%, compared with existing state-of-theart CPDP approaches. It can be concluded that (1) TOMO is very effective for addressing class-imbalance problem in CPDP scenario; (2) our FW strategy is helpful for CPDP; (3) TOMOFWTNB outperforms previous state-of-the-art CPDP approaches.
研究动机与目标
- 为解决跨项目缺陷预测(CPDP)中的类别不平衡问题,其中目标项目中的缺陷实例远少于非缺陷实例。
- 减少源项目与目标项目之间的分布偏移,该问题会阻碍CPDP中有效迁移学习。
- 通过在迁移学习中联合考虑特征重要性与数据不平衡,提升预测性能。
- 开发一种在G-Measure与Matthews相关系数(MCC)方面优于现有最先进CPDP方法的方法。
提出的方法
- 提出TOMO(面向迁移学习的少数类过采样)方法,通过利用源数据与目标数据的分布,在目标数据集中生成合成的少数类样本。
- 该方法计算一种混合距离矩阵,结合从目标少数类聚类中心到源少数类样本与目标少数类样本的距离,使用系数λ进行加权平均。
- 在混合空间中识别最近邻,以指导合成样本的生成,确保样本多样性与分布对齐。
- 通过在混合空间中,将少数类样本与其最近邻进行插值生成合成样本,同时调整样本数量以达到期望的不平衡比率。
- 在朴素贝叶斯分类器中应用特征加权(FW),以突出更具信息量的特征,提升模型的鲁棒性与泛化能力。
- 最终的FWTNB模型在重加权并平衡后的数据集上进行训练,从而增强源与目标分布之间的相似性。
实验结果
研究问题
- RQ1面向迁移学习的过采样技术能否有效减轻跨项目缺陷预测中的类别不平衡与分布偏移?
- RQ2在朴素贝叶斯分类器中引入特征加权是否能提升CPDP场景下的预测性能?
- RQ3所提出的TOMOFWTNB方法在G-Measure与MCC方面与现有最先进CPDP方法相比如何?
- RQ4与传统过采样方法相比,TOMO在多大程度上减少了源与目标数据集之间的分布差异?
主要发现
- 与基线方法相比,TOMO使平均G-Measure提升23.7%至41.8%,平均MCC提升54.2%至77.8%。
- 仅采用特征加权(FW)策略,即可使平均G-Measure提升11%,平均MCC提升29.2%。
- TOMOFWTNB在平均G-Measure方面至少优于现有最先进CPDP方法27.8%,在平均MCC方面至少提升71.5%。
- 所提出的方法在缓解CPDP中的类别不平衡方面极为有效,尤其在目标数据集严重不平衡时表现突出。
- 将特征加权与TOMO结合显著提升了模型性能,表明特征重要性是CPDP中的关键因素。
- TOMO中的混合距离计算成功减少了源项目与目标项目之间的分布偏移,提升了模型迁移能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。