Skip to main content
QUICK REVIEW

[論文レビュー] Transfer-Learning Oriented Class Imbalance Learning for Cross-Project Defect Prediction

Haonan Tong, 斌 刘|arXiv (Cornell University)|Jan 24, 2019
Software Engineering Research参考文献 83被引用数 14
ひとこと要約

本稿では、クラス不均衡と特徴量の重要度を同時に取り扱う、転移学習指向のクロスプロジェクト欠陥予測手法TOMOFWTNBを提案する。新しいマイノリティ過剰サンプリング手法(TOMO)を導入することで、ソースプロジェクトとターゲットプロジェクト間の分布差を低減し、ナイーブベイズ分類器に特徴量重み付けを統合することで、最先端手法に比べてG-Measureを最低27.8%、MCCを最低71.5%向上させる。

ABSTRACT

Cross-project defect prediction (CPDP) aims to predict defects of projects lacking training data by using prediction models trained on historical defect data from other projects. However, since the distribution differences between datasets from different projects, it is still a challenge to build high-quality CPDP models. Unfortunately, class imbalanced nature of software defect datasets further increases the difficulty. In this paper, we propose a transferlearning oriented minority over-sampling technique (TOMO) based feature weighting transfer naive Bayes (FWTNB) approach (TOMOFWTNB) for CPDP by considering both classimbalance and feature importance problems. Differing from traditional over-sampling techniques, TOMO not only can balance the data but reduce the distribution difference. And then FWTNB is used to further increase the similarity of two distributions. Experiments are performed on 11 public defect datasets. The experimental results show that (1) TOMO improves the average G-Measure by 23.7\%$\sim$41.8\%, and the average MCC by 54.2\%$\sim$77.8\%. (2) feature weighting (FW) strategy improves the average G-Measure by 11\%, and the average MCC by 29.2\%. (3) TOMOFWTNB improves the average G-Measure value by at least 27.8\%, and the average MCC value by at least 71.5\%, compared with existing state-of-theart CPDP approaches. It can be concluded that (1) TOMO is very effective for addressing class-imbalance problem in CPDP scenario; (2) our FW strategy is helpful for CPDP; (3) TOMOFWTNB outperforms previous state-of-the-art CPDP approaches.

研究の動機と目的

  • クロスプロジェクト欠陥予測(CPDP)におけるクラス不均衡の課題に対処すること。特に、ターゲットプロジェクトでは欠陥インスタンスが非欠陥インスタンスに比べて著しく少ないことが一般的である。
  • CPDPにおける効果的な転移学習を阻害する要因である、ソースプロジェクトとターゲットプロジェクト間の分布シフトを低減すること。
  • 転移学習において、データの不均衡と特徴量の重要度を併せて考慮することで、予測性能を向上させること。
  • G-Measureおよびマクカーシー相関係数(MCC)の観点から、既存の最先端CPDP手法を上回る性能を発揮する手法を開発すること。

提案手法

  • TOMO(転移学習指向マイノリティ過剰サンプリング)は、ソースおよびターゲットデータの分布を活用して、ターゲットデータセットにおける合成マイノリティクラスサンプルを生成する。
  • 重み係数λを用いた加重平均により、ターゲットマイノリティクラスターセンターロからソースマイノリティサンプルおよびターゲットマイノリティサンプルまでの距離を組み合わせたハイブリッド距離行列を計算する。
  • ハイブリッド空間における最近傍を特定し、合成サンプル生成をガイドすることで、多様性と分布整合性を確保する。
  • 合成サンプルは、ハイブリッド空間におけるマイノリティインスタンスとその最近傍との間の補間によって生成され、必要な不均衡比に合わせてサンプル数を調整する。
  • 特徴量重み付け(FW)をナイーブベイズ分類器に適用することで、より情報量の多い特徴量を強調し、モデルの頑健性と一般化性能を向上させる。
  • 最終的なFWTNBモデルは、再重み付けおよびバランス化されたデータセット上で学習され、ソースとターゲットの分布の類似性が向上する。

実験結果

リサーチクエスチョン

  • RQ1転移学習指向の過剰サンプリング手法は、クロスプロジェクト欠陥予測において、クラス不均衡と分布シフトの両方を効果的に低減できるか?
  • RQ2ナイーブベイズ分類器に特徴量重み付けを組み込むことで、CPDPシナリオにおける予測性能が向上するか?
  • RQ3提案手法TOMOFWTNBは、既存の最先端CPDP手法と比較して、G-MeasureおよびMCCの観点でどの程度優れているか?
  • RQ4従来の過剰サンプリング手法と比較して、TOMOはソースとターゲットデータセット間の分布差をどの程度低減するか?

主な発見

  • TOMOは、ベースライン手法に比べて平均G-Measureを23.7%~41.8%、平均MCCを54.2%~77.8%向上させる。
  • 特徴量重み付け(FW)戦略単体でも、平均G-Measureを11%、平均MCCを29.2%向上させる。
  • TOMOFWTNBは、既存の最先端CPDP手法に比べて、平均G-Measureを最低27.8%、平均MCCを最低71.5%向上させる。
  • 本手法は、特にターゲットデータセットが著しく不均衡な場合に、クラス不均衡の緩和に非常に効果的である。
  • TOMOと特徴量重み付けの統合は、モデル性能を顕著に向上させ、特徴量の重要度がCPDPにおいて重要な要因であることを示している。
  • TOMOにおけるハイブリッド距離計算は、ソースとターゲットプロジェクト間の分布シフトを効果的に低減し、学習済みモデルの転送性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。