Skip to main content
QUICK REVIEW

[논문 리뷰] Transfer-Learning Oriented Class Imbalance Learning for Cross-Project Defect Prediction

Haonan Tong, 斌 刘|arXiv (Cornell University)|2019. 01. 24.
Software Engineering Research참고 문헌 83인용 수 14
한 줄 요약

이 논문은 클래스 불균형과 특징 중요도를 동시에 고려하는 전이학습 기반의 교차프로젝트 결함 예측 방법인 TOMOFWTNB를 제안한다. 소스 및 타겟 프로젝트 간의 분포 차이를 줄이기 위해 새로운 소수 클래스 오버샘플링 기법(TOMO)을 도입하고, 나이브 베이즈 분류기에 특징 가중치를 통합함으로써, 최신 기술 대비 G-Measure는 최소 27.8% 향상되고 MCC는 최소 71.5% 향상된다.

ABSTRACT

Cross-project defect prediction (CPDP) aims to predict defects of projects lacking training data by using prediction models trained on historical defect data from other projects. However, since the distribution differences between datasets from different projects, it is still a challenge to build high-quality CPDP models. Unfortunately, class imbalanced nature of software defect datasets further increases the difficulty. In this paper, we propose a transferlearning oriented minority over-sampling technique (TOMO) based feature weighting transfer naive Bayes (FWTNB) approach (TOMOFWTNB) for CPDP by considering both classimbalance and feature importance problems. Differing from traditional over-sampling techniques, TOMO not only can balance the data but reduce the distribution difference. And then FWTNB is used to further increase the similarity of two distributions. Experiments are performed on 11 public defect datasets. The experimental results show that (1) TOMO improves the average G-Measure by 23.7\%$\sim$41.8\%, and the average MCC by 54.2\%$\sim$77.8\%. (2) feature weighting (FW) strategy improves the average G-Measure by 11\%, and the average MCC by 29.2\%. (3) TOMOFWTNB improves the average G-Measure value by at least 27.8\%, and the average MCC value by at least 71.5\%, compared with existing state-of-theart CPDP approaches. It can be concluded that (1) TOMO is very effective for addressing class-imbalance problem in CPDP scenario; (2) our FW strategy is helpful for CPDP; (3) TOMOFWTNB outperforms previous state-of-the-art CPDP approaches.

연구 동기 및 목표

  • 교차프로젝트 결함 예측(CPDP)에서 타겟 프로젝트의 결함 인스턴스가 비결함 인스턴스에 비해 훨씬 적은 경우 발생하는 클래스 불균형 문제를 해결하기 위해.
  • CPDP에서 효과적인 전이학습을 방해하는 소스와 타겟 프로젝트 간의 분포 이탈을 줄이기 위해.
  • 전이학습에서 데이터 불균형과 특징 중요도를 동시에 고려하여 예측 성능을 향상시키기 위해.
  • G-Measure와 매튜스 상관계수(MCC) 측면에서 기존 최신 기술 대비 뛰어난 성능을 보이는 방법을 개발하기 위해.

제안 방법

  • TOMO(전이학습 기반 소수 클래스 오버샘플링)는 소스 및 타겟 데이터 분포를 활용하여 타겟 데이터셋의 합성 소수 클래스 샘플을 생성한다.
  • 이 방법은 소스 소수 클래스 샘플과 타겟 소수 클래스 샘플에서의 거리에 가중 평균을 적용한 혼합 거리 행렬을 계산하며, 계수 λ를 사용한다.
  • 혼합 공간 내에서 가장 가까운 이웃을 식별하여 합성 샘플 생성을 안내함으로써 다양성과 분포 일치를 보장한다.
  • 합성 샘플은 혼합 공간 내에서 소수 클래스 인스턴스와 그 가장 가까운 이웃 간의 보간을 통해 생성되며, 원하는 불균형 비율을 달성하기 위해 샘플 수를 조정한다.
  • 특징 가중치(FW)는 나이브 베이즈 분류기에 적용되어 더 유용한 특징을 강조함으로써 모델의 강건성과 일반화 능력을 향상시킨다.
  • 최종적으로 FWTNB 모델은 재가중 및 균형 잡힌 데이터셋으로 훈련되어 소스와 타겟 분포 간 유사성을 향상시킨다.

실험 결과

연구 질문

  • RQ1전이학습 기반 오버샘플링 기법이 교차프로젝트 결함 예측에서 클래스 불균형과 분포 이탈을 효과적으로 줄일 수 있는가?
  • RQ2나이브 베이즈 분류기에 특징 가중치를 통합하면 CPDP 환경에서 예측 성능이 향상되는가?
  • RQ3제안된 TOMOFWTNB 방법은 G-Measure와 MCC 측면에서 기존 최신 기술 대비 어떻게 비교되는가?
  • RQ4기존 오버샘플링 방법에 비해 TOMO는 소스 및 타겟 데이터셋 간의 분포 차이를 어느 정도 줄이는가?

주요 결과

  • TOMO는 기준 방법 대비 평균 G-Measure를 23.7%에서 41.8%까지 향상시키고, 평균 MCC를 54.2%에서 77.8%까지 향상시킨다.
  • 특징 가중치(FW) 전략만으로도 평균 G-Measure는 11% 향상되고 평균 MCC는 29.2% 향상된다.
  • TOMOFWTNB는 기존 최신 기술 대비 평균 G-Measure 최소 27.8% 향상되고 평균 MCC 최소 71.5% 향상된다.
  • 제안된 방법은 특히 타겟 데이터셋이 심각하게 불균형한 경우 교차프로젝트 결함 예측에서 클래스 불균형을 효과적으로 완화하는 데 뛰어나다.
  • TOMO와 특징 가중치의 통합은 모델 성능을 크게 향상시키며, 이는 특징 중요도가 CPDP에서 핵심 요소임을 시사한다.
  • TOMO의 혼합 거리 계산 방식은 소스 및 타겟 프로젝트 간의 분포 이탈을 성공적으로 줄여 학습된 모델의 이식성 향상에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.