Skip to main content
QUICK REVIEW

[논문 리뷰] TDSelector: A Training Data Selection Method for Cross-Project Defect Prediction

Peng He, Yutao Ma|arXiv (Cornell University)|2016. 12. 29.
Software Engineering Research참고 문헌 37인용 수 10
한 줄 요약

TDSelector는 인스턴스 유사도와 결함 밀도(1개 인스턴스당 결함 수)를 결합하여 성능을 향상시키는 교차 프로젝트 결함 예측을 위한 새로운 훈련 데이터 선택 방법이다. 14개 프로젝트에서 평가된 결과, 기준 방법 대비 AUC가 최대 10.6% 향상되었으며, 이는 더 높은 결함 수를 가진 인스턴스를 선택할수록 예측 정확도가 더욱 향상됨을 보여준다.

ABSTRACT

In recent years, cross-project defect prediction (CPDP) attracted much attention and has been validated as a feasible way to address the problem of local data sparsity in newly created or inactive software projects. Unfortunately, the performance of CPDP is usually poor, and low quality training data selection has been regarded as a major obstacle to achieving better prediction results. To the best of our knowledge, most of existing approaches related to this topic are only based on instance similarity. Therefore, the objective of this work is to propose an improved training data selection method for CPDP that considers both similarity and the number of defects each training instance has (denoted by defects), which is referred to as TDSelector, and to demonstrate the effectiveness of the proposed method. Our experiments were conducted on 14 projects (including 15 data sets) collected from two public repositories. The results indicate that, in a specific CPDP scenario, the TDSelector-based bug predictor performs, on average, better than those based on the baseline methods, and the AUC (area under ROC curve) values are increased by up to 10.6 and 4.3%, respectively. Besides, an additional experiment shows that selecting those instances with more bugs directly as training data can further improve the performance of the bug predictor trained by our method.

연구 동기 및 목표

  • 낮은 품질의 훈련 데이터 선택으로 인한 교차 프로젝트 결함 예측(CPDP) 성능 저하 문제를 해결하기 위해.
  • 기존 방법이 훈련 데이터 선택에 단지 인스턴스 유사도에 의존하는 한계를 극복하기 위해.
  • 유사도와 인스턴스당 결함 수를 동시에 고려하여 훈련 데이터 품질을 향상시키는 새로운 방법을 제안하기 위해.
  • 제안된 방법의 효과성을 실증적으로 검증하여 결함 예측 성능 향상에 기여하는지 확인하기 위해.
  • 더 높은 결함 수를 가진 인스턴스를 우선순위에 두는 것이 예측 정확도 향상에 추가로 기여하는지 탐색하기 위해.

제안 방법

  • TDSelector는 인스턴스 간 코사인 유사도와 그들의 결함 밀도(1개 인스턴스당 결함 수)를 결합하여 훈련 인스턴스를 선택한다.
  • 유사도와 결함 수를 균형 있게 반영하는 복합 점수를 계산하여 가장 정보가 풍부한 훈련 인스턴스를 순위 매기고 선택한다.
  • 유사도와 결함 수의 가중 조합을 사용하며, 높은 값은 훈련 데이터로 더 좋은 후보를 의미한다.
  • 표준 기계 학습 분류기들을 선택된 데이터에 대해 훈련시켜 접근법을 평가한다.
  • 선택된 인스턴스 중 높은 결함 수를 가진 것들만 사용하는 경우의 영향을 분석하기 위해 탈락 실험(Ablation study)을 실시한다.
  • 이 방법은 두 개의 공개 저장소에서 온 14개 프로젝트에 적용되었으며, 평가를 위해 총 15개 데이터셋을 사용하였다.

실험 결과

연구 질문

  • RQ1인스턴스 유사도와 결함 밀도를 결합하면 교차 프로젝트 결함 예측에서 훈련 데이터 선택 성능을 향상시킬 수 있는가?
  • RQ2유사도만을 사용하는 기준 방법 대비 TDSelector의 AUC 성능는 어떻게 비교되는가?
  • RQ3더 높은 결함 수를 가진 인스턴스를 훈련 데이터로 선택할 경우 성능 향상이 추가로 이루어지는가?
  • RQ4TDSelector의 성능 향상은 다양한 소프트웨어 프로젝트 간에서 일관되게 유지되는가?
  • RQ5최종 선택 결정에서 결함 밀도와 유사도 중 어느 요소가 더 큰 기여를 하는가?

주요 결과

  • TDSelector 기반의 버그 예측기는 기준 방법보다 높은 AUC 값을 기록하였으며, 특정 CPDP 시나리오에서 최대 10.6% 향상되었다.
  • 평가된 데이터셋 전반에서 평균적으로 기준 방법 대비 AUC가 4.3% 향상되었다.
  • TDSelector와 함께 사용할 경우, 높은 결함 수를 가진 인스턴스만을 훈련 데이터로 선택하는 것이 예측기 성능을 추가로 향상시켰다.
  • 다양한 프로젝트에서 일관된 성능 향상이 나타나, 프로젝트 특성에 따른 변동에 대해 강건함을 입증하였다.
  • 결함 밀도의 통합은 더 나은 훈련 데이터 선택에 크게 기여하였으며, 유사도 중심 접근보다 뛰어난 성능을 보였다.
  • 결과적으로, 결함 밀도는 효과적인 교차 프로젝트 결함 예측을 위한 훈련 데이터 선택에서 핵심 요소임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.