[논문 리뷰] An empirical study of public data quality problems in cross project defect prediction
이 연구는 널리 사용되는 Jureczko 데이터셋에서의 데이터 품질 문제—특히 중복 및 일관성 없는 결함 케이스—를 식별하고 해결한다. 데이터셋을 정제하고 세 가지 데이터 선택 방법과 두 가지 분류기로 성능을 비교함으로써, 저자들은 정제된 데이터가 유의미하게 다를 뿐만 아니라 더 신뢰할 수 있는 예측 결과를 도출함을 입증한다. 이는 데이터 품질이 CPDP 정확도에 미치는 핵심적 영향을 강조한다.
Background: Two public defect data, including Jureczko and NASA datasets, have been widely used in cross project defect prediction (CPDP). The quality of defect data have been reported as an important factor influencing the defect prediction performance and Shepperd et al. have researched the data quality problems in NASA datasets. However, up to now, there is no research focusing on the quality problems of Jureczko datasets which are most widely used in CPDP. Aims: In this paper, we intend to investigate the problems of identical and inconsistent cases in Jureczko datasets and validate whether removing these problematic cases will make a difference to defect prediction performance in CPDP. Method: The problems of identical and inconsistent cases are reported from two aspects, respectively in each individual dataset and in a pair of datasets from different releases of a software project. Then a cleaned version of Jureczko datasets is provided by removing duplicate and inconsistent cases. Finally three training data selection methods are employed to compare the defect prediction performance of cleaned datasets with that of original datasets. Results: The experimental results in terms of AUC and F-Measure show that most datasets obtain very different defect prediction performance. Conclusions: It is very necessary to study the data quality problems in CPDP and the cleaned Jureczko datasets may provide more reliable defect prediction performance in CPDP.
연구 동기 및 목표
- 교차 프로젝트 결함 예측(CPDP)에 널리 사용되는 Jureczko 데이터셋에서의 데이터 품질 문제—특히 동일하고 일관성 없는 케이스—를 조사하기 위해.
- 중복 및 일관성 없는 케이스를 제거하면 CPDP의 결함 예측 성능이 향상되는지 평가하기 위해.
- 더 신뢰할 수 있고 재현 가능한 CPDP 연구를 지원하기 위해 Jureczko 데이터셋의 정제된 버전을 제공하기 위해.
- 기본적인 학습 데이터 선택 방법과 평가 지표를 사용하여 원본 데이터셋과 정제된 데이터셋의 성능을 비교하기 위해.
제안 방법
- 각 개별 Jureczko 데이터셋 내부 및 동일 소프트웨어 프로젝트의 서로 다른 릴리스 간에 동일하고 일관성 없는 케이스를 식별하였다.
- Jureczko 데이터셋에서 중복 및 일관성 없는 결함 케이스를 제거하기 위한 데이터 정제 방법을 제안하였다.
- 코드와 결함 메타데이터의 정렬 기반으로 문제 있는 케이스를 제거하여 Jureczko 데이터셋의 정제된 버전을 생성하였다.
- CPDP 모델의 소스 데이터를 선택하기 위해 세 가지 학습 데이터 선택 방법(PetersF, BurakF, NearestNeighbor)을 적용하였다.
- 두 분류기(C4.5 및 Random Forest)와 두 평가 지표(AUC 및 F-Measure)를 사용하여 모델 성능을 평가하였다.
- 원본 데이터셋과 정제된 데이터셋 간의 비교 실험을 수행하여 성능 차이를 평가하였다.
실험 결과
연구 질문
- RQ1Jureczko 데이터셋에서 개별 프로젝트 및 서로 다른 릴리스 간에 동일하고 일관성 없는 결함 케이스가 얼마나 널리 퍼져 있는가?
- RQ2중복 및 일관성 없는 케이스는 교차 프로젝트 결함 예측 모델의 성능에 어떤 영향을 미치는가?
- RQ3이러한 문제 있는 케이스를 제거하면 예측 성능에 측정 가능한 향상이 이루어지는가?
- RQ4여러 데이터셋과 평가 지표를 통해 원본 데이터셋과 정제된 데이터셋 간의 성능 차이가 통계적으로 유의미한가?
주요 결과
- 정제된 Jureczko 데이터셋은 원본 데이터셋과 비교해 유의미하게 다른 결함 예측 성능을 보였으며, 이는 데이터 품질 문제로 인해 모델 신뢰성이 직접적으로 영향을 받음을 시사한다.
- 대부분의 데이터셋에서 데이터 정제 후 AUC 및 F-Measure 값이 크게 변화하였으며, 평균 AUC 변화율은 -3.02%에서 3.09%까지 변동하였다.
- F-Measure 변화는 AUC 변화보다 더 두드러졌으며, 더 많은 데이터셋에서 비제로 성능 차이가 나타났다. 이는 F-Measure가 데이터 품질에 더 민감함을 시사한다.
- 연구 결과, 대부분의 데이터셋에서 세 가지 학습 데이터 선택 방법 전반에 걸쳐 비제로 성능 차이가 존재하는 것으로 확인되어 데이터 품질의 광범위한 영향을 확인하였다.
- 결과적으로, Jureczko와 같은 공공 데이터셋의 데이터 품질 문제로 인해 CPDP 분야에서 잘못된 또는 일관성 없는 연구 결과가 유도될 수 있음을 입증하였다.
- 저자들은 공공 데이터셋을 정제하는 것이 더 정확하고 신뢰할 수 있는 교차 프로젝트 결함 예측 결과를 달성하기 위해 필수적이라고 결론 내렸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.