[논문 리뷰] The impact of using biased performance metrics on software defect prediction research
이 연구는 소프트웨어 결함 예측 연구에서 편향된 F1 지표 사용이 미치는 영향을 분석하기 위해, 12,471개의 이원 비교를 포함한 38개의 주요 연구를 대상으로 F1과 편향이 없는 매트릭스 상관관계(MCC)를 비교하였다. 그 결과, F1 대신 MCC를 사용할 경우 결과의 방향이 바뀌는 비율이 21.95%에 이르며, 이는 지표 편향으로 인한 잘못된 결론 도출의 심각한 위험을 시사한다.
Context: Software engineering researchers have undertaken many experiments investigating the potential of software defect prediction algorithms. Unfortunately, some widely used performance metrics are known to be problematic, most notably F1, but nevertheless F1 is widely used. Objective: To investigate the potential impact of using F1 on the validity of this large body of research. Method: We undertook a systematic review to locate relevant experiments and then extract all pairwise comparisons of defect prediction performance using F1 and the un-biased Matthews correlation coefficient (MCC). Results: We found a total of 38 primary studies. These contain 12,471 pairs of results. Of these, 21.95% changed direction when the MCC metric is used instead of the biased F1 metric. Unfortunately, we also found evidence suggesting that F1 remains widely used in software defect prediction research. Conclusions: We reiterate the concerns of statisticians that the F1 is a problematic metric outside of an information retrieval context, since we are concerned about both classes (defect-prone and not defect-prone units). This inappropriate usage has led to a substantial number (more than one fifth) of erroneous (in terms of direction) results. Therefore we urge researchers to (i) use an unbiased metric and (ii) publish detailed results including confusion matrices such that alternative analyses become possible.
연구 동기 및 목표
- 편향된 F1 지표가 소프트웨어 결함 예측 연구의 타당성에 미치는 영향을 평가하기 위해.
- 기타 통계적 한계가 알려져 있음에도 불구하고 F1이 결함 예측 연구에서 얼마나 자주 사용되는지 파악하기 위해.
- 특히 데이터 불균형 상황에서 F1이 가장 혼란스럽게 작용하는 조건을 특정하기 위해.
- 대규모 실증 연구에서 F1 결과와 편향이 없는 매트릭스 상관관계(MCC) 결과를 비교하기 위해.
- 미래 연구에서 편향이 없는 지표 사용과 혼동 행렬의 투명한 보고를 촉진하기 위해.
제안 방법
- 소프트웨어 결함 예측 실험에서 F1 및 MCC 점수를 모두 보고한 주요 연구를 식별하기 위해 체계적 리뷰를 수행하였다.
- F1 및 MCC 점수를 모두 보고한 38개의 주요 연구에서 12,471개의 모델 성능 이원 비교를 추출하였다.
- F1에서 MCC로 전환할 경우 비교 방향(예: 모델 A가 모델 B보다 우수함)이 변화하는지 여부를 평가하기 위해 메타분석을 수행하였다.
- 이론적 및 실증적 분석을 통해 혼동 행렬의 순열을 활용하여 클래스 불균형이 F1의 편향을 악화시키는 방식을 분석하였다.
- 정보 검색 외의 맥락에서도 F1이 이진 분류 과제에서 가지는 한계를 통계 및 기계학습 문헌을 바탕으로 비판하였다.
- 재현성 및 추가 분석을 위해 원시 데이터와 분석 코드를 Zenodo(DOI: 10.5281/zenodo.4899090)에 공개하였다.
실험 결과
연구 질문
- RQ1F1과 MCC를 사용할 경우 소프트웨어 결함 예측 연구에서 성능 비교의 방향이 얼마나 자주 뒤바뀌는가?
- RQ2기존의 통계적 문제에도 불구하고 최근 소프트웨어 결함 예측 연구에서 F1 사용의 빈도는 어떠한가?
- RQ3특히 클래스 불균형 상황에서 F1이 가장 혼란스럽게 작용하는 조건은 무엇인가?
- RQ4지표 편향으로 인해 F1 기반 결론이 얼마나 위험하게 잘못된 결과를 낳을 수 있는가?
- RQ5완전한 혼동 행렬을 공개하고 F1을 MCC로 대체함으로써 연구 투명성과 타당성은 얼마나 향상될 수 있는가?
주요 결과
- 분석된 12,471개의 이원 비교 중 21.95%가 F1에서 MCC로 전환할 경우 방향이 바뀌었으며, 이는 지표 편향으로 인한 잘못된 결론 도출의 심각한 위험을 시사한다.
- F1은 여전히 소프트웨어 결함 예측 연구에서 널리 사용되고 있으며, 2015–2020년 동안의 연구 중 1/3 이상이 여전히 이 편향된 지표에 의존하고 있다.
- F1 지표는 특히 데이터 불균형 상황에서 문제가 되며, 전체 균형을 훼손하면서 정밀도 또는 재현율이 높은 모델을 선호하는 경향이 있다.
- 매트릭스 상관관계(MCC)는 소프트웨어 결함 예측의 이진 분류 과제에서 F1보다 더 견고하고 편향이 없는 대안이다.
- 이 연구는 F1이 클래스 분포에 민감하고 거짓 양성과 거짓 음성에 대해 비대칭적으로 대응함으로써 연구자가 최적의 모델을 선택하는 데 오도할 수 있음을 입증하였다.
- 저자들은 완전한 혼동 행렬을 공개할 경우 다른 지표 분석이 가능해져, 결함 예측 연구의 재현성과 타당성이 향상됨을 증거로 제시하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.