[논문 리뷰] On the Replicability and Reproducibility of Deep Learning in Software Engineering
이 논문은 소프트웨어 공학(Software Engineering, SE) 분야의 딥러닝(Deep Learning, DL) 연구에서 재현 가능성과 재현 가능성 문제를 조사하며, 분석한 93개의 DL 연구 중 단 10.8%만 이 문제들을 다루고 있으며, 74.2%는 코드나 데이터를 공유하지 않는 것으로 드러났다. 대표적인 네 개의 모델을 재실행한 결과, 최적화의 무작위성, 수렴 문제, 어휘 및 테스트 데이터 크기 민감도로 인해 성능이 불안정해지는 현상이 확인되어, SE 분야의 DL 연구에서 공유 가능한 재현 패키지, 안정적인 훈련, 그리고 강력한 평가 방법의 도입이 급한 필요성을 드러냈다.
Deep learning (DL) techniques have gained significant popularity among software engineering (SE) researchers in recent years. This is because they can often solve many SE challenges without enormous manual feature engineering effort and complex domain knowledge. Although many DL studies have reported substantial advantages over other state-of-the-art models on effectiveness, they often ignore two factors: (1) replicability - whether the reported experimental result can be approximately reproduced in high probability with the same DL model and the same data; and (2) reproducibility - whether one reported experimental findings can be reproduced by new experiments with the same experimental protocol and DL model, but different sampled real-world data. Unlike traditional machine learning (ML) models, DL studies commonly overlook these two factors and declare them as minor threats or leave them for future work. This is mainly due to high model complexity with many manually set parameters and the time-consuming optimization process. In this study, we conducted a literature review on 93 DL studies recently published in twenty SE journals or conferences. Our statistics show the urgency of investigating these two factors in SE. Moreover, we re-ran four representative DL models in SE. Experimental results show the importance of replicability and reproducibility, where the reported performance of a DL model could not be replicated for an unstable optimization process. Reproducibility could be substantially compromised if the model training is not convergent, or if performance is sensitive to the size of vocabulary and testing data. It is therefore urgent for the SE community to provide a long-lasting link to a replication package, enhance DL-based solution stability and convergence, and avoid performance sensitivity on different sampled data.
연구 동기 및 목표
- 최근 소프트웨어 공학(Software Engineering, SE) 분야의 딥러닝(Deep Learning, DL) 연구에서 재현 가능성과 재현 가능성 문제의 보편성을 조사하기 위해.
- DL 기반 SE 연구에서 소스 코드와 데이터를 얼마나 자주 공유하는지 평가하여, 이들이 재현 가능성에 어떤 영향을 미치는지 분석하기 위해.
- 모델의 불안정성, 수렴 문제, 어휘 크기, 테스트 데이터 변동성이 DL 기반 SE 연구의 재현 가능성에 어떤 영향을 미치는지 평가하기 위해.
- 향후 DL 기반 SE 연구의 재현 가능성과 재현 가능성 향상을 위한 실질적인 권고 사항을 제공하기 위해.
제안 방법
- 최근 5년 간 20개의 SE 전문 학술지 및 컆퍼런스에 게재된 93개의 DL 연구를 대상으로 체계적 문헌 리뷰를 수행하였다.
- 재현 패키지(소스 코드 및 데이터)의 가용성과 연구들이 재현 가능성 및 재현 가능성 문제를 얼마나 깊이 다루었는지 분석하였다.
- 상동의 프rotocol를 사용하되, 다른 무작위 시드와 데이터 분할 방식을 적용하여 상위 SE 컨ferenced에서 나온 네 개의 대표적 DL 모델을 재구현하고 재평가하였다.
- 다중 실행을 통해 모델 성능의 안정성을 측정하여 재현 가능성 수준을 평가하였으며, 어휘 크기 및 테스트 데이터 크기 민감도를 평가하여 재현 가능성에 영향을 미치는 요소를 분석하였다.
- 인간의 편향을 최소화하고 일관된 성능 측정을 보장하기 위해 자동화된 평가를 사용하였다.
- 고정 반복 횟수 대신 수렴 기반 훈련을 사용하고, 추상 구문 트리와 같은 강력한 특징을 통합하여 데이터 민감도를 줄이는 등의 완화 전략을 제안하였다.
실험 결과
연구 질문
- RQ1최근 몇 년 간의 딥러닝(Deep Learning, DL) 기반 소프트웨어 공학(Software Engineering, SE) 연구에서 재현 가능성과 재현 가능성 문제를 얼마나 자주 보고하고 있는가?
- RQ2딥러닝(Deep Learning, DL) 기반 소프트웨어 공학(Software Engineering, SE) 연구에서 소스 코드와 데이터를 얼마나 자주 공유하고 있으며, 이는 재현 가능성에 어떤 영향을 미치는가?
- RQ3무작위 초깃값과 최적화로 인한 모델의 불안정성이 보고된 결과의 재현 가능성에 어떤 영향을 미치는가?
- RQ4어휘 크기와 테스트 데이터 크기가 소프트웨어 공학(Software Engineering, SE) 작업에서 딥러닝(Deep Learning, DL) 모델 성능의 재현 가능성에 어떤 영향을 미치는가?
- RQ5딥러닝(Deep Learning, DL) 기반 소프트웨어 공학(Software Engineering, SE) 연구의 재현 가능성과 재현 가능성 향상을 위해 실질적인 조치는 무엇이 가능한가?
주요 결과
- 분석한 93개의 DL 기반 SE 연구 중 유일하게 재현 가능성 또는 재현 가능성 문제를 다룬 연구는 10.8%에 불과하여, 이 과학적 원칙의 광범위한 忽视(무시)가 드러났다.
- 74.2%의 연구가 소스 코드나 데이터를 공유하지 않아 재현 가능성의 가능성이 심각하게 훼손되었다.
- 네 개의 대표적 DL 모델을 재실행한 결과, 최적화의 무작위성으로 인해 실행 간 성능이 크게 변동하여 재현 가능성에 심각한 영향을 미치는 것으로 확인되었다.
- 모델 성능은 어휘 크기와 테스트 데이터 크기에 매우 민감하여, 다양한 데이터 분할에서 성능이 크게 변동하여 재현 가능성에 악영향을 미쳤다.
- 훈련 과정에서 낮은 수렴 수준이 성능의 불안정성과 요동을 유발하여 재현 가능성에 추가적인 악영향을 미쳤다.
- 본 연구는 공유 가능한 재현 패키지, 수렴 모니터링, 강력한 평가 방법이 DL 기반 SE 연구의 과학적 타당성을 향상시키기 위해 필수적이라고 결론 내렸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.