[논문 리뷰] A Systematic Mapping Study on Testing of Machine Learning Programs
이 체계적 맵핑 연구는 1,654개의 자료에서 식별된 37篇의 관련 논문을 분석하여 기계학습 프로그램의 테스트 현황을 맵핑한다. 주요 추세를 파악하고, 기계학습 유형과 접근 방식에 따라 테스트 기법을 분류하며, 특히 강화학습 시스템을 중심으로 실증적 증거, 도구 가용성, 비기능 테스트 부문의 격차를 부각시킨다.
We aim to conduct a systematic mapping in the area of testing ML programs. We identify, analyze and classify the existing literature to provide an overview of the area. We followed well-established guidelines of systematic mapping to develop a systematic protocol to identify and review the existing literature. We formulate three sets of research questions, define inclusion and exclusion criteria and systematically identify themes for the classification of existing techniques. We also report the quality of the published works using established assessment criteria. we finally selected 37 papers out of 1654 based on our selection criteria up to January 2019. We analyze trends such as contribution facet, research facet, test approach, type of ML and the kind of testing with several other attributes. We also discuss the empirical evidence and reporting quality of selected papers. The data from the study is made publicly available for other researchers and practitioners. We present an overview of the area by answering several research questions. The area is growing rapidly, however, there is lack of enough empirical evidence to compare and assess the effectiveness of the techniques. More publicly available tools are required for use of practitioners and researchers. Further attention is needed on non-functional testing and testing of ML programs using reinforcement learning. We believe that this study can help researchers and practitioners to obtain an overview of the area and identify several sub-areas where more research is required
연구 동기 및 목표
- 기계학습 프로그램 테스트 분야의 현재 연구 현황을 종합적으로 개괄하기 위해.
- 기계학습 유형, 테스트 접근 방식, 연구 초점을 기반으로 기존 테스트 기법을 식별하고 분류하기 위해.
- 실증적 증거와 보고 기준의 질 측면에서 출판된 논문의 품질을 평가하기 위해.
- 비기능 테스트와 강화학습 기반 기계학습 시스템과 같은 미충분한 연구가 이루어진 분야를 부각시키기 위해.
- 연구자와 실무자들이 데이터를 공개적으로 이용할 수 있도록 하고 향후 연구 방향을 제시함으로써 지원하기 위해.
제안 방법
- 소프트웨어 공학 분야의 문헌 검토 지침을 기반으로 체계적 맵핑 연구를 수행하였다.
- 1,654편의 초도 논문을 37편의 관련 연구로 줄이기 위해 포함 및 배제 기준을 정의하였다 (2019년 1월 기준).
- 선택된 문헌의 분류 및 분석을 이끌기 위해 세 개의 연구 질문 세트를 설정하였다.
- 기여 측면, 연구 측면, 테스트 접근 방식, 기계학습 유형, 테스트 유형 등의 속성을 기반으로 논문을 분류하였다.
- 실증 보고 및 재현 가능성에 대한 기존 평가 기준을 활용하여 선택된 논문의 품질을 평가하였다.
- 기계학습 테스트 분야의 향후 연구 및 도구 개발을 지원하기 위해 수집된 데이터를 공개하였다.
실험 결과
연구 질문
- RQ1기계학습 프로그램 테스트 분야에서 지배적인 연구 주제와 추세는 무엇인가?
- RQ2기계학습 유형과 테스트 접근 방식에 따라 테스트 기법은 어떻게 분류되는가?
- RQ3출판된 기계학습 테스트 연구에서 실증적 증거와 보고의 질은 어떠한가?
- RQ4비기능 테스트와 강화학습 기반 기계학습 프로그램 테스트 분야에서 아직 충분히 연구되지 않은 영역는 무엇인가?
- RQ5기계학습 테스트 연구 및 실무에서 도구 가용성과 재현 가능성의 주요 격차는 무엇인가?
주요 결과
- 기계학습 프로그램 테스트 분야는 급속도로 성장하고 있으나, 다양한 테스트 기법의 효과성을 비교하거나 평가하기 위한 충분한 실증적 증거가 부족하다.
- 초기 식별된 1,654편의 논문 중 포함 기준을 충족한 것은 37편 뿐이었으며, 이는 문헌에 높은 수준의 잡음과 관련성 부족이 있음을 시사한다.
- 실무자와 연구자들이 기계학습 시스템을 테스트하는 데 지원할 수 있는 공개된 도구가 현저히 부족하다.
- 비기능 테스트와 강화학습 기반 기계학습 프로그램의 테스트 분야는 여전히 미충분한 연구가 이루어져 있어 주요 연구 격차로 남아 있다.
- 선택된 논문의 보고 품질은 일관되지 않으며, 표준화된 평가 지표와 재현 가능한 실험 설정의 사용이 제한적이다.
- 본 연구의 데이터셋은 향후 기계학습 테스트 분야의 연구, 도구 개발, 벤치마킹을 지원하기 위해 공개되어 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.