[논문 리뷰] Exploring ML testing in practice -- Lessons learned from an interactive rapid review with Axis Communications
이 연구는 축축한 통신사의 산업 전문가들과 연구자들이 참여한 상호작용형 빠른 리뷰(IRR)를 통해 컴퓨터 비전 시스템에서의 머신러닝(ML) 테스팅 도전 과제, 특히 데이터 테스팅 문제를 탐구한다. 협업을 통해 개선된 분류 체계가 도출되었으며, 12개의 핵심 과제가 규명되었고, 데이터 테스팅을 위한 9개의 기술적 규칙이 제시되었다. 이는 산업 수요와 완벽하게 일치하지는 않지만 실용적이고 유연하게 적용 가능한 통찰을 제공한다.
There is a growing interest in industry and academia in machine learning (ML) testing. We believe that industry and academia need to learn together to produce rigorous and relevant knowledge. In this study, we initiate a collaboration between stakeholders from one case company, one research institute, and one university. To establish a common view of the problem domain, we applied an interactive rapid review of the state of the art. Four researchers from Lund University and RISE Research Institutes and four practitioners from Axis Communications reviewed a set of 180 primary studies on ML testing. We developed a taxonomy for the communication around ML testing challenges and results and identified a list of 12 review questions relevant for Axis Communications. The three most important questions (data testing, metrics for assessment, and test generation) were mapped to the literature, and an in-depth analysis of the 35 primary studies matching the most important question (data testing) was made. A final set of the five best matches were analysed and we reflect on the criteria for applicability and relevance for the industry. The taxonomies are helpful for communication but not final. Furthermore, there was no perfect match to the case company's investigated review question (data testing). However, we extracted relevant approaches from the five studies on a conceptual level to support later context-specific improvements. We found the interactive rapid review approach useful for triggering and aligning communication between the different stakeholders.
연구 동기 및 목표
- 실제 응용 분야에서의 머신러닝 테스팅 과제에 대해 학계와 산업계 간의 협력 연구를 시작하기 위해.
- 축축한 통신사의 현장 전문가들과 학계 연구자들 간의 용어와 연구 우선순위를 조율하기 위해.
- 머신러닝 테스팅과 관련된 관련 연구를 식별하고 분류하여, 특히 컴퓨터 비전 분야의 데이터 테스팅과 같은 산업 특화 과제와 연결하기 위해.
- 학술 문헌에서 이nder적 기술적 규칙과 적용 가능성 기준을 도출하여 산업 현장에서의 머신러닝 테스팅 적용을 안내하기 위해.
- 안전 중심의 머신러닝 시스템에서의 데이터 테스팅에 초점을 맞춘 향후 공동 연구 및 석사학위 논문 프로젝트를 지원하기 위해.
제안 방법
- 축축한 통신사의 4명의 전문가와 4명의 연구자 총 8명의 이해관계자를 포함한 상호작용형 빠른 리뷰(IRR)를 수행하였다.
- 구조적이고 협업적인 과정을 통해 반복적인 조율과 토론을 거쳐, 머신러닝 테스팅에 관한 180개의 주요 연구를 검토하였다.
- 기존 소프트웨어 테스팅 및 AI 품질 프레임워크를 기반으로 도서관 분류 체계(SERP 분류 체계)를 개발하고 확장하여 과제와 해결책을 분류하였다.
- 축축한 통신사가 제기한 12개의 실용적 과제를 우선순위 정리하였으며, 상위 3개(데이터 테스팅, 메트릭스, 테스트 생성)는 관련 문헌과 매핑하였다.
- '데이터셋을 어떻게 테스트할 것인가'에 관한 35개의 연구를 심층 분석하여 9개의 기술적 규칙과 맥락 요소를 도출하였다.
- 개념적 적합성, 기술적 실현 가능성, 영역 적합성 등의 기준을 사용해 선택된 연구의 관련성과 적용 가능성을 평가하였다.
실험 결과
연구 질문
- RQ1산업계의 관점에서 볼 때, 머신러닝 기반 컴퓨터 비전 시스템에서의 데이터 테스팅을 위한 가장 관련성 있고 적용 가능한 학술적 해결책은 무엇인가?
- RQ2연구자와 전문가가 함께 머신러닝 테스팅의 핵심 과제를 식별하고 우선순위를 정하는 방법은 무엇인가?
- RQ3학술 문헌에서 도출된 기술적 규칙과 적용 기준은 산업 현장에서의 머신러닝 테스팅 적용을 어떻게 안내할 수 있는가?
- RQ4분류 체계는 학계 연구와 산업 현장 실무 간의 소통과 일치를 어떻게 지원할 수 있는가?
- RQ5실제 시스템에서 머신러닝 테스팅 기법의 적용 가능성을 영향을 미치는 주요 맥락 요소는 무엇인가?
주요 결과
- 기존 학술 연구와 축축한 통신사의 특정한 데이터 테스팅 과제 사이에 완벽한 일치가 없었으며, 이는 산업용 컴퓨터 비전 시스템에서 실용적이고 맥락 기반의 데이터 테스팅에 대한 연구 격차가 있음을 시사한다.
- 다섯 개의 잠재력 있는 연구에서 유의미한 기술적 규칙 9개를 도출하였으며, 이는 산업 수요에 맞게 유연하게 변형할 수 있는 개념적 프레임워크를 제공한다.
- 상호작용형 빠른 리뷰 과정이 학계와 산업계 이해관계자 간의 공통된 이해를 형성하고 용어를 조율하며 신뢰를 구축하는 데 성공하였다.
- 소프트웨어 테스팅 및 AI 품질 차원을 통합한 SERP 분류 체계는 머신러닝 테스팅 연구의 복잡한 영역을 조직하고 탐색하는 데 유용한 것으로 입증되었다.
- 현장 전문가들은 놀라운 적합성 기법이 특히 관련성이 있으며, 이미 데이터 수집 과정에 적용하고 있다.
- 이 연구는 특히 자동차, 항공전자, 헬스케어와 같은 안전 중심 분야에서 AI 품질의 핵심 요소로 데이터 품질 확보의 중요성을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.