[논문 리뷰] A Meta-Summary of Challenges in Building Products with ML Components -- Collecting Experiences from 4758+ Practitioners
이 논문은 4,758명 이상의 전문가를 포함한 50개의 연구를 종합하여 기계학습 기반 소프트웨어 제품을 구축하는 데 있어 발생하는 과제들을 메타요약한다. 데이터 품질, 인공지능 역량 부족, 부적절한 도구 사용, 약한 시스템 수준의 테스팅이 주요 장벽으로 드러나며, 이는 MLOps 및 인공지능 공학 분야의 연구, 교육, 도구 개발에 중요한 시사점을 제공한다.
Incorporating machine learning (ML) components into software products raises new software-engineering challenges and exacerbates existing challenges. Many researchers have invested significant effort in understanding the challenges of industry practitioners working on building products with ML components, through interviews and surveys with practitioners. With the intention to aggregate and present their collective findings, we conduct a meta-summary study: We collect 50 relevant papers that together interacted with over 4758 practitioners using guidelines for systematic literature reviews. We then collected, grouped, and organized the over 500 mentions of challenges within those papers. We highlight the most commonly reported challenges and hope this meta-summary will be a useful resource for the research community to prioritize research and education in this field.
연구 동기 및 목표
- 기계학습 모듈을 포함한 소프트웨어 제품을 개발할 때 전문가들이 겪는 과제들을 통합하고 체계화하는 것.
- 기존 연구를 체계적으로 검토하여 기계학습 개발 라이프사이클 전반에서 반복적으로 나타나는 고영향 과제들을 특정하는 것.
- 과제를 주제 영역으로 분류하고 원천 전문가 출처로 추적함으로써 향후 연구 및 교육 지원을 위한 체계를 마련하는 것.
- 생산 환경에서의 공정성, 안전성 테스팅 등 시스템 수준의 품질 보증 분야와 같이 연구가 부족한 영역를 부각하는 것.
- 가장 자주 보고된 과제들을 우선순위로 삼아 도구 개발, 프로세스 개선 및 교육적 대응 방안을 제안하는 것.
제안 방법
- 4,758명 이상의 전문가를 포함한 50개의 관련 연구를 식별하기 위해 표준 가이드라인을 활용한 체계적 문헌 리뷰를 수행하였다.
- 이 연구들에서 보고된 과제 약 500개를 수집하고 분류하였다.
- 요구사항, 아키텍처, 모델 개발, 데이터 엔지니어링, 품질 보증, 프로세스, 조직/팀의 일곱 가지 주제 영역으로 과제를 그룹화하였다.
- 모든 과제를 원천 출처와 연결하여 추적 가능성과 신뢰성을 확보하였다.
- 주제적 통합 기법을 사용하여 가장 자주 보고된 과제들과 그 상호관계를 파악하였다.
- 집계된 결과를 바탕으로 연구, 교육, 도구 개발을 위한 권고안을 제시하였다.

실험 결과
연구 질문
- RQ1기계학습 기반 소프트웨어 제품을 개발할 때 전문가들이 가장 자주 보고하는 과제는 무엇인가?
- RQ2기계학습 라이프사이클의 다양한 단계와 조직적 맥락에 따라 과제는 어떻게 다를까?
- RQ3기존 도구와 관행이 부족한 영역는 무엇이며, 이를 보완할 수 있는 과제는 무엇인가?
- RQ4공정성, 안전성, 보안성과 같은 시스템 수준의 품질 특성과 관련된 현재의 연구 및 실무에서의 주요 격차는 무엇인가?
- RQ5전문가들이 특정한 과제를 제기한 바탕으로 연구 공동체는 향후 연구를 어떻게 우선순위를 정할 수 있는가?
주요 결과
- 가장 흔하게 보고된 과제는 데이터 품질이며, 전문가들은 그 중요성을 인식하고 있음에도 불구하고 데이터 문제를 관리하는 데 어려움을 겪고 있다.
- 상당수의 전문가들이 이해관계자들의 인공지능 역량 부족으로 인해 비현실적인 기대치와 부적절한 요구사항 명세가 발생함을 보고하고 있다.
- 운영 환경에서의 모니터링 및 테스팅은 필수적이라고 널리 인정되지만, 대부분의 경우 늦게 도입되거나 전혀 구현되지 않아 프로세스 성숙도의 격차가 드러나고 있다.
- 데이터 버전 관리, 기원 추적, 훈련-서비스 편차 탐지 등이 중요시되지만, 많은 팀에서 이를 위한 적절한 도구를 확보하지 못하고 있다.
- 모델 개발 분야에서 더 나은 엔지니어링 인프라와 표준화된 코드 품질 관리 관행이 필요하지만, 현재는 팀 간에 일관성이 없고 부족한 편이다.
- 특히 공정성, 보안성, 안전성과 같은 시스템 수준의 품질 보증은 자주 과제로 언급되지만, 이를 위한 조직적 프로세스를 마련한 기업은 소수에 그친다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.