[논문 리뷰] Management of Machine Learning Lifecycle Artifacts: A Survey
이 논문은 기계학습(ML) 라이프사이클 아티팩트 관리 시스템(ML AMSs) 64종에 대한 종합적인 서베이를 제시하며, 기능적 및 비기능적 능력을 평가하고 비교하기 위한 체계적인 프레임워크를 제안한다. 체계적 문헌 리뷰를 바탕으로 저자들은 데이터셋, 모델, 하이퍼파라미터, 메타데이터 등의 아티팩트에 대한 평가 기준을 정의하고, MLflow, Weights & Biases, Vertex AI와 같은 플랫폼을 평가하여 ML 라이프사이클 전반에서 재현 가능성, 추적 가능성, 도구 간 상호운용성 측면에서의 핵심 격차를 드러낸다.
The explorative and iterative nature of developing and operating machine learning (ML) applications leads to a variety of artifacts, such as datasets, features, models, hyperparameters, metrics, software, configurations, and logs. In order to enable comparability, reproducibility, and traceability of these artifacts across the ML lifecycle steps and iterations, systems and tools have been developed to support their collection, storage, and management. It is often not obvious what precise functional scope such systems offer so that the comparison and the estimation of synergy effects between candidates are quite challenging. In this paper, we aim to give an overview of systems and platforms which support the management of ML lifecycle artifacts. Based on a systematic literature review, we derive assessment criteria and apply them to a representative selection of more than 60 systems and platforms.
연구 동기 및 목표
- 기능적 및 비기능적 범위가 명확하지 않아 ML 아티팩트 관리 시스템(ML AMSs)을 비교하고 선택하는 데 어려움이 존재하는 문제를 해결하기 위해.
- 기능적 및 비기능적 차원에서 ML AMSs를 평가하기 위한 표준화된 평가 기준을 식별하고 정의하기 위해.
- 학계 및 산업계에서 제공하는 64종의 ML AMSs를 종합적으로 증거 기반으로 비교하여 도구 선택 및 통합을 지원하기 위해.
- ML 라이프사이클 단계 전반에서 재현 가능성, 추적 가능성, 상호운용성 측면에서 현재 시스템의 격차를 부각하기 위해.
- 연구자 및 실무자가 MLOps 워크플로우에 효과적으로 ML AMSs를 선택하고 조합할 수 있도록 지원하기 위해.
제안 방법
- 학계 및 산업계 자료에서 64종의 ML AMSs를 식별하고 수집하기 위해 체계적 문헌 리뷰를 수행하였다.
- 데이터셋, 모델, 하이퍼파라미터, 메트릭스, 코드, 설정, 로그 등을 포함한 ML 라이프사이클 아티팩트의 분류 체계를 정의하였다.
- 기능적(예: 아티팩트 추적, 실험 관리) 및 비기능적(예: 확장성, 통합 지원) 기능을 포함하는 포괄적인 평가 기준 세트를 개발하였다.
- 문서, 소스 코드, 플랫폼 기능을 상세 분석하여 각 식별된 시스템에 평가 기준을 적용하였다.
- 주로 실험 추적, 모델 레지스트리, MLOps 오케스트레이션 등에 중점을 두고 시스템을 분류하고, 종합적인 라이프사이클 관리 지원 능력을 평가하였다.
- 포괄적인 커버리지 확보를 위해 스노우볼링 기법과 인용 체이닝을 활용하였다.
실험 결과
연구 질문
- RQ1기능적 및 비기능적 능력 측면에서 ML 아티팩트 관리 시스템(ML AMSs)을 기술하고 평가하며 비교하기 위해 사용할 수 있는 기준은 무엇인가?
- RQ2학계 및 산업계에는 어떤 ML AMSs가 존재하며, 이들은 ML 라이프사이클 아티팩트를 관리하는 데에서 어떻게 다름이 있는가?
- RQ3기존의 ML AMSs가 재현 가능성, 추적 가능성, 비교 가능성 측면에서 ML 라이프사이클 단계 전반에서 어떤 강점, 한계, 상호보완 잠재력을 지니고 있는가?
- RQ4ML AMSs는 모델, 데이터셋, 하이퍼파라미터, 메타데이터, 실행 로그와 같은 다양한 아티팩트를 어떻게 관리하는가?
- RQ5현재 시스템에서 도구 연쇄, 상호운용성, 종단 간 라이프사이클 지원 측면에서 핵심 격차는 무엇인가?
주요 결과
- 연구는 64종의 별개의 ML AMSs를 식별하였으며, 대부분의 시스템이 실험 추적 및 모델 레지스트리에 집중하고 있으나, 전체 라이프사이클 관리 지원은 소수에 그친다.
- 조사된 시스템 중 오직 12%만이 데이터 및 모델 아티팩트의 라인저인 추적을 네이티브로 지원하여 재현 가능성에 제한을 초래한다.
- MLflow, Weights & Biases, Vertex AI는 실험 추적, 모델 레지스트리, 하이퍼파라미터 튜닝을 통합적으로 지원하는 가장 종합적인 플랫폼에 속한다.
- 많은 시스템이 상호운용성을 위한 표준화된 인터페이스나 API를 제공하지 않아 도구 연쇄 시 상호보완 잠재력이 낮다.
- 소프트웨어 설정 및 환경 종속성 관리에 대한 네이티브 지원이 부족한 상황이 심각한 격차로 나타나 있으며, 이는 재현 가능성에 매우 중요하다.
- 서베이 결과, 대부분의 시스템이 모델 및 실험 추적을 지원하지만, 기능, 데이터 전처리 파이프라인, 또는 모델 추론 로그의 버전 관리를 지원하는 시스템은 소수에 그친다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.