Skip to main content
QUICK REVIEW

[논문 리뷰] Amazon SageMaker Autopilot: a white box AutoML solution at scale

Piali Das, Valerio Perrone|arXiv (Cornell University)|2020. 12. 15.
Machine Learning and Data Classification참고 문헌 32인용 수 7
한 줄 요약

Amazon SageMaker Autopilot는 표본 데이터를 위한 다양한 머신러닝 파이프라인을 자동으로 생성하고 튜닝하는 확장성 있고 투명한 AutoML 시스템입니다. 데이터 과학자들이 모델를 검토하고 수정할 수 있도록 하면서도 프로덕션 준비 상태를 유지합니다. 기본 XGBoost와 비교해 뛰어난 성능을 보이며, 최신 기준 수준의 성능을 달성하고, 훈련 속도가 빠르고 지연 시간이 낮습니다. 편집 가능한 코드와 확장 가능한 전처리 컴포넌트를 통해 사용자 맞춤 설정이 가능합니다.

ABSTRACT

AutoML systems provide a black-box solution to machine learning problems by selecting the right way of processing features, choosing an algorithm and tuning the hyperparameters of the entire pipeline. Although these systems perform well on many datasets, there is still a non-negligible number of datasets for which the one-shot solution produced by each particular system would provide sub-par performance. In this paper, we present Amazon SageMaker Autopilot: a fully managed system providing an automated ML solution that can be modified when needed. Given a tabular dataset and the target column name, Autopilot identifies the problem type, analyzes the data and produces a diverse set of complete ML pipelines including feature preprocessing and ML algorithms, which are tuned to generate a leaderboard of candidate models. In the scenario where the performance is not satisfactory, a data scientist is able to view and edit the proposed ML pipelines in order to infuse their expertise and business knowledge without having to revert to a fully manual solution. This paper describes the different components of Autopilot, emphasizing the infrastructure choices that allow scalability, high quality models, editable ML pipelines, consumption of artifacts of offline meta-learning, and a convenient integration with the entire SageMaker suite allowing these trained models to be used in a production setting.

연구 동기 및 목표

  • 블랙박스 AutoML 시스템의 한계를 해결하기 위해 표본 데이터를 위한 투명하고 사용자 맞춤형이며 프로덕션 준비 상태인 솔루션을 제공하는 것.
  • 특성 공학, 알고리즘 선택, 하이퍼파rameter 튜닝에 필요한 수동 작업을 줄이면서도 높은 모델 성능을 유지하는 것.
  • 전문가 사용자가 완전히 수동 개발으로 되돌아가지 않고도 자동으로 생성된 파이프라인을 수정하고 확장할 수 있도록 하는 것.
  • 시간 시리즈 및 자연어 특성과 같은 복잡한 데이터 유형을 포함한 다양한 데이터셋과 복잡한 데이터 유형을 처리할 수 있도록 시스템을 확장하는 것.
  • 배포 및 추론을 위해 광범위한 AWS SageMaker 생태계와 원활하게 통합하는 것.

제안 방법

  • 시스템은 훈련 데이터의 품질을 예측하기 위해 결측치, 왜도, 상관관계, 랜드마크 특성 등을 포함한 포괄적인 메타특성 추출을 수행합니다.
  • 전문가 힌트와 제한된 훈련 데이터를 기반으로 한 메타학습 모델이 데이터셋 특성에 따라 적절한 전처리 및 알고리즘 파이프라인을 선택합니다.
  • 기능 공학, 훈련, 후처리 단계를 분리하는 분산형 컨테이너 아키텍처를 사용하여 다수의 다양한 파이프라인을 동시에 튜닝합니다.
  • 표준화된 메트릭(상대 오차 차이, 작업 성공률, 배치 100개 행 기준 추론 지연 시간)을 사용하여 각 파이프라인을 평가합니다.
  • 컴ponent 별 동적 하드웨어 할당을 지원하며, Docker 컨테이너를 통해 사용자가 커스텀 전처리기나 알고리즘을 삽입할 수 있습니다.
  • 모델는 저지연 시간 SageMaker 엔드포인트로 배포되며, 훈련, 튜닝, 추론 단계를 종합적으로 측정한 성능이 전체적으로 평가됩니다.

실험 결과

연구 질문

  • RQ1산업 규모의 머신러닝 워크플로우에서 자동화와 투명성, 사용자 제어를 어떻게 균형 있게 유지할 수 있는가?
  • RQ2훈련 데이터가 제한된 상황에서 메타학습과 힌트 기반 검색이 파이프라인 선택에 얼마나 기여할 수 있는가?
  • RQ3완전 관리형 AutoML 시스템이 전문가가 튜닝한 모델과 경쟁할 수 있는 성능을 달성하면서도 낮은 추론 지연 시간을 유지할 수 있는가?
  • RQ4복잡한 데이터 유형을 포함한 다양한 실제 표본 데이터셋에 대해 시스템은 어떻게 확장되는가?
  • RQ5성능이나 유지보수성에 손상 없이 확장성과 맞춤 설정을 가능하게 하는 아키텍처 패턴은 무엇인가?

주요 결과

  • Autopilot는 모든 데이터셋에서 기본 XGBoost 베이스라인보다 뛰어난 성능을 보이며, 상대 오차 차이 메트릭을 통해 일관된 향상을 보였습니다.
  • 시스템은 높은 작업 성공률을 기록하여 벤치마크에 포함된 대부분의 데이터셋에서 엔드 투 엔드 파이프라인 생성 및 모델 배포를 성공적으로 완료했습니다.
  • 85%의 데이터셋에서 Autopilot는 베이스라인 방법보다 성능이 동일하거나 향상되었으며, 다양한 데이터 유형에 걸쳐 뛰어난 견고성을 입증했습니다.
  • Autopilot 모델의 평균 추론 엔드포인트 지연 시간은 100개 행의 배치당 100ms 이하로 측정되어 강력한 프로덕션 준비 상태를 나타냈습니다.
  • 앙상블 방법을 사용하지 않았음에도 불구하고 Autopilot의 성능은 최신 기준 수준의 베이스라인과 경쟁 가능했으며, 이는 파이프라인 검색 및 튜닝 전략의 효과성을 입증합니다.
  • 모듈형이고 컨테이너 기반의 아키텍처는 새로운 알고리즘과 커스텀 전처리기의 원활한 통합을 가능하게 하여 확장성과 향후 비표본 데이터 유형으로의 확장성을 지원합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.