Skip to main content
QUICK REVIEW

[논문 리뷰] Ensemble Squared: A Meta AutoML System

Jason J. Yoo, Tony Joseph|arXiv (Cornell University)|2020. 12. 10.
Machine Learning and Data Classification참고 문헌 20인용 수 4
한 줄 요약

Ensemble Squared (Ensemble 2)는 다양한 오픈소스 AutoML 도구들로부터 파이프라인을 앙상블하여 테이블 기반 분류 벤치마크에서 최고 성능을 달성하는 메타 AutoML 시스템이다. 기본 AutoML 시스템들의 상보적인 검색 전략과 모델 공간을 활용함으로써 정확도와 내구성을 향상시켜, 벽시계 시간 비교에서 AutoGluon을 포함한 개별 시스템들을 능가한다.

ABSTRACT

There are currently many barriers that prevent non-experts from exploiting machine learning solutions ranging from the lack of intuition on statistical learning techniques to the trickiness of hyperparameter tuning. Such barriers have led to an explosion of interest in automated machine learning (AutoML), whereby an off-the-shelf system can take care of many of the steps for end-users without the need for expertise in machine learning. This paper presents Ensemble Squared (Ensemble$^2$), an AutoML system that ensembles the results of state-of-the-art open-source AutoML systems. Ensemble$^2$ exploits the diversity of existing AutoML systems by leveraging the differences in their model search space and heuristics. Empirically, we show that diversity of each AutoML system is sufficient to justify ensembling at the AutoML system level. In demonstrating this, we also establish new state-of-the-art AutoML results on the OpenML tabular classification benchmark.

연구 동기 및 목표

  • 모델 선택 및 하이퍼파라미터 튜닝의 복잡성으로 인해 비전문가들이 기계학습을 적용하는 데 직면하는 장벽을 해결하기 위해.
  • 기본 AutoML 시스템들 간의 검색 전략과 모델 공간의 내재적 다양성 덕분에 다수의 AutoML 시스템을 앙상블함으로써 성능 향상이 측정 가능한지 조사하기 위해.
  • 다양한 기존 AutoML 도구들의 강점을 결합한 내구성 있고 접근성이 높은 AutoML 시스템을 구축하기 위해.
  • 메타-앙상블링을 통한 AutoML 시스템의 병합을 통해 OpenML 테이블 기반 분류 벤치마크에서 새로운 SOTA 기준을 설정하기 위해.

제안 방법

  • 시스템은 두 단계 파이프라인을 사용한다: 먼저, 고정된 시간 제한 내에서 Singularity 컨테이너를 통해 M개의 기본 AutoML 시스템을 병렬로 실행하여 기계학습 파이프라인을 탐색한다.
  • 각 기본 시스템은 고유한 검색 공간, 히우리스틱, 하이퍼파라미터 최적화 전략을 사용하여, 모델 및 전처리 선택 측면에서 다양성을 활용한다.
  • 탐색 단계 이후, 모든 기본 시스템에서 검증 점수 기준으로 상위 K개의 파이프라인을 선택하고, 필요에 따라 전체 훈련 세트에서 재학습할 수 있다.
  • 선택된 파이프라인들은 최종 테스트 세트 예측을 생성하기 위해 다수결 투표 또는 스태킹 메타-러너를 사용하여 앙상블된다.
  • 시스템은 내구성 있도록 설계되었으며, 모든 기본 AutoML 시스템이 실패할 경우에만 실패하므로, 개별 시스템보다 신뢰성이 높다.
  • 공개 웹 인터페이스를 통해 비전문가들도 최소한의 기술 전문성으로 데이터셋을 업로드하고 예측 결과를 받을 수 있다.

실험 결과

연구 질문

  • RQ1다수의 AutoML 시스템을 앙상블하면 개별 시스템 대비 성능 향상이 이루어지는가?
  • RQ2기존 AutoML 시스템들의 성능에 충분한 다양성이 존재하여 AutoML 수준에서의 메타-앙상블링이 타당한가?
  • RQ3벽시계 시간과 동일한 계산 자원 조건 하에서 Ensemble 2는 최고 성능을 내는 AutoML 시스템들과 비교해 어떻게 성과를 내는가?
  • RQ4기본 AutoML 시스템들이 다양한 데이터셋에서 상관관계가 있거나 없음을 얼마나 보여주는가?

주요 결과

  • Ensemble 2는 OpenML 테이블 기반 분류 벤치마크에서 새로운 SOTA 성능을 달성하여, 벽시계 시간 비교에서 모든 개별 AutoML 시스템을 능가했다.
  • 1시간 벽시계 시간 비교에서, Ensemble 2는 OpenML 데이터셋 41개 중 31개에서 1위를 기록했으며, AutoGluon은 30개에서 1위를 기록했다.
  • 동일한 계산 조건(1시간 대비 5시간 실행) 하에서는 Ensemble 2가 경쟁력 있는 성능을 유지했으며, AutoGluon이 총합에서 가장 뛰어났지만, 다른 시스템들은 더 긴 실행 시간 동안 약간의 성능 저하를 보였다.
  • 상관관계 분석 결과, 기본 AutoML 시스템들이 중간에서 낮은 상관관계(예: AutoGluon과 CMU AutoML 간 r ≈ 0.79)를 보이며, 메타-앙상블링에 타당한 다양성이 있음을 확인했다.
  • 시스템은 개선된 내구성을 보였으며, 모든 기본 AutoML 시스템이 실패할 경우에만 실패했고, 이는 개별 시스템의 실패에 대한 저항력이 높음을 시사한다.
  • 앙상블의 성능 향상은 기본 AutoML 시스템들 간의 검색 공간, 히우리스틱, 전처리 전략의 다양성 덕분으로 기인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.