Skip to main content
QUICK REVIEW

[논문 리뷰] LightAutoML: AutoML Solution for a Large Financial Services Ecosystem

Anton Vakhrushev, Oleksandr S. Ryzhkov|arXiv (Cornell University)|2021. 09. 03.
Machine Learning and Data Classification참고 문헌 35인용 수 6
한 줄 요약

LightAutoML는 대규모 유럽 금융 서비스 생태계를 대상으로 한 도메인 특화 AutoML 프레임워크로, 속도, 확장성, 복잡한 비정상적 데이터 워크플로우 지원을 최적화하였다. 기울기 부스팅 트리와 선형 모델에만 집중하고 고급 전처리 및 동적 하이퍼파rameter 튜닝을 통해 일반 목적의 AutoML 도구를 능가하며, 인간 데이터 과학자 수준의 모델 품질을 달성하면서도 학습 시간을 최대 10배 단축하고 개발 비용을 수백만 달러 절감하였다.

ABSTRACT

We present an AutoML system called LightAutoML developed for a large European financial services company and its ecosystem satisfying the set of idiosyncratic requirements that this ecosystem has for AutoML solutions. Our framework was piloted and deployed in numerous applications and performed at the level of the experienced data scientists while building high-quality ML models significantly faster than these data scientists. We also compare the performance of our system with various general-purpose open source AutoML solutions and show that it performs better for most of the ecosystem and OpenML problems. We also present the lessons that we learned while developing the AutoML system and moving it into production.

연구 동기 및 목표

  • 다양한 데이터 소스, 비정상적 프로세스, 고성능 모델 배포를 수반하는 대규모이고 복잡한 금융 서비스 생태계의 고유하고 특수한 요구사항을 해결한다.
  • 생산 환경에서 학습 시간과 운영 비용을 크게 줄이면서도 높은 성능을 유지하는 AutoML 시스템을 개발한다.
  • 금융 응용 프로그램에 특화된 경량적이고 빠르며 확장 가능한 AutoML 파이프라인을 구축한다. 이는 시간 외 검증 및 행동 모델링을 포함한다.
  • 실제 금융 데이터셋과 OpenML 벤치마크에서 일반 목적의 AutoML 프레임워크와 인간 데이터 과학자보다 뛰어난 성능을 입증한다.
  • 24/7 생산 환경에서 수천 개의 머신러닝 모델을 자동으로 지속적으로 생성할 수 있도록 한다. 수작업으로는 달성할 수 없는 능력을 실현한다.

제안 방법

  • 성능을 희생시키지 않으면서도 복잡성을 줄이고 학습 속도를 높이기 위해 모델 공간을 기울기 부스팅 트리(GBMs)와 선형 모델로만 제한한다.
  • 문제 크기와 데이터 규모에 따라 최적화 품질과 속도의 균형을 맞추는 동적 하이퍼파rameter 튜닝 전략을 구현한다.
  • 메타 통계와 데이터 유형 히우리스틱을 사용해 자동으로 특징 변환을 선택하는 새로운 규칙 기반 전처리 파이프라인을 도입한다.
  • 수천 대의 기업 시스템에서 온 이질적이고 문서화가 잘 되지 않은 데이터를 처리하기 위해 자동 데이터 타이핑과 스키마 추론을 구현한다.
  • 다양한 생산 플랫폼과 CI/CD 파이프라인에 통합하여 모델 학습, 검증, 배포의 종단 간 자동화를 가능하게 한다.
  • 금융 리스크 및 고객 행동 응용 프로그램에 필수적인 전용 검증 모드, 특히 시간 외 검증 및 순차적 행동 모델링을 지원한다.

실험 결과

연구 질문

  • RQ1복잡하고 비정상적인 데이터를 다루는 실제 금융 응용 프로그램에서 도메인 특화 AutoML 시스템이 일반 목적의 AutoML 솔루션을 능가할 수 있는가?
  • RQ2기울기 부스팅 트리와 선형 모델 두 가지 모델 유형만을 기반으로 한 경량 AutoML 프레임워크가 인간이 수작업으로 튜닝한 모델과 비교해도 성능이 유사하거나 뛰어나게 달성할 수 있는가?
  • RQ3다양한 금융 사용 사례에서 LightAutoML는 인간 데이터 과학자와 비교해 모델 품질과 개발 속도 면에서 어떻게 성과를 내는가?
  • RQ4대규모이고 이질적인 금융 생태계에서 AutoML 시스템을 대규모로 구현할 때의 주요 기술적 및 조직적 과제는 무엇인가?
  • RQ5수천 개의 모델을 대규모로 자동 생성하는 것은 인간 데이터 과학자가 달성할 수 없는 비즈니스 가치와 능력을 제공할 수 있는가?

주요 결과

  • LightAutoML는 H2O, AutoGluon, Google Cloud AutoML와 같은 선도적인 일반 목적 AutoML 도구보다도 기업 내 금융 응용 프로그램과 OpenML 벤치마크에서 모두 뛰어난 성능을 보였으며, 특히 AUC-ROC 및 LogLoss 지표에서 두각을 나타냈다.
  • 기존 데이터 과학자 워크플로우 대비 모델 학습 시간을 4배에서 10배까지 단축했으며, CI/CD 파이프라인과 통합 시 시장 진입 시간 개선 폭이 최대 70%에 이르렀다.
  • 배포된 모델의 60~70%에서 인간 데이터 과학자보다 뛰어난 성능을 달성했으며, 특히 데이터 준비 및 전처리 작업에서 가장 높은 성과 향상을 보였다.
  • 이 프레임워크는 24/7 생산 환경에서 수천 개의 머신러닝 모델을 자동으로 지속적으로 생성할 수 있게 했으며, 수작업으로는 달성할 수 없는 능력을 실현했다.
  • 매우 높은 생산성 향상에도 불구하고 데이터 과학자 수가 시간이 지남에 따라 증가했으며, 이는 AutoML가 인간 전문 지식을 대체하기보다는 머신러닝 응용의 범위를 확장했음을 시사한다.
  • 수천 개의 특징과 수백만 건의 레코드를 포함하는 대규모 이질적 데이터를 다룰 때도 뛰어난 강건성을 보였으며, 다양한 금융 응용 프로그램에서 높은 성능을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.