Skip to main content
QUICK REVIEW

[논문 리뷰] Towards a more efficient representation of imputation operators in TPOT

Unai Garciarena, Alexander Mendiburu|arXiv (Cornell University)|2018. 01. 13.
Evolutionary Algorithms and Applications참고 문헌 16인용 수 3
한 줄 요약

이 논문은 TPOT라는 자동화된 머신러닝 파이프라인 최적화 도구에 임퓨테이션 방법(IMs)을 더 효율적으로 통합하기 위해 강타입 유전적 프로그래밍(GP) 접근법을 제안한다. IMs를 파이프라인 시작부분에만 배치할 수 있도록 제약 조건을 가진 연산자로 재정의함으로써, 타당하지 않은 파이프라인의 수를 크게 줄여 검색 효율성과 정확도를 향상시키지만, 더 넓고 효과적인 검색 공간 덕분에 약간의 런타임 증가가 발생한다.

ABSTRACT

Automated Machine Learning encompasses a set of meta-algorithms intended to design and apply machine learning techniques (e.g., model selection, hyperparameter tuning, model assessment, etc.). TPOT, a software for optimizing machine learning pipelines based on genetic programming (GP), is a novel example of this kind of applications. Recently we have proposed a way to introduce imputation methods as part of TPOT. While our approach was able to deal with problems with missing data, it can produce a high number of unfeasible pipelines. In this paper we propose a strongly-typed-GP based approach that enforces constraint satisfaction by GP solutions. The enhancement we introduce is based on the redefinition of the operators and implicit enforcement of constraints in the generation of the GP trees. We evaluate the method to introduce imputation methods as part of TPOT. We show that the method can notably increase the efficiency of the GP search for optimal pipelines.

연구 동기 및 목표

  • 임퓨테이션 방법(IMs)을 통합할 때 타당하지 않은 파이프라인이 다수 생성되는 이전 TPOT 방법의 비효율성을 해결하기 위해.
  • 유전적 프로그래밍(GP)의 검색 효율성을 향상시키기 위해 IM 통합에 대한 구조적 제약 조건을 도입하기 위해.
  • IMs를 초기 단계에서 고정된 것으로 설정하는 것이 아니라, 파이프라인 최적화 과정의 일부로 진화시킬 수 있도록 하기 위해.
  • 기존의 문법 기반 GP 프레임워크와의 호환성을 유지하면서도, 누락된 데이터를 처리할 수 있는 표현력을 향상시키기 위해.
  • 차원 축소나 특성 스케일링과 같은 다른 제약 조건이 있는 머신러닝 연산자로의 프레임워크 확장을 위한 기반을 마련하기 위해.

제안 방법

  • IMs를 GP 문법 내에서 특수한 제약 조건이 있는 연산자로 재정의하여, 파이프라인의 시작 부분에만 배치되도록 보장한다.
  • 모든 파이프라인의 시작 부분에 정확히 하나의 IM이 존재하도록 보장하는 개념적 제약 조건을 도입한다. 이는 후속 단계에서 잘못된 위치에 IM이 삽입되는 것을 방지한다.
  • 강타입 GP를 사용하여 유형 일致성을 강제하고 트리 생성 중에 타당하지 않은 파이프라인 구조가 생성되지 않도록 한다.
  • 다중 또는 잘못된 위치에 있는 IMs를 허용하지 않는 제약 조건을 문법에 통합하여, 후속 컴포넌트에 항상 임퓨티드된 데이터가 유입되도록 보장한다.
  • 기존 TPOT의 GP 프레임워크를 최소한의 변경으로 활용하여 새로운 문법 구조를 지원한다.
  • IMs가 초기 임퓨테이션 단계 이후에 삽입되지 않도록 보장하여, 후속 컴포넌트가 항상 임퓨티드된 데이터를 받도록 한다.

실험 결과

연구 질문

  • RQ1임퓨테이션 방법(IMs)을 TPOT의 유전적 프로그래밍 기반 파이프라인 검색에 효율적으로 통합할 수 있는 방법은 무엇인가? 이때 타당하지 않은 파이프라인이 다수 생성되지 않도록 할 수 있는가?
  • RQ2임퓨테이션 방법에 엄격한 위치 제약 조건(파이프라인 시작부분에만 허용)을 적용할 경우, 검색 효율성과 해의 품질에 어떤 영향을 미치는가?
  • RQ3제약 조건이 내장된 강타입 GP 문법은 누락된 데이터가 존재하는 환경에서 TPOT의 수렴성과 성능을 향상시킬 수 있는가?
  • RQ4이전 방법에서 IMs를 단순한 사전 처리 단위로 간주하는 것과 비교해 볼 때, 제안된 방법은 정확도와 계산 비용 측면에서 어떤가?
  • RQ5이러한 제약 기반 문법 확장은 자동화된 파이프라인 최적화에서 다른 머신러닝 연산자로 일반화할 수 있는 정도는 어느 정도인가?

주요 결과

  • 새로운 문법을 적용한 TPOT는 모든 9개 데이터셋에서 이전 방법보다 높은 평균 정확도를 지속적으로 달성했으며, 특히 초기 평가 단계에서 두드러진 성능 향상을 보였다.
  • IMs가 파이프라인 시작부분에만 위치할 수 있도록 강제하는 제약 조건 덕분에, 타당하지 않은 파이프라인의 수가 극적으로 감소했다.
  • 더 많은 수의 평가된 파이프라인이 존재함에도 불구하고 런타임이 약간 증가했음에도 불구하고, 향상된 검색 효율성 덕분에 더 나은 해에 더 빨리 수렴하는 데 성공했다.
  • 무작위로 생성된 타당한 파이프라인에 대한 편향을 줄여, 진화 과정이 더 다양한 효율적인 파이프라인 구조를 탐색할 수 있도록 했다.
  • 결과적으로, IMs를 진화 과정에 통합하는 것이 고정된 사전 처리 임퓨테이션보다 더 나은 모델 성능을 이끌어낸다.
  • 이 방법은 확장 가능하며, 특성 스케일링이나 차원 축소와 같은 다른 제약 조건이 있는 머신러닝 연산자도 파이프라인 진화 과정에 통합할 수 있도록 적응 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.