Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Features For Relational Data.

Hoang Thanh Lam, Tran Ngoc Minh|arXiv (Cornell University)|2018. 01. 16.
Data Mining Algorithms and Applications참고 문헌 10인용 수 8
한 줄 요약

이 논문은 히우리스틱 기반 규칙 시스템과 딥 네URAL 네트워크를 결합하여 수동 공학 없이 예측 가능한 특징을 발견하는 자동 특징 학습 프레임워크를 제안한다. 이는 최첨단 성능을 달성하고 카글 키워드 경쟁에서 늦은 메달을 획득하며, 복잡한 관계형 데이터셋을 사용해 이를 달성한 첫 번째 알려진 자동화된 시스템임을 나타낸다.

ABSTRACT

Feature engineering is one of the most important but tedious tasks in data science projects. This work studies automation of feature learning for relational data. We first theoretically proved that learning relevant features from relational data for a given predictive analytics problem is NP-hard. However, it is possible to empirically show that an efficient rule based approach predefining transformations as a priori based on heuristics can extract very useful features from relational data. Indeed, the proposed approach outperformed the state of the art solutions with a significant margin. We further introduce a deep neural network which automatically learns appropriate transformations of relational data into a representation that predicts the target variable well instead of being predefined as a priori by users. In an extensive experiment with Kaggle competitions, the proposed methods could win late medals. To the best of our knowledge, this is the first time an automation system could win medals in Kaggle competitions with complex relational data.

연구 동기 및 목표

  • 관계형 데이터베이스를 포함한 데이터 과학 프로젝트에서 반복적이고 시간이 오래 소요되는 특징 공학의 과제를 해결하기 위해.
  • 예측 분석 작업을 위한 관계형 데이터에서 관련 특징을 자동으로 학습하는 시스템을 개발하기 위해.
  • 문제의 이론적 난이도를 극복하기 위해 실용적이고 경험적으로 효과적인 방법을 제안하기 위해.
  • 카글 경쟁에서의 실제 벤치마크를 통해 자동 특징 학습의 효과성을 입증하기 위해.
  • 복잡한 관계형 데이터셋에서 최첨단 기법들보다 뛰어난 성능을 달성하기 위해.

제안 방법

  • 관계형 데이터에서 특징을 학습하는 것이 NP-난이도임을 이론적으로 증명하여 문제의 계산 난이도를 입증하기 위해.
  • 분야 전문 히우리스틱을 사용해 사전에 특징 변환을 정의하는 규칙 기반 접근법을 설계하여 효율적으로 유용한 특징을 추출하기 위해.
  • 사전에 인간이 정의한 규칙 없이도 관계형 데이터를 예측 가능한 표현으로 최적의 변환을 자동으로 학습하는 딥 네URAL 네트워크를 구현하기 위해.
  • 원시 테이블을 목표 변수를 효과적으로 예측할 수 있는 표현으로 매핑하기 위해 관계형 데이터에서 끝에서 끝까지 딥 네URAL 네트워크를 훈련하기 위해.
  • 카글 경쟁에서의 데이터를 포함한 다양한 관계형 데이터셋에서 규칙 기반 및 신경망 접근법을 평가하기 위해.
  • 최첨단 특징 공학 기법들과의 성능 비교를 위해 경험적 평가를 수행하기 위해.

실험 결과

연구 질문

  • RQ1관계형 데이터에서 자동 특징 학습이 수동 특징 공학과 경쟁력 있는 성능을 달성하거나 이를 뛰어넘을 수 있는가?
  • RQ2분야 특화 히우리스틱을 사용해 효율적으로 의미 있는 특징을 관계형 데이터에서 추출할 수 있는 규칙 기반 시스템을 설계할 수 있는가?
  • RQ3딥 네URAL 네트워크가 사전 정의된 인간의 규칙 없이도 끝에서 끝까지 최적의 데이터 변환을 학습할 수 있는가?
  • RQ4제안된 자동화된 시스템이 실제 관계형 데이터셋에서 기존 최첨단 기법들을 뛰어넘을 수 있는가?
  • RQ5자동 특징 학습 시스템이 카글과 같은 고위험 데이터 과학 경쟁에서 메달을 획득할 수 있는가?

주요 결과

  • 이론적 분석을 통해 관계형 데이터에서 특징을 학습하는 것이 NP-난이도임을 입증하여 효율적인 히우리스틱 또는 자동 학습이 필요한 이유를 정당화한다.
  • 히우리스틱 기반 규칙 시스템이 최첨단 특징 공학 기법들보다 예측 성능에서 뚜렷한 우위를 보였다.
  • 딥 네URAL 네트워크 컴포넌트는 사전에 정의된 변환 규칙이 없이도 효과적인 데이터 표현을 성공적으로 학습했다.
  • 통합된 접근법은 여러 카글 경쟁에서 늦은 메달을 획득하여 복잡한 관계형 데이터에서의 실제 효과성을 입증했다.
  • 저자들의 지식에 비추어 볼 때, 이는 관계형 데이터를 사용해 카글 경쟁에서 메달을 획득한 첫 번째 자동화된 시스템이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.