Skip to main content
QUICK REVIEW

[논문 리뷰] A Comparison of Machine Learning Methods for Data with High-Cardinality Categorical Variables

Fabio Sigrist|arXiv (Cornell University)|2023. 07. 05.
Forecasting Techniques and ApplicationsDecision Sciences인용 수 3
한 줄 요약

이 논문은 고카디널리티 카디널리티를 가진 표형 데이터에 대해 트리 부스팅, 딥 네URAL 네트워크, 그리고 랜덤 효과를 포함하거나 포함하지 않은 선형 혼합 효과 모델을 비교한다. 랜덤 효과를 포함한 모델이 예측 정확도를 크게 향상시키며, 트리 부스팅 모델이 랜덤 효과를 포함한 딥 네URAL 네트워크를 여러 데이터셋에서 모두 앞선다.

ABSTRACT

High-cardinality categorical variables are variables for which the number of different levels is large relative to the sample size of a data set, or in other words, there are few data points per level. Machine learning methods can have difficulties with high-cardinality variables. In this article, we empirically compare several versions of two of the most successful machine learning methods, tree-boosting and deep neural networks, and linear mixed effects models using multiple tabular data sets with high-cardinality categorical variables. We find that, first, machine learning models with random effects have higher prediction accuracy than their classical counterparts without random effects, and, second, tree-boosting with random effects outperforms deep neural networks with random effects.

연구 동기 및 목표

  • 고카디널리티 카디널리티를 가진 표형 데이터셋에서 머신러닝 모델의 성능을 평가하기 위해.
  • 이러한 데이터에서 랜덤 효과를 통합하면 예측 정확도가 향상되는지 조사하기 위해.
  • 예측 성능 및 계산 효율성 측면에서 트리 부스팅, 딥 네URAL 네트워크, 선형 혼합 효과 모델을 비교하기 위해.
  • 다양한 인코딩 전략(예: 원핫 인코딩, 임베딩, 숫자 매핑)이 모델 성능에 미치는 영향을 평가하기 위해.
  • 고카디널리티 환경에서 랜덤 효과가 효과적인 정규화 기법으로 기능하는지 확인하기 위해.

제안 방법

  • 실제 표형 데이터셋에서 트리 부스팅(_LIGHTGBM, CatBoost, GPBoost_), 딥 네URAL 네트워크의 엔티티 임베딩, 선형 혼합 효과 모델의 다양한 변종을 경험적으로 비교한다.
  • 고카디널리티 카디널리티 변수의 각 수준을 랜덤 효과로 간주하여 트리 부스팅 및 딥 네URAL 네트워크에서 그룹 수준의 변동성을 모델링한다.
  • 혼합 효과 모델링을 적용하여 반응 변수의 평균을 고정 효과와 랜덤 효과의 합으로 모델링하고, 랜덤 효과는 학습된 분산을 가진 정규분포에서 추출된다.
  • 딥 네URAL 네트워크의 경우, 밀집층과 랜덤 효과(LMMNN)를 조합한 하이브리드 아키텍처를 사용하여 그룹 수준 패턴을 포착한다.
  • 트리 부스팅의 경우, LIGHTGBM과 CatBoost의 카디널리티 변수를 위한 내장된 지원을 사용하고, 숫자 매핑과의 성능을 비교한다.
  • 평균 제곱오차(MSE)를 사용하여 모델을 평가하고, 최고 성능 모델에 대한 평균 상대적 차이와 데이터셋 간 평균 순위를 보고한다.
Figure 1: Average relative difference (in %) to the lowest test MSE. The Wages data set is not included for calculating this since not all methods were run on it.
Figure 1: Average relative difference (in %) to the lowest test MSE. The Wages data set is not included for calculating this since not all methods were run on it.

실험 결과

연구 질문

  • RQ1머신러닝 모델에 랜덤 효과를 통합하면 고카디널리티 카디널리티 변수에서 예측 정확도가 향상되는가?
  • RQ2랜덤 효과를 포함한 트리 부스팅 모델과 랜덤 효과를 포함한 딥 네URAL 네트워크 모델 간 예측 성능는 어떻게 비교되는가?
  • RQ3다양한 인코딩 전략(예: 원핫, 임베딩, 숫자 매핑)은 고카디널리티 카디널리티 변수에서 모델 성능에 어떤 영향을 미치는가?
  • RQ4선형 혼합 효과 모델은 이 설정에서 전통적인 독립 모델보다 성능이 뛰어나지 않는가?
  • RQ5고카디널리티 카디널리티 변수를 처리할 때 트리 부스팅이 딥 네URAL 네트워크보다 일관된 성능 우위를 보이는가?

주요 결과

  • 랜덤 효과를 포함한 머신러닝 모델은 랜덤 효과 없이 구현된 전통적 모델보다 예측 정확도가 유의미하게 높다.
  • 랜덤 효과를 포함한 트리 부스팅 모델은 랜덤 효과를 포함한 딥 네URAL 네트워크를 능가하며, LMMNN의 경우 최고 성능 모델 대비 평균 상대적 차이가 17.3%이며, LightGBM(Cat)의 경우 17.4%인 반면, LightGBM(Num)는 111%, 임베딩을 사용한 신경망은 189%에 이른다.
  • 전반적으로 가장 뛰어난 성능을 보인 모델은 GPBoost에 랜덤 효과를 적용한 것으로, 평균 상대적 차이는 9.63%이며 평균 순위는 2.43이었다.
  • 선형 혼합 효과 모델은 가장 열악한 성능을 보였으며, 평균 상대적 차이는 47.7%이며 평균 순위는 5.71이었다.
  • CatBoost와 LightGBM는 내장된 카디널리티 지원을 통해 숫자 매핑 대비 더 뛰어난 성능을 보였으며, LightGBM(Cat)는 평균 순위 3.29를 기록했다.
  • 벽시계 시간은 크게 다름에 따라 신경망과 LMMNN는 GPU에서 실행되고, 다른 모델들은 CPU에서 실행되었지만, 성능 차이와 직접적인 관련은 없었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.