Skip to main content
QUICK REVIEW

[논문 리뷰] A benchmark of categorical encoders for binary classification

Federico Matteucci, Vadim Arzamasov|arXiv (Cornell University)|2023. 07. 17.
Machine Learning and Data ClassificationComputer Science인용 수 3
한 줄 요약

이 논문은 이진 분류를 위한 범주형 인코더에 대한 현재까지 가장 종합적인 벤치마크를 제시한다. 50개의 데이터셋, 5개의 기계학습 모델, 4개의 평가 지표, 3가지 튜닝 전략, 10가지 집계 방법을 포함해 총 32개의 인코더 구성에 대해 평가한다. 연구 결과, 인코더 성능은 실험적 요인에 매우 민감하며, 모델 선택, 평가 지표, 집계 전략에 따라 순위가 크게 달라짐을 확인하였다. 이는 이전에 범위가 좁은 연구에서 도출된 결론을 도전하며, 인코더 평가에 있어 더 넓은 실험 설계의 필요성을 강조한다.

ABSTRACT

Categorical encoders transform categorical features into numerical representations that are indispensable for a wide range of machine learning models. Existing encoder benchmark studies lack generalizability because of their limited choice of (1) encoders, (2) experimental factors, and (3) datasets. Additionally, inconsistencies arise from the adoption of varying aggregation strategies. This paper is the most comprehensive benchmark of categorical encoders to date, including an extensive evaluation of 32 configurations of encoders from diverse families, with 36 combinations of experimental factors, and on 50 datasets. The study shows the profound influence of dataset selection, experimental factors, and aggregation strategies on the benchmark's conclusions -- aspects disregarded in previous encoder benchmarks.

연구 동기 및 목표

  • 기존의 범주형 인코더 벤치마크가 일반화 가능성에 빈도가 낮은 데이터셋, 일관되지 않은 평가 지표, 명확하지 않은 튜닝 또는 집계 전략을 사용함에 따라 발생하는 문제를 해결하기 위해.
  • 기계학습 모델, 평가 지표, 튜닝 전략, 집계 방법과 같은 실험적 요인이 인코더 성능 순위에 미치는 영향을 평가하기 위해.
  • 결정 트리와 로지스틱 회귀 모델에 특히 초점을 맞춰 다양한 실험 설정에서 가장 강력한 인코더 구성 요건을 분리하고 권장하기 위해.
  • ρ-재현가능성과 J-재현가능성으로 재현가능성을 정량화하여, 결과가 모델과 데이터셋 샘플에 따라 상당히 다름을 입증하기 위해.
  • 향후 연구에서 재현 가능하고 비교 가능한 인코더 평가를 지원하기 위해 공개된 벤치마크 프레임워크를 제공하기 위해.

제안 방법

  • 본 연구는 다양한 분야의 50개의 이진 분류 데이터셋에서 최신 및 신규 인코더를 포함한 총 32개의 인코더 구성 요건을 평가한다.
  • 로지스틱 회귀, 랜덤 포레스트, 기울기 부스팅, k-NN, SVM 등 널리 사용되는 5개의 기계학습 모델을 사용하며, 튜닝 전략으로는 튜닝 없음, 모델 튜닝, 전체 파이프라인 튜닝의 세 가지 방법을 적용한다.
  • 성능 평가를 위해 ROC AUC, 균형 정확도, 정확도, 정밀도-재현도 AUC의 4개 평가 지표를 사용하여 다각도적 평가를 보장한다.
  • 프리드리히-네멘요, 케멘티-영, 히우리스틱 랭킹 등 10가지의 집계 전략을 적용하여 공통 랭킹을 도출하고, 후처리 방법에 대한 민감도를 평가한다.
  • 재현가능성은 ρ-재현가능성(랭킹 간 피어슨 상관계수)과 J-재현가능성(상위-k 집합 간 재현율 유사도)을 사용하여 정량화하여, 다양한 실험 조건에서 일관성의 통계적 검증이 가능하도록 한다.
  • 모든 실험은 표준화된 전처리를 통해 수행되며, 코드는 공개되어 있어 재현성 확보 및 향후 벤치마크 작업을 용이하게 한다.
Figure 1 : Sensitivity as the average similarity between rankings, measured with $\rho$ (upper triangle) and $J$ (lower triangle), computed between individual rankings for varying: (a) ML model, (b) quality metric, (c) tuning strategy, and between consensus rankings for varying (d) aggregation strat
Figure 1 : Sensitivity as the average similarity between rankings, measured with $\rho$ (upper triangle) and $J$ (lower triangle), computed between individual rankings for varying: (a) ML model, (b) quality metric, (c) tuning strategy, and between consensus rankings for varying (d) aggregation strat

실험 결과

연구 질문

  • RQ1기계학습 모델, 평가 지표, 튜닝 전략, 집계 방법 등 다양한 실험적 요인이 범주형 인코더 순위에 어떻게 영향을 미치는가?
  • RQ2범주형 인코더의 성능은 다양한 데이터셋과 실험 설정 간에 어느 정도 재현 가능한가?
  • RQ3결정 트리 및 선형 모델을 포함한 다양한 모델과 평가 지표에서 일관되게 뛰어난 성능을 보이는 인코더 구성 요건은 무엇인가?
  • RQ4집계 전략은 인코더의 공통 랭킹에 어떻게 영향을 미치며, 벤치마크 결과의 해석에 어떤 영향을 미치는가?
  • RQ5이전 연구들이 최고 성능을 보인 인코더에 대해 서로 다른 결론을 도출한 이유는 무엇이며, 이는 실험 설계의 차이로 설명될 수 있는가?

주요 결과

  • 인코더 성능은 기계학습 모델 선택에 매우 민감하며, 로지스틱 회귀는 가장 높은 재현가능성(ρ-재현가능성)을 보였고, 결정 트리는 가장 낮은 재현가능성을 보였다.
  • 결정 트리 모델에서는 웨이트 오브 은익(WoE)가 항상 1위로 순위가 매겨졌지만, 통계적 검정 결과 다른 인코더와 유의미한 차이가 없었다.
  • 로지스틱 회귀에서는 합계(Sum), 원-핫(One-Hot), 이진(Binary), 웨이트 오브 은익이 다른 인코더보다 유의미하게 높은 순위를 기록했으며, t-검정을 통해 통계적 유의성을 확인했다.
  • 민해시(Min-hash) 및 원-핫 인코더와 같은 유사도 기반 인코더는 0.05 유의수준에서 t-검정 결과 유의미한 성능 차이가 없었으며, 이는 이전 연구에서의 우월성 주장과 정반대되는 결과였다.
  • 케멘티-영과 프리드리히-네멘요와 같은 집계 전략은 뚜렷하게 다른 공통 랭킹을 도출하여, 후처리 방법이 벤치마크 결과의 해석에 미치는 영향이 크다는 점을 시사했다.
  • 재현가능성 지표 분석 결과, 더 큰 데이터셋 샘플은 신뢰도를 향상시키지만, J-재현가능성에서는 이 추세가 항상 성립하지 않아 순위 일관성에 복잡한 종속성이 존재함을 시사했다.
Figure 2 : Replicability as the average similarity of consensus rankings from disjoint subsets of datasets.
Figure 2 : Replicability as the average similarity of consensus rankings from disjoint subsets of datasets.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.