Skip to main content
QUICK REVIEW

[논문 리뷰] Encoding categorical data: Is there yet anything 'hotter' than one-hot encoding?

Ekaterina Poslavskaya, А. А. Королев|arXiv (Cornell University)|2023. 12. 28.
Machine Learning and Data Classification인용 수 9
한 줄 요약

본 연구는 선형 혼합효과 모델을 사용하여 대규모 OpenML 데이터셋 컬렉션의 여러 인코딩 스킴을 평가하고, 다항(class multiclass) 작업에서 원-핫(one-hot) 및 헬머트(Helmert) 코딩이 타깃 기반 인코더보다 우수하다고 보이며, 이진(binary) 작업에서는 차이가 작다.

ABSTRACT

Categorical features are present in about 40% of real world problems, highlighting the crucial role of encoding as a preprocessing component. Some recent studies have reported benefits of the various target-based encoders over classical target-agnostic approaches. However, these claims are not supported by any statistical analysis, and are based on a single dataset or a very small and heterogeneous sample of datasets. The present study explores the encoding effects in an exhaustive sample of classification problems from OpenML repository. We fitted linear mixed-effects models to the experimental data, treating task ID as a random effect, and the encoding scheme and the various characteristics of categorical features as fixed effects. We found that in multiclass tasks, one-hot encoding and Helmert contrast coding outperform target-based encoders. In binary tasks, there were no significant differences across the encoding schemes; however, one-hot encoding demonstrated a marginally positive effect on the outcome. Importantly, we found no significant interactions between the encoding schemes and the characteristics of categorical features. This suggests that our findings are generalizable to a wide variety of problems across domains.

연구 동기 및 목표

  • 포괄적으로 샘플링된 광범위한 분류 문제 집합에서 인코딩 유형이 예측 성능에 미치는 영향을 평가한다.
  • 실제 데이터셋에서 타깃 기반 인코더가 타깃-인식 없이 작동하는 인코더에 비해 이점을 제공하는지 확인한다.
  • 인코딩 선택이 학습/추론 효율성 및 모델 기반 특성 중요도에 영향을 미치는지 평가한다.
  • 인코딩 스킴과 데이터셋 특성(범주형 특성의 보급도, 카디널리티 등) 간의 상호작용을 조사한다.
  • 이진 및 다중 클래스 작업 전반에 걸친 인코딩 효과의 일반화 가능성을 검토한다.

제안 방법

  • 이진 및 다중 클래스 분류 작업의 포괄적 OpenML 데이터셋 모음을 구성했다.
  • 모든 범주형 특성에 다섯 가지 인코더(label, one-hot, Helmert, target, weight of evidence)를 적용했다.
  • 각 인코딩된 데이터셋에서 H2O AutoML을 사용해 여러 기본 모델과 스택드 앙상블을 학습시켰다.
  • 작업 ID를 랜덤 효과로, 인코딩 유형과 특성 특징을 고정 효과로 하는 선형 혼합효과 모델을 적합시켰다.
  • 선형 및 비선형 모델(GLM 및 XGBoost) 간의 성능과 이진 대 다중 클래스 작업 간의 성능을 비교했다.

실험 결과

연구 질문

  • RQ1인코딩 유형이 이진 및 다중 클래스 작업 전반에 걸쳐 이질적 앙상블(스택드 앙상블)의 예측력을 좌우하는가?
  • RQ2인코딩 유형이 개별 기본 추정치(선형 대 비선형)의 예측력에 영향을 미치는가?
  • RQ3인코딩 스킴이 서로 다른 데이터셋 특성에 대해 학습 시간 및 효율성에 어떤 영향을 미치는가?
  • RQ4성능 결정에 있어 인코딩 스킴과 범주형 특성 특성 간의 상호작용이 있는가?
  • RQ5OpenML의 다양한 실제 분류 문제에 대해 결과가 일반화되는가?

주요 결과

  • 이진 작업에서 범주형 특성의 비율이 앙상블 성능에 부정적으로 작용하는 반면 평균 카디널리티가 높아지면 성능이 향상될 수 있다; 카디널리티가 높으면 성능에 악영향을 줄 수 있다.
  • 다중 클래스 작업에서 타깃 클래스 수가 성능의 주요 결정 요인이고, OHE와 Helmert 인코딩이 스택드 앙상블에 대해 타깃 기반 인코더보다 약간 우수한 성능을 보인다.
  • 선형 모델의 경우 라벨 인코딩은 이진 작업에서 예측력을 감소시키는 경향이 있고, 다중 클래스 작업에서는 타깃 기반/지시자 인코딩이 일반적으로 라벨 인코딩보다 우수하다.
  • 모델 간에 인코딩 유형은 이진 작업에서 앙상블 성능에 제한적이거나 의미 있는 영향을 미치지 않았지만 다중 클래스 GLM/XGBoost 결과에서 OHE와 Helmert의 일부 이점이 관찰되었다.
  • 타깃 기반 인코더와 OHE가 특정 다중 클래스 상황에서 라벨 인코딩보다 이점을 제공할 수 있으며, 결과는 모델 유형에 따라 다르다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.