Skip to main content
QUICK REVIEW

[논문 리뷰] Sampling Techniques in Bayesian Target Encoding

Michael Larionov|arXiv (Cornell University)|2020. 06. 01.
Bayesian Modeling and Causal Inference참고 문헌 5인용 수 8
한 줄 요약

이 논문은 고정된 모멘트 대신 목표 통계량의 사후 분포에서 샘플링하는 방식으로 일반화 능력을 향상시키고 타겟 누출을 줄이는 새로운 범주형 변수 인코딩 방법인 Sampling Bayesian Encoder를 제안한다. 합성 및 실세계 데이터셋에서 전통적인 타겟 인코딩과 베이지안 타겟 인코딩을 모두 능가하며, 더 높은 정확도와 보다 우수한 특성 중요도 캘리브레이션을 달성한다.

ABSTRACT

Target encoding is an effective encoding technique of categorical variables and is often used in machine learning systems for processing tabular data sets with mixed numeric and categorical variables. Recently en enhanced version of this encoding technique was proposed by using conjugate Bayesian modeling. This paper presents a further development of Bayesian encoding method by using sampling techniques, which helps in extracting information from intra-category distribution of the target variable, improves generalization and reduces target leakage.

연구 동기 및 목표

  • 베이지안 추론을 활용하여 전통적인 타겟 인코딩에서 발생하는 타겟 누출과 과적합 문제를 해결한다.
  • 범주 내 목표 분포의 평균을 넘는 정보를 포착하여 고카디널리티를 가진 범주형 변수에서 일반화 능력을 향상시킨다.
  • 모멘트 기반의 베이지안 인코딩 대체로 이론적으로 탄탄한 샘플링 기반의 방법을 개발한다.
  • 허무한 노이즈 주입에 의존하는 것 대신, 샘플링을 통해 자연스럽게 매개변수 공간을 탐색함으로써 이를 줄인다.
  • 다양한 머신러닝 모델을 대상으로 합성 및 실세계 데이터셋에서의 방법의 실증적 검증을 수행한다.

제안 방법

  • 각 범주에 대해 목표 변수의 분포를 공액 사전을 사용하여 모델링하고, 학습 데이터를 통해 사후 분포를 갱신한다.
  • 사후 분포의 첫 Q개 모멘트를 사용하는 대신, 사후 분포에서 샘플링하여 인코딩 표현을 생성한다.
  • 인코딩 함수 f(θ)는 사후 모수를 Q차원 공간으로 매핑하여 다소의 표현 학습을 가능하게 한다.
  • 예측은 K개의 사후 샘플에 대한 몬테카를로 평균을 통해 추정된다: ŷ(xₙ) ≈ (1/K)Σŷ_θ(ξₙ, f₁(θₙ₁ᵏ), ..., fₘ(θₙₘᵏ)).
  • 학습 및 추론 모두에서 샘플링을 수행하며, 각 예측에 대해 K개의 샘플을 사용하여 데이터셋 크기를 K×N으로 효과적으로 증가시킨다.
  • 이 방법은 어떤 예측 모델에도 적용 가능하며, f(θ)의 선택을 통해 적응형 특성 공학이 가능하다. 예를 들어 다항식 또는 웨이트 오브 옵저버블리티를 사용할 수 있다.

실험 결과

연구 질문

  • RQ1베이지안 타겟 인코딩에서 사후 분포에서 샘플링하는 것이 고정된 모멘트를 사용하는 것보다 더 나은 일반화를 이끌 수 있는가?
  • RQ2제안된 샘플링 기반 방법은 표준 타겟 인코딩 및 LeaveOneOutEncoder에 비해 타겟 누출을 줄이는가?
  • RQ3샘플 수 K의 수가 모델 성능과 학습 효율성에 어떤 영향을 미치는가?
  • RQ4매핑 함수 f(θ)의 선택이 특히 표현력이 떨어지는 모델에서 모델 성능에 얼마나 큰 영향을 미치는가?
  • RQ5사전 스케일링 요소 γ가 희귀 범주에서 모델의 강건성에 어떤 영향을 미치는가?

주요 결과

  • make_classification 데이터셋에서 Random Forest를 사용한 결과, Sampling Bayesian Encoder는 0.6595의 정확도를 기록했으며, 최고의 LeaveOneOutEncoder 모델인 0.6585보다 略적으로 높았다.
  • make_hastie_10_2 데이터셋에서, 이 방법은 0.8229의 정확도를 기록했고, LeaveOneOutEncoder 기준선인 0.8217보다 높았다.
  • Adult 데이터셋에서, 이 방법은 0.8652의 정확도를 기록했으며, 최고의 LeaveOneOutEncoder 모델인 0.8647보다 높았다.
  • 메르세데스-벤츠 데이터셋에서, R² 점수는 제안된 방법으로 0.61135를 기록했고, LeaveOneOutEncoder 기준선인 0.60974보다 높았다.
  • 특성 중요도 분석 결과, Sampling Bayesian Encoder를 사용한 모델은 범주형 특성에 대해 훨씬 더 낮은 중요도를 할당했으며, 이는 타겟 누출 감소를 시사한다.
  • 경쟁 환경에서 공개 및 비공개 테스트 세트 모두에서 이 방법은 더 높은 성능을 보였으며, 이는 훈련되지 않은 데이터에 대한 더 나은 일반화 능력을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.