Skip to main content
QUICK REVIEW

[논문 리뷰] Trees-Based Models for Correlated Data

Assaf Rabinowicz, Saharon Rosset|arXiv (Cornell University)|2021. 02. 16.
Gaussian Processes and Bayesian Inference참고 문헌 33인용 수 4
한 줄 요약

이 논문은 회귀 트리, 랜덤 포레스트, 기울기 부스팅에 대해 관련 구조(예: 군집화, 종단적, 공간적 데이터)를 명시적으로 통합하는 새로운 트리 기반 모델인 RETCO(Regression Tree for Correlated Data)를 소개한다. 선형 혼합 모델과 가우시안 프로세스를 통해 상관관계를 고려하여 분할 기준, 정지 기준, 잎 예측을 수정함으로써, 시뮬레이션과 다양한 분야의 실제 데이터를 통한 검증을 통해 기존 방법보다 예측 정확도를 크게 향상시킨다.

ABSTRACT

This paper presents a new approach for trees-based regression, such as simple regression tree, random forest and gradient boosting, in settings involving correlated data. We show the problems that arise when implementing standard trees-based regression models, which ignore the correlation structure. Our new approach explicitly takes the correlation structure into account in the splitting criterion, stopping rules and fitted values in the leaves, which induces some major modifications of standard methodology. The superiority of our new approach over trees-based models that do not account for the correlation is supported by simulation experiments and real data analyses.

연구 동기 및 목표

  • 표준 트리 기반 모델이 관련 데이터를 다루는 데에 한계가 있어 편향된 예측과 정확하지 않은 오차 추정을 초래하는 문제를 해결하기 위해.
  • 랜덤 효과와 랜덤 필드를 트리 기반 모델에 통합하여 예측 성능를 향상시키고 통계적 추론을 가능하게 하는 통합 프레임워크를 개발하기 위해.
  • 의존성 구조가 존재하는 상황에서도 편향되지 않은 일반화 오차 추정을 보장하기 위해 관련 데이터에 맞게 모델 평가 및 선택 기법을 보정하기 위해.
  • 모의 및 실제 세계 설정에서 제안된 방법이 표준 트리 기반 모델과 기존 대안보다 뛰어나다는 것을 입증하기 위해.

제안 방법

  • 모델의 분할 기준, 정지 기준, 잎의 예측값을 수정하여 데이터 내 알려진 관련 구조를 명시적으로 고려하는 새로운 알고리즘인 RETCO를 제안한다.
  • 고정 효과와 랜덤 효과를 사용하여 조건부 평균을 모델링함으로써 선형 혼합 모델(LMM)과 가우시안 프로세스 회귀를 트리 기반 프레임워크에 통합한다.
  • 관련 데이터에서 일반화 오차를 편향 없이 추정하기 위해 교정된 교차검증 손실 함수(CV_c)를 도입하여 표준 CV를 모델 선택에 대체한다.
  • 특히 공간적 또는 시간적 설정에서 관측치 간의 의존성을 모델링하기 위해 커널 기반 공분산 함수(예: 지수형)를 적용한다.
  • 각 분할이 관련성에 맞게 조정된 손실 함수를 최소화하도록 하는 재귀적 분할 전략을 사용하여, 예측이 기초적인 의존성 구조를 반영하도록 보장한다.
  • 다중 트리에 걸쳐 관련성 인식 분할 및 예측 규칙를 적용함으로써 랜덤 포레스트 및 기울기 부스팅과 같은 앙상블 방법을 지원한다.

실험 결과

연구 질문

  • RQ1표준 트리 기반 모델이 관련 데이터에서 관련성을 忽시할 경우 예측 정확도와 오차 추정에 어떤 영향을 미치는가?
  • RQ2관련 구조를 명시적으로 통합하는 수정된 트리 기반 모델이 예측 오차 측면에서 표준 회귀 트리, 랜덤 포레스트, 기울기 부스팅보다 우월한가?
  • RQ3관련 데이터에 대해 모델 선택 및 오차 추정을 어떻게 보정할 수 있는가? 이는 교차검증에서 낙관적 편향을 방지하기 위함이다.
  • RQ4실제 관련 데이터 세트에 적용했을 때, RETCO는 RE-EM 및 표준 RF와 같은 기존 방법보다 얼마나 더 뛰어난 성능을 보이는가?

주요 결과

  • 모의 및 실제 세계의 모든 관련 데이터 시나리오에서 RETCO는 표준 트리 기반 모델보다 예측 오차를 크게 감소시켰다.
  • 랜덤 효과 분산(σ²_b)의 다양한 수준을 가진 시뮬레이션에서 RETCO는 일관되게 표준 모델을 능가했으며, 고관련성 설정에서는 오차 감소율이 최대 30%에 이르렀다.
  • 교정된 교차검증 손실(CV_c)은 편향 없는 일반화 오차 추정을 제공했고, 표준 CV는 관련 데이터에서 오차를 과소평가하여 과적합을 유도했다.
  • 실제 데이터 분석에서 RETCO는 FIFA 선수 가치, 미국 범죄율, 한국 기상 예측, 캘리포니아 주택 가격, 파킨슨병 원격 모니터링, 임금 데이터 등 다섯 가지 다양한 데이터 세트에서 표준 RF보다 낮은 예측 오차를 기록했다.
  • 모든 경우(예: b*⊥b 및 b*=b)에서 RE-EM 방법보다 RETCO가 성능이 뛰어났으며, 특히 관련 구조가 강할수록 더 큰 성능 향상을 보였다.
  • 군집화(FIFA, 범죄), 공간적(한국 기상), 종단적(파킨슨병, 임금) 등 다양한 데이터 유형에서 안정적인 성능 유지를 보이며 광범위한 적용 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.