Skip to main content
QUICK REVIEW

[논문 리뷰] RRMSE Voting Regressor: A weighting function based improvement to ensemble regression

Shikun Chen, Nguyen Manh Luc|arXiv (Cornell University)|2022. 07. 11.
Face and Expression Recognition인용 수 16
한 줄 요약

이 논문은 상대적 제곱근 평균 제곱 오차(RRMSE)를 기반으로 기본 학습기의 가중치를 부여함으로써 예측 정확도를 향상시키는 새로운 앙상블 회귀 방법인 RRMSE 투표 회귀기(RRMSE Voting Regressor)를 제안한다. 실험 결과, Bagging 회귀(BR) 및 동적 가중 회귀(DWR)와 같은 기준 앙상블 방법보다 유의미하게 뛰어난 성능을 보이며, 최신 기술인 불확실성과 함께 투표 회귀(VRU) 방법과 비교해도 열등하지 않은 성능을 기록한다. 여섯 개의 벤치마크 데이터셋에서 검증되었다.

ABSTRACT

This paper describes the RRMSE (Relative Root Mean Square Error) based weights to weight the occurrences of predictive values before averaging for the ensemble voting regression. The core idea behind ensemble regression is to combine several base regression models in order to improve the prediction performance in learning problems with a numeric continuous target variable. The default weights setting for the ensemble voting regression is uniform weights, and without domain knowledge of learning task, assigning weights for predictions are impossible, which makes it very difficult to improve the predictions. This work attempts to improve the prediction of voting regression by implementing the RRMSE based weighting function. Experiments show that RRMSE voting regressor produces significantly better predictions than other state-of-the-art ensemble regression algorithms on six popular regression learning datasets.

연구 동기 및 목표

  • 기본 모델에 의미 있는 가중치를 할당할 수 있는 사전 지식이 없는 경우, 앙상블 투표 회귀에서 균일한 가중치 할당의 한계를 해결하기 위해.
  • 예측 오차가 낮은 모델을 우선시하는 데이터 기반 오차 기반 가중치 함수를 도입함으로써 앙상블 회귀 성능을 향상시키기 위해.
  • RRMSE 기반 가중치 할당이 기존의 앙상블 회귀 기법보다 통계적으로 유의미한 향상을 이끌어내는지 평가하기 위해.
  • 이질적 앙상블 학습에서 모델 선택 및 가중치 할당에 있어 RRMSE가 신뢰할 수 있는 지표가 될 잠재력을 탐색하기 위해.

제안 방법

  • 기본 학습기의 개별적 가중치를 계산하기 위해 상대적 제곱근 평균 제곱 오차(RRMSE)를 사용하는 새로운 앙상블 회귀 프레임워크를 제안한다.
  • RRMSE 값이 낮은 기본 모델일수록 더 높은 가중치를 할당하며, 역비례 함수를 사용한다: $ w_i = \frac{1}{\text{RRMSE}_i} $, 모든 모델에 대해 정규화된다.
  • 가중 평균 공식을 적용한다: $ \hat{f}_{\text{RRMSE}}(x) = \sum_{i=1}^{k} w_i(x) \cdot \hat{f}_i(x) $, 여기서 가중치는 검증 데이터에서의 RRMSE 값에서 유도된다.
  • 다양한 기본 학습기(예: 랜덤 포레스트, 기울기 부스팅, SVM)를 전체 데이터셋에 대해 훈련시킨 이질적 앙상블 설정을 사용한다.
  • 성능 비교를 위해 통계적 유의성 검정(Friedman 정렬 순위 검정 및 사후 분석)을 사용한다.
  • 표준 메트릭(MAE, MSE, RMSE, 및 $ R^2 $)을 사용하여 여섯 개의 표준 회귀 데이터셋에서 방법을 검증한다.

실험 결과

연구 질문

  • RQ1RRMSE 기반 가중치 할당은 균일하거나 일정한 가중치 할당 방식보다 앙상블 회귀 성능을 향상시킬 수 있는가?
  • RQ2RRMSE 투표 회귀기는 Bagging 회귀(BR), 동적 가중 회귀(DWR), 그리고 불확실성과 함께 투표 회귀(VRU)와 같은 최신 기술 앙상블 방법과 비교해 어떻게 성능을 내는가?
  • RQ3RRMSE 투표 회귀기의 성능 향상은 여러 벤치마크 데이터셋에서 통계적으로 유의미한가?
  • RQ4RRMSE 기반 가중치 할당 함수는 전통적인 앙상블 통합 전략보다 더 견고하고 정확한 예측을 이끌어낼 수 있는가?

주요 결과

  • RRMSE 투표 회귀기는 여섯 개의 모든 데이터셋에서 평균 순위가 가장 높았으며, MAE, MSE, RMSE, $ R^2 $ 모든 메트릭에서 BR 및 DWR를 모두 앞섰다.
  • 통계적 검정 결과, RRMSE 투표 회귀기는 MAE, MSE, RMSE, $ R^2 $에서 BR 및 DWR를 유의미하게 뛰어넘었으며, 모든 메트릭에서 p값 < 0.01이었다.
  • Abalone 데이터셋에서 RRMSE 투표 회귀기는 가장 낮은 MAE(1.5102), MSE(4.7140), RMSE(2.1712), 가장 높은 $ R^2 $(0.5645)를 기록하여 1위를 차지했다.
  • 스마트 그리드 안정성 데이터셋에서 RRMSE 투표 회귀기는 가장 낮은 MAE(0.0075)와 MSE(0.000095)를 기록했으며, $ R^2 $는 0.9287이었고, DWR(0.0174)보다 유의미하게 뛰어났다.
  • VRU보다는 약간의 개선이 있었지만 일관된 성능을 보였으며, 평균 순위는 1.0으로 VRU의 2.25보다 높았고, 어떤 메트릭에서도 유의미하게 열등하지 않았다.
  • 사후 분석 테스트 결과, RRMSE 투표 회귀기는 MAE, MSE, RMSE에서 여섯 번의 비교 중 여섯 번 모두에서 승리했으며, $ R^2 $에서는 여섯 번 중 다섯 번에서 승리하여 강력하고 일관된 우월성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.