[논문 리뷰] Evaluation of Tree Based Regression over Multiple Linear Regression for Non-normally Distributed Data in Battery Performance
이 연구는 비정규 분포이자 다중공선성이 있는 데이터에서 배터리 사이클 수명을 예측하기 위해 트리 기반 회귀(랜덤 포레스트)와 다중선형회귀(MLR)를 평가한다. 데이터 변환과 단계적 회귀를 적용했음에도 불구하고 MLR는 R²가 81.23%에 그쳤지만, 랜덤 포레스트는 변환 없이도 R²가 97.73%에 도달하여 비정규성과 고차원성, 비대칭성을 띤 배터리 데이터셋에서 비모수적 성질과 다중공선성 및 비정규성에 대한 강건성 덕분에 뛰어난 성능을 보였다.
Battery performance datasets are typically non-normal and multicollinear. Extrapolating such datasets for model predictions needs attention to such characteristics. This study explores the impact of data normality in building machine learning models. In this work, tree-based regression models and multiple linear regressions models are each built from a highly skewed non-normal dataset with multicollinearity and compared. Several techniques are necessary, such as data transformation, to achieve a good multiple linear regression model with this dataset; the most useful techniques are discussed. With these techniques, the best multiple linear regression model achieved an R^2 = 81.23% and exhibited no multicollinearity effect for the dataset used in this study. Tree-based models perform better on this dataset, as they are non-parametric, capable of handling complex relationships among variables and not affected by multicollinearity. We show that bagging, in the use of Random Forests, reduces overfitting. Our best tree-based model achieved accuracy of R^2 = 97.73%. This study explains why tree-based regressions promise as a machine learning model for non-normally distributed, multicollinear data.
연구 동기 및 목표
- 비정규 분포이자 다중공선성이 있는 배터리 성능 데이터에 대해 트리 기반 회귀와 다중선형회귀의 성능을 평가하기 위해.
- 데이터 변환 및 변수 선택 기법이 MLR 모델의 정확성과 타당성에 미치는 영향을 평가하기 위해.
- 기본 회귀 가정을 위반하는 데이터셋에서 비모수적 모델인 랜덤 포레스트가 모수적 모델을 능가할 수 있는지 확인하기 위해.
- 모델 해석 기법을 활용하여 배터리 사이클 수명 예측에 가장 기여하는 특징을 규명하기 위해.
- 실제 데이터 제약 조건 하에서의 배터리 열화 예측 모델 선택에 대한 지침을 제공하기 위해.
제안 방법
- 비정규성 문제를 해결하기 위해 Box-Cox 변환을 적용한 모델을 포함한 두 개의 다중선형회귀 모델을 구축하였다.
- MLR 모델의 다중공선성 문제를 완화하기 위해 단계적 회귀를 적용하였다.
- 트리 기반 모델의 비모수적 성질을 활용하여 데이터 변환 없이 단일 결정트리 및 랜덤 포레스트 회귀(RFR) 모델을 개발하였다.
- 모델 일반화 능력을 평가하고 테스트 정확도 및 상관계수를 산출하기 위해 10겹 교차검증을 수행하였다.
- MLR 모델의 잔차 분석을 통해 가정 검증을 수행한 반면, RFR 모델은 이러한 가정이 필요하지 않았다.
- RFR 모델을 활용해 특징 중요도 분석을 수행하여 예측에 기여하는 변수들의 기여도 기반 순위를 산정하였다.

실험 결과
연구 질문
- RQ1비정규성과 다중공선성이 있는 배터리 성능 데이터에서 데이터 변환이 다중선형회귀의 성능을 유의미하게 향상시키는가?
- RQ2비대칭적인 배터리 데이터셋에서 랜덤 포레스트와 같은 트리 기반 모델이 변환 및 단계적 MLR 모델보다 R² 정확도와 과적합 정도에서 어떻게 비교되는가?
- RQ3트리 기반 모델이 모수적 모델에 비해 다중공선성 및 비정규성 문제를 어느 정도 완화하는가?
- RQ4어떤 입력 특징이 배터리 사이클 수명 예측에 가장 예측력이 있는가? 그리고 MLR와 RFR 모델 간 특징 중요도의 차이는 무엇인가?
- RQ5트리 기반 모델은 데이터 변환 없이도 가정 검증 없이 배터리 종료 수명을 신뢰성 있게 예측할 수 있는가?
주요 결과
- Box-Cox 변환과 단계적 회귀를 거친 최적의 다중선형회귀 모델은 R²가 81.23%에 도달했으며, 다중공선성은 제거되었지만 여전히 과적합과 예측 이상치가 존재했다.
- 랜덤 포레스트 회귀 모델은 97.73%의 최고 테스트 정확도를 기록했으며, 과적합도 없고 예측 이상지도 없었으며, 다른 모든 모델을 능가했다.
- 결정트리 모델은 훈련 정확도 99.73%와 테스트 정확도 97.54%를 기록했지만 명백한 과적합이 나타났으며, 이는 앙상블화를 통해 랜덤 포레스트로 개선되었다.
- 특징 중요도 분석 결과, RFR 모델에서 $d_{i}^{0.97}$이 가장 영향력 있는 예측변수로 79%의 중요도를 기록했고, 다음으로 $d_{i}^{0.98}$이 16%, $d_{i}^{0.99}$이 5%의 중요도를 보였다.
- 예측값과 실측값 간 상관계수는 트리 기반 모델 모두에서 0.99였으며, MLR 모델에서 관찰된 0.88~0.91에 비해 유의미하게 높았다.
- 트리 기반 모델, 특히 랜덤 포레스트는 데이터의 비대칭성과 다중공선성에 강건하며, 데이터 변환 또는 가정 검증 없이도 성능을 유지를 할 수 있었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.