[논문 리뷰] A comparative study of statistical and machine learning models on near-real-time daily emissions prediction
이 연구는 2020년에서 2022년 사이에 중국에서 근접 실시간 일일 이산화탄소 배출량 예측을 위한 여섯 가지 모델—세 가지 통계 모델(ARIMA, SARIMAX, GM(1,1))과 세 가지 기계학습 모델(LSTM, RF, ANN)—을 평가한다. LSTM 모델이 모든 평가 지표에서 가장 낮은 오차를 기록하며 가장 뛰어난 성능을 보였으며, 평균 제곱오차(MSE) 3.5179e-04와 결정계수(R²) 0.9844를 기록하여 단기 배출량 예측에 뛰어난 성능을 보였다.
The rapid ascent in carbon dioxide emissions is a major cause of global warming and climate change, which pose a huge threat to human survival and impose far-reaching influence on the global ecosystem. Therefore, it is very necessary to effectively control carbon dioxide emissions by accurately predicting and analyzing the change trend timely, so as to provide a reference for carbon dioxide emissions mitigation measures. This paper is aiming to select a suitable model to predict the near-real-time daily emissions based on univariate daily time-series data from January 1st, 2020 to September 30st, 2022 of all sectors (Power, Industry, Ground Transport, Residential, Domestic Aviation, International Aviation) in China. We proposed six prediction models, which including three statistical models: Grey prediction (GM(1,1)), autoregressive integrated moving average (ARIMA) and seasonal autoregressive integrated moving average with exogenous factors (SARIMAX); three machine learning models: artificial neural network (ANN), random forest (RF) and long short term memory (LSTM). To evaluate the performance of these models, five criteria: Mean Squared Error (MSE), Root Mean Squared Error (RMSE), Mean Absolute Error (MAE), Mean Absolute Percentage Error (MAPE) and Coefficient of Determination () are imported and discussed in detail. In the results, three machine learning models perform better than that three statistical models, in which LSTM model performs the best on five criteria values for daily emissions prediction with the 3.5179e-04 MSE value, 0.0187 RMSE value, 0.0140 MAE value, 14.8291% MAPE value and 0.9844 value.
연구 동기 및 목표
- 중국에서 근접 실시간 일일 이산화탄소 배출량을 예측하는 데 가장 정확한 모델을 특정하는 것.
- 일변량 시계열 배출량 데이터에서 통계 모델(ARIMA, SARIMAX, GM(1,1))과 기계학습 모델(LSTM, RF, ANN)의 성능을 비교하는 것.
- MSE, RMSE, MAE, MAPE, R² 등의 표준 평가 지표를 다수 사용하여 모델 정확도를 평가하는 것.
- 시행 가능한 기후 정책 수립을 지원하기 위해, 시기적절하고 신뢰할 수 있는 배출 추세 예측을 가능하게 하는 것.
제안 방법
- 연구는 2020년 1월 1일부터 2022년 9월 30일까지의 일변량 일일 시계열 데이터를 사용하며, 전력, 산업, 지상 운송, 주거, 국내 항공, 국제 항공의 여섯 부문을 포함한다.
- 여섯 가지 모델이 훈련되고 평가되며, 세 가지 통계 모델(GM(1,1), ARIMA, SARIMAX)과 세 가지 기계학습 모델(ANN, RF, LSTM)이 포함된다.
- 모델 성능은 평균 제곱오차(MSE), 근본 평균 제곱오차(RMSE), 평균 절대오차(MAE), 평균 절대 백분율 오차(MAPE), 결정계수(R²)의 다섯 가지 평가 지표를 사용하여 평가된다.
- 모델들은 역사적 데이터를 기반으로 훈련되고, 일반화를 확보하기 위해 검증용 검출 데이터셋을 사용하여 테스트된다.
- 기계학습 모델(LSTM, RF, ANN)의 하이퍼파ram터는 교차검증을 통해 최적화되어 예측 성능을 향상시킨다.
- 연구는 일변량 예측에 집중하며, 각 모델은 외부 공변량 없이 역사적 배출 시계열 데이터만을 사용한다. 다만 SARIMAX는 외생 변수를 통합한다.
실험 결과
연구 질문
- RQ1통계 모델과 기계학습 모델 중에서 중국의 근접 실시간 일일 배출량 예측에서 가장 정확한 것은 무엇인가?
- RQ2통계 모델과 기계학습 모델 간의 성능 지표(MSE, RMSE, MAE, MAPE, R²)가 일일 배출량 예측에서 어떻게 비교되는가?
- RQ3LSTM 모델이 일일 배출량 데이터의 시간적 패턴을 포착하는 데 다른 모델보다 뚜렷하게 뛰어나다고 할 수 있는가?
- RQ4각 모델의 상대적 안정성과 강건성은 다양한 배출 부문의 추세 변화에 대해 어떻게 나타나는가?
주요 결과
- LSTM 모델은 모든 다섯 가지 평가 지표에서 최고의 성능을 기록하였으며, 평균 제곱오차(MSE)는 3.5179e-04를 기록하였다.
- LSTM 모델은 근본 평균 제곱오차(RMSE) 0.0187을 기록하여 일일 배출량 예측의 높은 정밀도를 보였다.
- LSTM 모델은 평균 절대오차(MAE) 0.0140을 기록하여 예측의 평균 편차가 낮음을 반영하였다.
- LSTM 모델은 평균 절대 백분율 오차(MAPE) 14.8291%를 기록하여 백분율 기준으로 중간 정도의 상대 오차를 보였다.
- LSTM 모델은 결정계수(R²) 0.9844를 기록하여 배출량의 변동성의 98.44%가 모델에 의해 설명됨을 나타내었다.
- 통계 모델 중에서는 SARIMAX가 가장 우수한 성능을 보였지만, 여전히 모든 기계학습 모델보다 모든 지표에서 열등한 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.