Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Subseasonal Forecasting in the Western U.S. with Machine Learning

Jessica Hwang, Paulo Orenstein|arXiv (Cornell University)|2018. 09. 19.
Meteorological Phenomena and Simulations참고 문헌 38인용 수 11
한 줄 요약

이 논문은 미국 서부 지역의 초기기상예보를 위한 기계학습 앙상블 시스템을 제안하며, 다중작업 특성 선택과 k-가 близ한 이웃 방법을 결합하여 예보 정확도를 향상시킨다. 이 방법은 운영 중인 CFSv2 모델과 Rodeo 대회 최고 성과자들을 크게 능가하며, 2011–2018년 기간 동안 기온 예보에 대해 40–50% 높은 정확도를, 강수량 예보에 대해 129–169% 높은 정확도를 달성한다.

ABSTRACT

Water managers in the western United States (U.S.) rely on longterm forecasts of temperature and precipitation to prepare for droughts and other wet weather extremes. To improve the accuracy of these longterm forecasts, the U.S. Bureau of Reclamation and the National Oceanic and Atmospheric Administration (NOAA) launched the Subseasonal Climate Forecast Rodeo, a year-long real-time forecasting challenge in which participants aimed to skillfully predict temperature and precipitation in the western U.S. two to four weeks and four to six weeks in advance. Here we present and evaluate our machine learning approach to the Rodeo and release our SubseasonalRodeo dataset, collected to train and evaluate our forecasting system. Our system is an ensemble of two regression models. The first integrates the diverse collection of meteorological measurements and dynamic model forecasts in the SubseasonalRodeo dataset and prunes irrelevant predictors using a customized multitask model selection procedure. The second uses only historical measurements of the target variable (temperature or precipitation) and introduces multitask nearest neighbor features into a weighted local linear regression. Each model alone is significantly more accurate than the debiased operational U.S. Climate Forecasting System (CFSv2), and our ensemble skill exceeds that of the top Rodeo competitor for each target variable and forecast horizon. Moreover, over 2011-2018, an ensemble of our regression models and debiased CFSv2 improves debiased CFSv2 skill by 40-50% for temperature and 129-169% for precipitation. We hope that both our dataset and our methods will help to advance the state of the art in subseasonal forecasting.

연구 동기 및 목표

  • 미국 서부 지역의 정확한 초기기상예보가 수자원 및 산불 관리에 필수적임을 해결하기 위해.
  • 기온과 강수량에 대해 2~6주 전망을 내기 위해 운영 중인 미국 기후예보시스템(CFSv2)을 초월한 예보 정확도 향상을 위해.
  • 고차원 기상자료와 정확도 기반 목표 함수를 고려한, 초기기상예보의 고유한 과제에 맞춰진 기계학습 프레임워크를 개발하기 위해.
  • 향후 초기기상예보 연구를 지원하기 위해 새로운 벤치마크 데이터셋(SubseasonalRodeo)을 공개하기 위해.
  • CFSv2와 기계학습 모델을 앙상블함으로써, 다양한 예측 수준과 변수에서 예보 정확도를 크게 향상시킬 수 있음을 입증하기 위해.

제안 방법

  • 시스템은 두 개의 비선형 회귀 모델인 MultiLLR와 AutoKNN의 앙상블을 사용한다.
  • MultiLLR는 다양한 기상 및 모델 예보 데이터 소스에서 관련 예측 변수를 식별하기 위해 다중작업 후행 단계 특성 선택을 수행한다.
  • AutoKNN는 기존의 목표 변수 측정치(기온 또는 강수량)만 사용하며, 정확도 기반 k-가까운 이웃 특성을 가중 지역 선형 회귀에 통합한다.
  • 평균 정확도가 양수일 경우 평균 예보 정확도를 증가시킬 수 있는 새로운 앙상블 절차를 도입한다.
  • 표준 회귀 손실이 아닌 예보 정확도 최적화를 위해 특수 설계된 다중작업 목표 함수를 활용한다.
  • NMME 및 CFSv2를 포함한 다양한 출처에서 수집한 SubseasonalRodeo 데이터셋을 사용해 모델을 학습하고 평가한다.

실험 결과

연구 질문

  • RQ1기계학습 모델이 운영 중인 CFSv2 시스템을 초월해 미국 서부 지역의 초기기상예보 정확도를 향상시킬 수 있는가?
  • RQ2고차원 기상자료에서 초기기상예보를 위해 관련 예측 변수를 식별하는 데 다중작업 특성 선택 접근법이 얼마나 효과적인가?
  • RQ3외부 예측 변수 없이 목표 변수 이력 자료만 사용하는 모델이 최근접이웃 방법을 통해 높은 예보 정확도를 달성할 수 있는가?
  • RQ4CFSv2와 다수의 기계학습 모델을 앙상블하면 다양한 예측 수준에서 통계적으로 유의미한 예보 정확도 향상이 이루어지는가?
  • RQ5AutoKNN에서 학습된 최근접이웃이 역사적 기상자료의 계절적 및 시간적 패턴을 얼마나 잘 반영하는가?

주요 결과

  • MultiLLR 모델만으로도 기온과 강수량 예보에서 주 3–4주차 및 주 5–6주차에 대해 탈편향 처리된 CFSv2 모델을 능가한다.
  • 목표 변수 이력 자료만 사용하는 AutoKNN 모델 역시 기온과 강수량 예보에서 주 3–4주차 및 주 5–6주차에 대해 탈편향 처리된 CFSv2를 능가한다.
  • MultiLLR와 AutoKNN의 앙상블은 모든 네 가지 예측 과제에서 최고의 Rodeo 경쟁자 성능을 초월한다.
  • 2011–2018년 기간 동안, 제안된 모델과 탈편향 처리된 CFSv2의 앙상블은 기온 예보에 대해 40–50% 높은 정확도를, 강수량 예보에 대해 129–169% 높은 정확도를 달성한다.
  • 강수량 예보에서는 모델이 더 단순해졌으며, 중앙값 특성 수가 4–5개로 기온 예보의 7개보다 적었다.
  • AutoKNN 모델의 강수량 예보에서의 최근접이웃은 강하게 계절적 특성을 띠며, 상위 이웃들은 일반적으로 같은 해의 같은 달에서 유래한 반면, 기온 예보의 이웃들은 연중 전반에 걸쳐 분포되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.