[논문 리뷰] Time Series Predictions in Unmonitored Sites: A Survey of Machine Learning Techniques in Water Resources
이 종합 검토는 관측되지 않은 유역에서 수문학적 및 수질 시계열 예측을 위한 기계학습 기법을 다루며, 딥러닝, 전이학습, 지식 기반 모델에 중점을 둔다. 데이터 부족, 모델 해석 가능성, 이식성 등의 주요 과제를 밝히며, 예측 정확도와 신뢰성을 향상시키기 위해 설명 가능한 AI와 수문학적 과정 지식의 통합이 데이터가 부족한 지역에서 필수적임을 강조한다.
Prediction of dynamic environmental variables in unmonitored sites remains a long-standing challenge for water resources science. The majority of the world's freshwater resources have inadequate monitoring of critical environmental variables needed for management. Yet, the need to have widespread predictions of hydrological variables such as river flow and water quality has become increasingly urgent due to climate and land use change over the past decades, and their associated impacts on water resources. Modern machine learning methods increasingly outperform their process-based and empirical model counterparts for hydrologic time series prediction with their ability to extract information from large, diverse data sets. We review relevant state-of-the art applications of machine learning for streamflow, water quality, and other water resources prediction and discuss opportunities to improve the use of machine learning with emerging methods for incorporating watershed characteristics into deep learning models, transfer learning, and incorporating process knowledge into machine learning models. The analysis here suggests most prior efforts have been focused on deep learning learning frameworks built on many sites for predictions at daily time scales in the United States, but that comparisons between different classes of machine learning methods are few and inadequate. We identify several open questions for time series predictions in unmonitored sites that include incorporating dynamic inputs and site characteristics, mechanistic understanding and spatial context, and explainable AI techniques in modern machine learning frameworks.
연구 동기 및 목표
- 희소한 관측 데이터로 인해 관측되지 않은 유역에서 수문학적 변수를 예측하는 데 발생하는 핵심 격차를 해결하기 위해.
- 유역 유량, 수질 및 환경 변수 예측을 위한 최신 기계학습 방법을 종합하기 위해.
- 다양한 기계학습 접근법의 장점과 한계를 평가하고, 특히 과정 기반 모델과의 비교를 통해 분석하기 위해.
- 데이터 효율성, 모델 해석 가능성, 수문학적 과정 지식 통합 분야의 열린 연구 질문을 규명하기 위해.
- 미래 연구를 안내하기 위해 수자원 기계학습 분야의 최선의 실천 방식과 다학제적 협업의 필요성을 제시하기 위해.
제안 방법
- 2010년에서 2022년 사이에 관측되지 않은 유역(UGBs)에서 기계학습 응용에 관한 230篇 이상의 논문을 대상으로 체계적 검토를 수행하였다.
- 기계학습 기법을 딥러닝(LSTM, GNNs, TCNs), 전이학습, 지식 기반 모델(예: 미분 가능 과정 기반 모델)으로 분류하였다.
- 시간 척도(주로 일일 예측), 지리적 초점(주로 미국), 데이터 유형(유역 유량, 수질, 호수 수온)에 따라 모델 성능를 분석하였다.
- SHAP, 통합 기울기, 계층별 기여도 전파와 같은 해석 방법을 활용해 모델 결정의 해석 가능성을 평가하였다.
- 유역 특성과 동적 입력(예: 기상 데이터)을 딥러닝 프레임워크에 통합하여 일반화 능력을 향상시켰다.
- 정확도, 해석 가능성, 데이터 요구량 측면에서 전통적 기계학습(예: 랜덤 포레스트, XGBoost)과 딥러닝 모델을 비교하였다.

실험 결과
연구 질문
- RQ1LSTM, XGBoost, GNNs 등의 다양한 기계학습 모델은 관측되지 않은 유역에서 유역 유량과 수질 예측에 어떻게 비교되는가?
- RQ2제한된 학습 데이터를 가진 관측되지 않은 유역에서 전이학습이 모델 일반화 능력을 얼마나 향상시킬 수 있는가?
- RQ3과정 기반 수문학적 지식은 딥러닝 모델에 어떻게 통합되어 해석 가능성과 물리적 일관성을 향상시킬 수 있는가?
- RQ4UGBs에서 기계학습의 해석 가능성(XAI)에 있어 주요 과제는 무엇이며, SHAP 및 통합 기울기와 같은 방법은 신뢰도와 사용성을 어떻게 향상시킬 수 있는가?
- RQ5강수량, 기온 등의 동적 입력과 공간적 맥락은 어떻게 효과적으로 기계학습 모델에 통합되어 더 나은 시공간 예측을 가능하게 할 수 있는가?
주요 결과
- 대부분의 연구는 미국에서 일일 예측에 집중되어 있으며, 훈련 데이터의 지리적 및 시간적 다양성이 제한되어 있다.
- 충분한 데이터가 확보된 경우, 딥러닝 모델(특히 LSTM 및 GNNs)이 전통적인 경험적 및 과정 기반 모델보다 예측 정확도에서 뛰어나다.
- 전이학습은 모니터링된 지역에서 사전 훈련된 모델을 활용하여 관측되지 않은 유역에서의 성능 향상에 잠재력을 보이고 있다.
- 작은 데이터셋에서도 해석 가능성과 강건성이 뛰어나기 때문에, XGBoost 및 랜덤 포레스트와 같은 전통적 기계학습 모델이 널리 사용되고 있다.
- 설명 가능한 AI(XAI) 기법인 SHAP 및 통합 기울기 방법은 LSTM 및 GNNs와 같은 모델의 시간적·공간적 주의 패턴을 드러내어 모델의 투명성을 높일 수 있다.
- 다른 한편으로는, 기계학습 모델 유형 간의 체계적 비교가 흔치 않으며, 특히 수질 및 장기 예측에 대한 표준화된 벤치마크가 부족한 상황이다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.