Skip to main content
QUICK REVIEW

[논문 리뷰] Synthetic Photovoltaic and Wind Power Forecasting Data

Stephan Vogt, Jens Schreiber|arXiv (Cornell University)|2022. 04. 01.
Energy Load and Power Forecasting인용 수 4
한 줄 요약

이 논문은 독일 내 120개의 태양광 발전소와 273개의 풍력 발전소에 대해 실제 기상 측정치와 물리 모델을 사용하여 생성한 대규모 공개 합성 데이터셋을 소개한다. 이 데이터셋은 재생 가능 에너지 예측 분야에서 현실적인 기계학습 연구를 가능하게 하며, 결과적으로 합성 데이터에서의 모델 오차가 실제 역사적 데이터와 유사함을 보여주어 향후 연구를 위한 신뢰할 수 있는 기준을 확립한다.

ABSTRACT

Photovoltaic and wind power forecasts in power systems with a high share of renewable energy are essential in several applications. These include stable grid operation, profitable power trading, and forward-looking system planning. However, there is a lack of publicly available datasets for research on machine learning based prediction methods. This paper provides an openly accessible time series dataset with realistic synthetic power data. Other publicly and non-publicly available datasets often lack precise geographic coordinates, timestamps, or static power plant information, e.g., to protect business secrets. On the opposite, this dataset provides these. The dataset comprises 120 photovoltaic and 273 wind power plants with distinct sides all over Germany from 500 days in hourly resolution. This large number of available sides allows forecasting experiments to include spatial correlations and run experiments in transfer and multi-task learning. It includes side-specific, power source-dependent, non-synthetic input features from the ICON-EU weather model. A simulation of virtual power plants with physical models and actual meteorological measurements provides realistic synthetic power measurement time series. These time series correspond to the power output of virtual power plants at the location of the respective weather measurements. Since the synthetic time series are based exclusively on weather measurements, possible errors in the weather forecast are comparable to those in actual power data. In addition to the data description, we evaluate the quality of weather-prediction-based power forecasts by comparing simplified physical models and a machine learning model. This experiment shows that forecasts errors on the synthetic power data are comparable to real-world historical power measurements.

연구 동기 및 목표

  • 기계학습 기반 재생 가능 에너지 예측을 위한 공개 가능하고 종합적인 데이터셋의 부족을 해결하기 위해.
  • 정확한 지리 좌표, 타임스탬프 및 물리적 발전소 특성과 함께 대규모이고 현실적인 합성 데이터셋을 제공하기 위해.
  • 각 발전소에 대한 상세한 정적 메타데이터를 포함시켜 전이 학습, 다중 작업 학습 및 제로샷 학습과 같은 고급 기계학습 연구를 지원하기 위해.
  • 물리 모델과 기울기 부스팅 회귀 트리(GCRT) 모델을 합성 데이터에서 비교함으로써 예측 오차 기준을 설정하기 위해.
  • 실제 수치 기상 예측(NWP) 입력에 기반하여 합성 데이터가 실제 예측 오차를 반영하도록 보장하기 위해.

제안 방법

  • 합성 전력 시계열은 Icosahedral Nonhydrostatic(ICON) 모델의 실제 역사적 기상 측정치를 기반으로 하는 물리 모델을 사용하여 생성된다.
  • 이 데이터셋은 4개 계절을 모두 포함하는 500일 간의 시간당 해상도 데이터(2018년 12월 8일 ~ 2020년 6월 2일)를 포함하며, 강력한 모델 훈련 및 테스트를 가능하게 한다.
  • 각 발전소는 태양광 모듈의 기울기 및 방향, 풍력 터빈의 로터-발전기 비율과 같은 고유한 물리적 및 기하학적 파라미터를 부여받아 현실성과 전이 학습 가능성을 확보한다.
  • 비합성 입력 특성(예: 바람 속도, 수평 전체 일조량, 온도)은 ICON-NWP 모델에서 유도되며, 합성 전력 출력과 짝을 이룬다.
  • 기울기 부스팅 회귀 트리(GCRT) 모델을 훈련하고, 예를 들어 Enercon 및 McLean 전력 곡선과 같은 물리 기반 기준 모델과 비교하여 예측 정확도를 평가한다.
  • 예를 들어 7일에서 365일까지의 훈련 세트를 단축시켜 실험할 수 있도록 함으로써 데이터가 부족한 조건에서도 평가를 지원한다.

실험 결과

연구 질문

  • RQ1기계학습 모델이 합성 데이터에서 기록한 예측 오차는 실제 역사적 데이터에서 관측된 오차와 어떻게 비교되는가?
  • RQ2합성 데이터는 전이 학습 및 다중 작업 학습과 같은 분야에서 신뢰할 수 있는 기준을 제공할 수 있는가?
  • RQ3다양한 양의 훈련 데이터에서 물리 모델과 기계학습 모델(GCRT 등) 간의 성능 격차는 어느 정도인가?
  • RQ4터빈 특성 파라미터가 알려지지 않은 경우, 다양한 경험적 전력 곡선(McLean, Enercon 등)의 정확도는 어떻게 비교되는가?
  • RQ5세부적인 발전소별 메타데이터(예: 방향, 로터 지름, 허브 높이)를 포함시킴으로써 모델 일반화 및 전이 학습 성능 향상 정도는 어느 정도인가?

주요 결과

  • 합성 데이터셋에서 GBRT 및 물리 기반 기준 모델의 예측 오차는 실제 역사적 전력 측정치에서 관측된 오차와 유사하다.
  • 태양광 예측의 경우, 충분한 훈련 데이터(예: 365일)가 확보된 상태에서 GBRT 모델이 물리 기준 모델을 능가하며, 평균 nRMSE가 0.072로 물리 모델의 0.085보다 낮다.
  • 풍력 예측의 경우, GBRT 모델이 Enercon 물리 기준 모델을 일관되게 능가하며, 전체 훈련 데이터를 사용할 경우 평균 nRMSE를 0.210(기준)에서 0.125로 감소시킨다.
  • 제한된 훈련 데이터(예: 7일) 조건에서는 물리 모델이 태양광 분야에서 더 강건한 반면, GBRT 모델은 최소 14일의 데이터가 있더라도 풍력 예측에서 뛰어난 성능을 보인다.
  • 터빈 전용 파라미터가 없는 경우, McLean 경험적 전력 곡선은 Enercon 기준 모델과 유사한 nRMSE(0.212~0.239)를 기록하며 실용적인 대안이 될 수 있다.
  • 세부적인 발전소별 메타데이터(예: 방향, 로터 지름, 허브 높이)를 포함시킴으로써 이 합성 데이터셋은 전이 학습 및 제로샷 학습의 신뢰할 수 있는 평가를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.