[논문 리뷰] Towards Optimal District Heating Temperature Control in China with Deep Reinforcement Learning
이 논문은 중국의 2차 열공급망에서 도시 난방 공급수 온도를 최적화하기 위해 딥 강화학습(DRL) 기반 접근법을 제안한다. 순환신경망(RNN)을 사용해 실내 온도를 예측하고 DRL 에이전트를 훈련시킨다. 에이전트는 최적화된 기준 전략 대비 시즌당 2.19%의 에너지 절감과 495톤의 CO₂ 감소를 달성하면서 열적 쾌적함을 향상시킨다.
Achieving efficiency gains in Chinese district heating networks, thereby reducing their carbon footprint, requires new optimal control methods going beyond current industry tools. Focusing on the secondary network, we propose a data-driven deep reinforcement learning (DRL) approach to address this task. We build a recurrent neural network, trained on simulated data, to predict the indoor temperatures. This model is then used to train two DRL agents, with or without expert guidance, for the optimal control of the supply water temperature. Our tests in a multi-apartment setting show that both agents can ensure a higher thermal comfort and at the same time a smaller energy cost, compared to an optimized baseline strategy.
연구 동기 및 목표
- 기존 제어 전략으로 인해 탄소 배출의 주요 원인이 되는 중국의 도시 난방망로의 에너지 비효율성 문제를 해결하기 위해.
- 실내 쾌적함을 향상시키고 에너지 소비를 줄이기 위해 데이터 기반 최적 제어 방법을 개발하기 위해.
- 딥 강화학습이 실제와 유사한 시뮬레이션 환경에서 기존의 수온 곡선 기반 제어 전략을 능가할 수 있는지 평가하기 위해.
- 전문가 가이드 레이션 액션 스페이스가 DRL 에이전트 성능과 실생활 구현 가능성에 미치는 영향을 평가하기 위해.
- 에너지 비용 가중치를 명시적으로 포함하지 않은 경우에도 열적 쾌적도 이격도 기반 보상 함수가 에너지 절감을 이끌 수 있는지 입증하기 위해.
제안 방법
- 실제 시뮬레이션 데이터를 기반으로 순환신경망(RNN)을 훈련시어 공급수 온도, 외기 온도, 시간대, 이전 측정치를 바탕으로 실내 온도를 예측한다.
- 딥 Q 네트워크(DQN)를 사용해 두 개의 DRL 에이전트를 훈련시킨다: 에이전트 1은 이전 공급수 온도 대비 증분 동작을 사용하고, 에이전트 2는 학습된 기준 전략에서의 이격도를 사용한다.
- 환경는 상태 벡터에 외기 온도, 공급수 온도, 시간대, 24시간 이내 실내 온도 기록을 포함하는 마르코프 결정 과정(Markov Decision Process)으로 모델링된다.
- 보상 함수는 목표 실내 온도(18 °C)에서의 절대 이격도를 벌어지게 하며, 에너지 비용에 대한 명시적 가중치 없이 설정된다: r = -Σ|T_in - T_target|.
- 과적합을 방지하기 위해 일곱 개의 중국 도시 기상 데이터를 사용해 훈련하고, 일반화 능력을 평가하기 위해 여덟 번째 도시(Yuncheng)에서 테스트를 실시한다.
- 기준 전략은 최적화된 수온 곡선을 사용하며, 수동 조정을 통해 설정되며 현재 산업 관행를 반영한다.
실험 결과
연구 질문
- RQ1딥 강화학습은 중국의 도시 난방 시스템에서 에너지 효율성과 열적 쾌적함 측면에서 현재 산업 표준 수온 곡선 전략을 능가할 수 있는가?
- RQ2전문가 가이드 레이션 액션 스페이스(에이전트 2)는 실생활 구현 시나리오에서 DRL 에이전트의 성능과 안정성에 어떤 영향을 미치는가?
- RQ3열적 쾌적도 이격도 기반 보상 함수가 명시적인 에너지 비용 페널티 없이도 에너지 소비를 줄일 수 있는 정도는 어느 정도인가?
- RQ4RNN 기반의 온도 예측 모델은 다양한 기후 조건에서 DRL 에이전트의 강건성과 일반화 능력에 어떤 기여를 하는가?
- RQ5100만 평방미터를 서비스하는 대규모 도시 난방망로에 DRL을 적용할 경우 잠재적인 CO₂ 및 에너지 절감 효과는 무엇인가?
주요 결과
- 에이전트 2는 다세대 시뮬레이션에서 최적화된 기준 전략 대비 시즌당 2.19%의 에너지 절감과 495톤의 CO₂ 감소를 달성했다.
- 두 DRL 에이전트 모두 기준 전략 대비 평균 절대 오차를 8.5% 감소시켰으며, 에이전트 2는 가장 낮은 오차(0.545 °C)와 표준편차(0.692 °C)를 기록했다.
- 에너지 비용 가중치를 명시적으로 포함하지 않은 열적 쾌적도 이격도 기반 보상 함수는 무게 조정 함수보다 더 안정적이고 강건했으며, 여전히 상당한 에너지 절감 효과를 보였다.
- 전문가 가이드 레이션 액션 스페이스(에이전트 2)는 성능 향상과 함께 전문가 기준 전략에서 3 °C 이내로 동작을 유지함으로써 운영자 신뢰도 향상과 구현 가능성 증대에 기여했다.
- PID 제어기는 기준 전략보다 略적으로 우수했지만, 에너지 효율성과 열적 쾌적함 측면에서 두 DRL 에이전트에 비해 열등했다.
- 결과는 DRL이 고정된 열가격과 저장 기능이 없는 낮은 유연성 환경에서도 도시 난방 시스템의 복잡한 열역학적 특성을 효과적으로 학습할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.