[논문 리뷰] Flow Rate Control in Smart District Heating Systems Using Deep Reinforcement Learning
이 논문은 깊이 강화학습(DRL) 기반의 유량 제어 시스템을 제안하며, 딥 디터미니스틱 정책 기울기(DDPG)를 사용하여 열 공급을 최적화한다. 수동 제어 대비 에너지 소비를 19,850.1 GJ/h 감소시키고 물 소비를 42,276.45 톤/h 감소시켜 실제 및 시뮬레이션 환경에서의 구현에서 뚜렷한 효율성 향상을 보였다.
At high latitudes, many cities adopt a centralized heating system to improve the energy generation efficiency and to reduce pollution. In multi-tier systems, so-called district heating, there are a few efficient approaches for the flow rate control during the heating process. In this paper, we describe the theoretical methods to solve this problem by deep reinforcement learning and propose a cloud-based heating control system for implementation. A real-world case study shows the effectiveness and practicability of the proposed system controlled by humans, and the simulated experiments for deep reinforcement learning show about 1985.01 gigajoules of heat quantity and 42276.45 tons of water are saved per hour compared with manual control.
연구 동기 및 목표
- 최적화되지 않은 유량 제어와 높은 물 낭비로 인한 도시 난방 시스템(DHS)의 비효율성 문제를 해결하기 위해.
- 복잡한 수학적 모델에 의존하거나 다양한 DHS 구성에 적응하지 못하는 전통적 제어 방법의 한계를 극복하기 위해.
- 실시간 자동 유량 최적화를 위한 확장성 있고 클라우드 기반의 제어 시스템을 개발하기 위해.
- 실제 구현과 시뮬레이션을 통해 DRL 접근법을 검증하여 수동 제어 대비 에너지 및 물 절감 효과를 입증하기 위해.
제안 방법
- 딥 디터미니스틱 정책 기울기(DDPG) 알고리즘을 사용하여 도시 난방 시스템의 주 및 보조 측 유량 최적 정책을 학습하기 위해 딥 신경망을 훈련한다.
- DRL 에이전트는 공급 및 귀환 물 온도, 유량, 목표 열 요구량 등의 상태 관측값을 수신하고, 목표 열 공급에서의 편차를 최소화하기 위해 유량 조정을 출력한다.
- 변경된 시스템 동역학과 실시간 적용 가능성을 확보하기 위해, 새로운 데이터(예: 7일 간격의 윈도우)를 기반으로 모델을 점진적으로 재훈련하는 롤링 훈련 방식을 사용한다.
- 현장 센서에서 수집된 실시간 데이터를 클라우드 플랫폼(아리바이 클라우드)으로 전송하기 위해 NB-IoT를 통합하여 원격 중앙 집중식 제어를 가능하게 한다.
- 주 유량 제어를 위해 DRL을 사용하고, 개별 아파트의 수압 불균형을 보정하기 위해 PID 제어기를 조합한 하이브리드 제어 아키텍처를 구현한다.
- 보상 함수는 주 및 보조 측에서 실제 열량과 목표 열량 간의 절대 오차를 최소화하도록 설계된다.
실험 결과
연구 질문
- RQ1깊이 강화학습이 도시 난방 시스템의 유량 제어를 효과적으로 최적화하여 에너지 및 물 소비를 줄일 수 있는가?
- RQ2열 공급 정확도와 자원 효율성 측면에서 DRL 기반 제어는 수동 제어에 비해 어떻게 비교되는가?
- RQ3세부 시스템 모델이 필요 없이 DRL 에이전트가 다양한 도시 난방 시스템 구성에 일반화할 수 있는가?
- RQ4NB-IoT를 통한 실시간 데이터 스트리밍이 실제 구현에서 DRL 기반 제어의 성능과 확장성에 어떤 영향을 미치는가?
- RQ5롤링 훈련 전략은 변화가 많은 난방 환경에서 모델의 안정성과 적응력을 어떻게 향상시키는가?
주요 결과
- DDPG 에이전트는 수동 제어 대비 보조 측에서 총 열 에너지 소비를 12.6% 감소시키고 주 측에서 9.7% 감소시켰다.
- DDPG 방법은 총 열 소비량을 18,219.17 GJ/h로 정규화하여 시험된 방법들 중 두 번째로 낮은 수준을 기록했으며, CE 값은 1,307.07 GJ/h로 높은 효율성을 나타냈다.
- DDPG 및 SAC 에이전트는 지도 학습 방법보다 목표 곡선에 더 가까운 열 공급을 유지했으며, 주파수 분포 히스토GRAM에서 오차가 거의 0 근처에 집중되어 있었다.
- 시뮬레이션 실험에서 수동 제어 대비 매시간 약 19,850.1 기가줄의 열 에너지와 42,276.45 톤의 물을 절감했다.
- 롤링 훈련 전략 덕분에 DRL 모델이 시간이 지남에 따라 향상되었으며, 더 많은 데이터가 통합될수록 평균 보상이 증가하여 실제 동역학에 효과적으로 적응하는 것으로 나타났다.
- DRL 기반 시스템은 복잡한 비선형 동역학과 수압 불균형을 효과적으로 처리하여 전통적 제어 방법에 비해 정확성과 안정성 측면에서 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.