Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning based Multi-Access Control and Battery Prediction with Energy Harvesting in IoT Systems

Man Chu, Hang Li|arXiv (Cornell University)|2018. 05. 11.
Energy Harvesting in Wireless Networks참고 문헌 34인용 수 6
한 줄 요약

이 논문은 에너지 수확 기반 IoT 시스템에서 공동 다중접속 제어 및 배터리 상태 예측을 위한 강화학습(RL) 기반 프레임워크를 제안한다. 딥 Q네트워크(DQN)와 장기 단기 기억(LSTM) 네트워크를 사용하여, 단지 인과적 채널 및 배터리 상태 정보만을 사용하여 업링크 합산 속도를 최적화하고 배터리 예측 오차를 최소화한다. 이로 인해 모델 기반 정책보다 최대 9.96% 높은 합산 속도와 무작위 스케줄링보다 24.7% 높은 성능을 달성한다.

ABSTRACT

Energy harvesting (EH) is a promising technique to fulfill the long-term and self-sustainable operations for Internet of things (IoT) systems. In this paper, we study the joint access control and battery prediction problems in a small-cell IoT system including multiple EH user equipments (UEs) and one base station (BS) with limited uplink access channels. Each UE has a rechargeable battery with finite capacity. The system control is modeled as a Markov decision process without complete prior knowledge assumed at the BS, which also deals with large sizes in both state and action spaces. First, to handle the access control problem assuming causal battery and channel state information, we propose a scheduling algorithm that maximizes the uplink transmission sum rate based on reinforcement learning (RL) with deep Q-network (DQN) enhancement. Second, for the battery prediction problem, with a fixed round-robin access control policy adopted, we develop a RL based algorithm to minimize the prediction loss (error) without any model knowledge about the energy source and energy arrival process. Finally, the joint access control and battery prediction problem is investigated, where we propose a two-layer RL network to simultaneously deal with maximizing the sum rate and minimizing the prediction loss: the first layer is for battery prediction, the second layer generates the access policy based on the output from the first layer. Experiment results show that the three proposed RL algorithms can achieve better performances compared with existing benchmarks.

연구 동기 및 목표

  • 사전에 에너지 원천에 대한 지식이 없는 동적이고 예측 불가능한 에너지 수확 환경에서 IoT 시스템의 도전 과제를 해결한다.
  • 채널 및 배터리 상태 정보의 인과적 지식만을 사용하여 실시간 모델 프리 없는 액세스 제어 정책을 설계하여 업링크 합산 속도를 최대화한다.
  • 에너지 도착 과정에 대한 사전 지식이 없이도 예측 오차를 최소화하는 배터리 상태 예측 알고리즘을 개발한다.
  • 두 층의 강화학습 아키텍처를 사용하여 액세스 제어와 배터리 예측을 하나의 공동 최적화 프레임워크로 통합한다.
  • 제한된 사전 시스템 지식과 비정상적인 에너지 원천이 존재하는 실제 환경에서도 높은 성능을 달성한다.

제안 방법

  • 순시 시스템 피드백 기반으로 정책 학습을 위한 딥 Q네트워크(DQN)를 사용하는 부분 관측 상태를 가진 마르코프 결정 과정(MDP)으로 액세스 제어 문제를 모델링한다.
  • 역사적 에너지 및 채널 데이터를 사용하여 향후 배터리 상태를 예측하기 위해 딥 LSTM 네트워크를 구현하며, 평균 제곱 예측 오차를 최소화한다.
  • 두 층의 강화학습 아키텍처를 제안한다: 첫 번째 층은 LSTM을 통해 배터리 수준을 예측하고, 두 번째 층은 이러한 예측 결과를 입력으로 받아 DQN 에이전트가 액세스 스케줄링을 수행한다.
  • 합산 속도 최대화와 예측 손실 최소화를 균형 잡는 병합 보상 함수를 사용하여 공동 네트워크를 엔드 투 엔드로 훈련한다.
  • 고차원 상태 및 행동 공간에서 훈련의 안정성과 수렴성을 향상시키기 위해 DQN에서 경험 재생과 타겟 네트워크를 적용한다.
  • 명시적 시스템 모델이 필요 없이도 연속적이고 대규모의 상태/행동 공간을 다룰 수 있도록 딥 신경망을 사용한 함수 근사 기법을 적용한다.

실험 결과

연구 질문

  • RQ1모델 프리 강화학습 접근법이 채널 및 배터리 상태 정보의 인과적 지식만을 사용하는 에너지 수확 기반 IoT 시스템에서 업링크 합산 속도를 효과적으로 최적화할 수 있는가?
  • RQ2에너지 도착 과정에 대한 사전 모델이 없는 조건에서 딥 LSTM 네트워크가 향후 배터리 수준을 얼마나 정확하게 예측할 수 있는가?
  • RQ3액세스 제어와 배터리 예측을 공동으로 최적화하는 것이 분리된 접근 방식에 비해 시스템 성능을 얼마나 향상시키는가?
  • RQ4제안된 RL 기반 방법이 라운드로빈, 무작위, 모델 기반 정책 등의 기준 정책과 비교하여 합산 속도 및 예측 정확도 측면에서 어떻게 성능을 내는가?
  • RQ5배터리 용량과 채널 조건이 다양할 경우, 공동 DQN-LSTM 프레임워크의 수렴 성향과 안정성은 어떠한가?

주요 결과

  • 제안된 DQN 기반 액세스 제어 알고리즘은 모델 기반 정책(MP)보다 평균 합산 속도가 9.96% 높고, 라운드로빈보다 21.1% 높으며, 무작위 스케줄링보다 24.7% 높다.
  • 배터리 예측 손실은 약 22,000개의 훈련 스텝 이후 약 0.0175 단위로 안정화되어 높은 예측 정확도를 나타낸다.
  • 공동 두 층의 강화학습 프레임워크는 안정적으로 수렴하며, 배터리 예측 손실이 합산 속도 보상보다 먼저 평형 상태에 도달함으로써 정확한 예측이 더 나은 스케줄링 결정을 가능하게 함을 보여준다.
  • 더 높은 배터리 용량과 더 많은 가용 채널이 존재할수록 합산 속도가 증가하며, 이는 에너지 낭비 감소와 더 나은 스케줄링 기회 때문일 것이다.
  • 훈련이 진행됨에 따라 제안된 DQN과 오프라인 최적 상한선 간의 성능 격차가 줄어들며, 충분한 훈련 후 상한선의 95.86%에 도달한다.
  • 에너지 동역학에 대한 사전 지식 없이도 시스템은 MP보다 평균 9.96% 높은 합산 속도와 무작위 스케줄링보다 24.7% 높은 합산 속도를 안정적으로 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.