Skip to main content
QUICK REVIEW

[논문 리뷰] Design and Comparison of Reward Functions in Reinforcement Learning for Energy Management of Sensor Nodes

Yohann Rioual, Yannick Le Moullec|arXiv (Cornell University)|2021. 06. 02.
Reinforcement Learning in Robotics참고 문헌 23인용 수 5
한 줄 요약

이 논문은 무선 센서 노드에서 Q-학습 기반 에너지 관리에 대한 일곱 가지 보상 함수를 설계하고 평가하며, 배터리 충전 상태를 기반으로 성능과 에너지 소비 간의 트레이드오프를 최적화함으로써 동적 균형 매개변수를 갖는 적응형 보상 함수(R6 및 R7)가 에너지 효율성을 크게 향상시키고 학습 시간을 단축시킴을 입증한다.

ABSTRACT

Interest in remote monitoring has grown thanks to recent advancements in Internet-of-Things (IoT) paradigms. New applications have emerged, using small devices called sensor nodes capable of collecting data from the environment and processing it. However, more and more data are processed and transmitted with longer operational periods. At the same, the battery technologies have not improved fast enough to cope with these increasing needs. This makes the energy consumption issue increasingly challenging and thus, miniaturized energy harvesting devices have emerged to complement traditional energy sources. Nevertheless, the harvested energy fluctuates significantly during the node operation, increasing uncertainty in actually available energy resources. Recently, approaches in energy management have been developed, in particular using reinforcement learning approaches. However, in reinforcement learning, the algorithm's performance relies greatly on the reward function. In this paper, we present two contributions. First, we explore five different reward functions to identify the most suitable variables to use in such functions to obtain the desired behaviour. Experiments were conducted using the Q-learning algorithm to adjust the energy consumption depending on the energy harvested. Results with the five reward functions illustrate how the choice thereof impacts the energy consumption of the node. Secondly, we propose two additional reward functions able to find the compromise between energy consumption and a node performance using a non-fixed balancing parameter. Our simulation results show that the proposed reward functions adjust the node's performance depending on the battery level and reduce the learning time.

연구 동기 및 목표

  • 에너지 수확 기반 센서 노드에서 최적의 보상 함수 구성 요소를 규명하기 위해.
  • 다양한 보상 함수 설계가 에너지 소비를 관리하는 데 있어 Q-학습 성능에 미치는 영향을 평가하기 위해.
  • 배터리 충전 상태를 기반으로 에너지 소비와 노드 성능 간의 균형을 동적으로 조절할 수 있는 적응형 보상 함수를 개발하기 위해.
  • 센서 노드 운영에서 에너지 효율성을 유지하거나 향상시키면서 학습 시간을 단축하기 위해.

제안 방법

  • 배터리 충전 상태, 수확한 에너지, 측정 주파수, 성능 지표를 조합하여 사용한 다섯 가지 기초 보상 함수(R1–R5)를 설계하였다.
  • 비고정 균형 매개변수를 갖는 두 가지 고급 보상 함수(R6 및 R7)를 제안하였으며, 이는 배터리 수준에 따라 스케일링되어 성능과 에너지 사용 간의 트레이드오프를 최적화한다.
  • 다양한 에너지 수확 조건을 가진 시뮬레이션 환경에서 에이전트를 훈련하기 위해 강화학습 알고리즘으로 Q-학습을 사용하였다.
  • 다양한 일수에 걸쳐 시뮬레이션을 수행하여 주요 성능 지표로 배터리 충전 수준과 측정 주파수를 추적하였다.
  • R6 및 R7의 설계에는 현재 배터리 상태에 따라 조정되는 동적 균형 매개변수가 통합되어 있어 적응성이 향상되었다.
  • 24일 간의 연장 시뮬레이션을 통해 Q-값의 수렴을 검증하였으며, 안정적인 정책 학습을 확인하였다.

실험 결과

연구 질문

  • RQ1배터리 수준, 수확한 에너지, 측정 주파수 등의 다양한 보상 함수 구성 요소가 에너지 관리에서 Q-학습의 학습 및 성능에 어떤 영향을 미치는가?
  • RQ2고정된 균형 매개변수와 동적 균형 매개변수의 차이는 에너지 소비와 노드 성능 간의 트레이드오프에 어떤 영향을 미치는가?
  • RQ3배터리 충전 상태에 적응하는 보상 함수는 학습 효율성과 에너지 관리 결과를 향상시킬 수 있는가?
  • RQ4에너지 수확 기반 센서 노드에서 가장 빠른 수렴 속도와 가장 안정적인 행동을 보이는 보상 함수 설계는 무엇인가?

주요 결과

  • 보상 매개변수 β를 포함한 R1 및 R2는 에너지 소비를 수확한 에너지 수준에 맞게 효과적으로 조정하며 뛰어난 성능을 보였다.
  • R5는 주로 주도적인 운동 주파수에 기반하지만, 에너지 수확에 적응은 하지만 필요한 경우 성능 우선 순위를 부여하지 못한다.
  • R3 및 R4는 성능이 열악했다: R3는 에너지 사용과 수확 간의 연결이 없었고, R4는 에너지가 부족할 때 소비를 줄이지 못했다.
  • 동적 균형 매개변수를 갖는 R6 및 R7는 고정 매개변수 함수보다 우수한 성능을 보였으며, 배터리 상태에 적응함으로써 학습 시간을 단축시켰다.
  • 시뮬레이션 결과 24일 동안 Q-값의 수렴이 확인되어 다양한 에너지 조건에서도 안정적이고 적응적인 행동이 나타났다.
  • 제안된 보상 함수(R6 및 R7)는 다양한 배터리 용량에서 뛰어난 견고성을 보였으며, 시스템 구성 요소에 대한 사전 지식이 필요하지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.