Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-user Resource Control with Deep Reinforcement Learning in IoT Edge Computing

Lei Lei, Huijuan Xu|arXiv (Cornell University)|2019. 06. 19.
IoT and Edge/Fog Computing참고 문헌 36인용 수 4
한 줄 요약

이 논문은 장기 평균 가중 지연 및 전력 소비의 합을 최소화하기 위해, IoT 엣지 컴퓨팅 시스템에서 딥 강화학습 기반의 공동 계산 오프로딩 및 다중 사용자 스케줄링 알고리즘을 제안한다. 연속 시간 마르코프 결정 과정(CTMDP) 모델과 가치 함수 근사에 위한 새로운 신경망 아키텍처를 사용함으로써, 차원의 극복 문제를 효과적으로 완화하는 반분산 경매 기반 자원 제어를 가능하게 하여, 기준 및 기타 DRL 방법에 비해 시뮬레이션에서 뚜렷한 성능 향상을 달성한다.

ABSTRACT

By leveraging the concept of mobile edge computing (MEC), massive amount of data generated by a large number of Internet of Things (IoT) devices could be offloaded to MEC server at the edge of wireless network for further computational intensive processing. However, due to the resource constraint of IoT devices and wireless network, both the communications and computation resources need to be allocated and scheduled efficiently for better system performance. In this paper, we propose a joint computation offloading and multi-user scheduling algorithm for IoT edge computing system to minimize the long-term average weighted sum of delay and power consumption under stochastic traffic arrival. We formulate the dynamic optimization problem as an infinite-horizon average-reward continuous-time Markov decision process (CTMDP) model. One critical challenge in solving this MDP problem for the multi-user resource control is the curse-of-dimensionality problem, where the state space of the MDP model and the computation complexity increase exponentially with the growing number of users or IoT devices. In order to overcome this challenge, we use the deep reinforcement learning (RL) techniques and propose a neural network architecture to approximate the value functions for the post-decision system states. The designed algorithm to solve the CTMDP problem supports semi-distributed auction-based implementation, where the IoT devices submit bids to the BS to make the resource control decisions centrally. Simulation results show that the proposed algorithm provides significant performance improvement over the baseline algorithms, and also outperforms the RL algorithms based on other neural network architectures.

연구 동기 및 목표

  • 제한된 계산 및 무선 자원을 가진 다중 사용자 IoT 엣지 컴퓨팅 시스템에서 효율적인 자원 할당 문제를 해결하기 위해.
  • 스토케스틱한 트래픽 도착 조건 하에서 장기 평균 가중 지연 및 전력 소비의 합을 최소화하기 위해.
  • 다중 사용자 마르코프 결정 과정(MDP)에서의 차원의 극복 문제를 스케일러블 딥 강화학습을 통해 극복하기 위해.
  • 기지국에서의 경매 기반 자원 제어를 통해 반분산 구현을 가능하게 하기 위해.
  • 연속 시간 MDP에서 후결정 상태의 가치 함수를 정확하게 근사하는 데 적합한 신경망 아키텍처를 설계하기 위해.

제안 방법

  • 동적 자원 제어 문제를 무한 시간 할당 보상 기반 연속 시간 마르코프 결정 과정(CTMDP)으로 수식화한다.
  • 후결정 시스템 상태의 가치 함수 근사를 위해 단일 컨볼루션 레이어를 갖춘 신경망 아키텍처를 도입하여 계산 복잡도를 감소시킨다.
  • 값 함수 갱신과 평균 보상 추정에 각각 다른 학습률을 사용하는 이중 학습률 기반 방식을 적용하여 수렴성을 확보한다.
  • IoT 기기들이 기지국에 자원 할당 결정을 위한 입찰을 제출하는 반분산 경매 메커니즘을 사용한다.
  • 유예 추적을 적용한 시간 차분 학습을 통해, 상태에 따라 가중치가 조정되는 상태 기반 기울기를 사용하여 각 노드의 가치 함수와 가중치 벡터를 갱신한다.
  • 컨볼루션 레이어와 완전 연결 레이어의 가중치를 별도로 갱신하는 함수 근사 프레임워크를 구현하며, Tanh 활성화 함수의 도함수를 사용한다.

실험 결과

연구 질문

  • RQ1딥 강화학습은 다중 사용자 IoT 엣지 컴퓨팅 자원 제어에서 차원의 극복 문제를 효과적으로 해결할 수 있는가?
  • RQ2제안된 가치 함수 근사용 신경망 아키텍처는 다른 DRL 아키텍처에 비해 성능 및 수렴성 측면에서 어떻게 비교되는가?
  • RQ3반분산 경매 기반 구현 방식은 다중 사용자 환경에서 시스템의 확장성과 공정성에 어떤 영향을 미치는가?
  • RQ4기준 방법에 비해 이 알고리즘이 장기 가중 지연 및 전력 소비의 합을 어느 정도 감소시키는가?
  • RQ5다양한 학습률 시퀀스는 제안된 알고리즘의 수렴성과 안정성에 어떤 영향을 미치는가?

주요 결과

  • 제안된 Neural-ICO 알고리즘은 장기 평균 가중 지연 및 전력 소비의 합을 최소화하는 데 있어 기준 알고리즘에 비해 뚜렷한 성능 향상을 달성한다.
  • 특히 고차원 다중 사용자 환경에서 다른 딥 강화학습 방법에 비해 뛰어난 성능을 보인다.
  • 시뮬레이션 결과는 다양한 트래픽 도착 패턴과 사용자 부하 조건 하에서도 안정적인 수렴성과 뛰어난 강인성을 입증한다.
  • 함수 근사 아키텍처에서 단일 컨볼루션 레이어 사용이 최적의 성능을 제공하며, 추가적인 완전 연결 레이어는 성능 향상에 기여하지 않는다.
  • 평균 보상 추정에 더 빠르게 감쇠하는 αk를 사용하는 이중 학습률 기반 방식은 정확한 장기 보상 추적과 안정적인 정책 학습을 보장한다.
  • 반분산 경매 기반 구현 방식은 실세계 IoT 엣지 네트워크에서의 확장성과 실용적 구현을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.