Skip to main content
QUICK REVIEW

[논문 리뷰] GAN-powered Deep Distributional Reinforcement Learning for Resource Management in Network Slicing

Yuxiu Hua, Rongpeng Li|arXiv (Cornell University)|2019. 05. 10.
Software-Defined Networks and 5G참고 문헌 43인용 수 11
한 줄 요약

이 논문은 5G 네트워크 슬라이싱에서 동적이고 수요 인식형 자원 관리를 위한 GAN 기반 딥 디스트리뷰션럴 강화학습(GAN-DDQN) 및 듀얼링 GAN-DDQN을 제안한다. 생성적 적대 신경망을 활용해 행동-가치 분포를 모델링하고 보상 클리핑 및 듀얼링 구조를 통합함으로써 학습 안정성을 향상시키고 스펙트럼 효율성과 SLA 이행률을 개선하며, 시뮬레이션에서 기존의 DQN보다 뛰어난 성능을 발휘한다.

ABSTRACT

Network slicing is a key technology in 5G communications system. Its purpose is to dynamically and efficiently allocate resources for diversified services with distinct requirements over a common underlying physical infrastructure. Therein, demand-aware resource allocation is of significant importance to network slicing. In this paper, we consider a scenario that contains several slices in a radio access network with base stations that share the same physical resources (e.g., bandwidth or slots). We leverage deep reinforcement learning (DRL) to solve this problem by considering the varying service demands as the environment state and the allocated resources as the environment action. In order to reduce the effects of the annoying randomness and noise embedded in the received service level agreement (SLA) satisfaction ratio (SSR) and spectrum efficiency (SE), we primarily propose generative adversarial network-powered deep distributional Q network (GAN-DDQN) to learn the action-value distribution driven by minimizing the discrepancy between the estimated action-value distribution and the target action-value distribution. We put forward a reward-clipping mechanism to stabilize GAN-DDQN training against the effects of widely-spanning utility values. Moreover, we further develop Dueling GAN-DDQN, which uses a specially designed dueling generator, to learn the action-value distribution by estimating the state-value distribution and the action advantage function. Finally, we verify the performance of the proposed GAN-DDQN and Dueling GAN-DDQN algorithms through extensive simulations.

연구 동기 및 목표

  • 다양한 서비스 요구 사항을 가진 5G 네트워크 슬라이싱 환경에서 동적이고 수요 인식형 무선 자원 할당 문제를 해결하기 위해.
  • 강화학습 학습 과정에서 SLA 이행률 비율(SSR)과 스펙트럼 효율성(SE)의 노이즈와 무작위성 영향을 줄이기 위해.
  • 생성적 적대 신경망을 분포 기반 Q-학습과 융합하여 네트워크 슬라이싱에 대한 딥 강화학습의 학습 안정성과 학습 효율성을 향상시키기 위해.
  • 듀얼링 생성기 아키텍처를 통해 상태가치 함수와 행동 우월도 함수를 분리함으로써 표현 학습을 향상시키기 위해.

제안 방법

  • 행동-가치 분포를 추정된 분포와 목표 분포 간의 차이를 최소화하는 방식으로 모델링하기 위해 생성적 적대 신경망을 사용하는 GAN-DDQN을 제안한다.
  • 학습 안정성 향상과 가치 네트워크 내 분포 근사 향상을 위해 기울기 보정이 있는 워샤프스키 GAN(WGAN-GP)을 적용한다.
  • 강화학습 환경에서 극단적인 유용도 값으로 인한 불안정성을 완화하기 위해 보상 클리핑 메커니즘을 도입한다.
  • 학습 안정성을 향상시키기 위해 듀얼링 GAN-DDQN에서 상태가치 분포와 행동 우월도 함수를 별도로 추정하는 듀얼링 생성기 아키텍처를 설계한다.
  • 분포 기반 강화학습과 GAN 기반 가치 추정을 융합하여 행동-가치 분포의 더 풍부한 통계적 성질을 포착한다.
  • 기울기 벡터장 분석을 통해 특정 조건 하에서 GAN 기반 학습 목표의 수렴 성질을 증명한다.

실험 결과

연구 질문

  • RQ1GAN 기반 접근법이 네트워크 슬라이싱에 대한 딥 강화학습에서 행동-가치 분포를 효과적으로 모델링할 수 있는가? 이는 노이즈가 많고 무작위적인 보상의 영향을 줄이는가?
  • RQ2보상 클리핑은 고분산 보상이 존재하는 자원 할당 작업에서 GAN 기반 DRL의 학습 안정성을 어떻게 향상시키는가?
  • RQ3GAN 생성기 내에 듀얼링 아키텍처를 통합하면 분포 기반 Q-학습에서 네트워크 슬라이싱의 학습 효율성과 수렴 속도가 향상되는가?
  • RQ4동적 트래픽 수요 하에서 GAN-DDQN은 스펙트럼 효율성과 SLA 이행률 측면에서 기존의 DQN보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ5분포 기반 강화학습의 맥락에서 제안된 GAN 기반 학습 목표의 이론적 수렴 행동은 어떠한가?

주요 결과

  • GAN-DDQN은 행동-가치 분포를 전체적으로 모델링함으로써 학습 안정성과 성능을 크게 향상시키며, 노이즈가 많은 SSR 및 SE 측정치에 대한 민감도를 감소시킨다.
  • 보상 클리핑 메커니즘은 극단적인 보상 값으로 인한 불안정성을 효과적으로 완화하여 보다 일관된 학습 진전을 가능하게 한다.
  • 듀얼링 GAN-DDQN은 상태가치와 행동 우월도 함수를 분리함으로써 내재된 학습 분산을 줄여 GAN-DDQN보다 더 뛰어난 성능을 달성한다.
  • 광범위한 시뮬레이션 결과, 동적 서비스 수요 하에서 GAN-DDQN과 듀얼링 GAN-DDQN 모두 기존의 DQN보다 스펙트럼 효율성과 SLA 이행률 비율 측면에서 뛰어난 성능을 발휘한다.
  • 이론적 분석을 통해 GAN 기반 학습 목표가 특정 조건 하에서 최적의 분포로 수렴하며, 진동 폭이 학습률과 기울기 보정 하이퍼파rameter에 의해 제한됨을 확인하였다.
  • 비정적 트래픽과 다중 지표 제약 조건 하에서도 제안된 방법은 뛰어난 일반화 잠재력을 보이며 우수한 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.