Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic SDN-based Radio Access Network Slicing with Deep Reinforcement Learning for URLLC and eMBB Services

Abderrahime Filali, Zoubeir Mlika|arXiv (Cornell University)|2022. 02. 13.
Software-Defined Networks and 5G인용 수 4
한 줄 요약

이 논문은 깊이 강화 학습을 사용하여 URLLC 및 eMBB 서비스에 라디오 자원을 동적으로 할당하는 이중 시간스케일 SDN 기반 RAN 슬라이싱 프레임워크를 제안한다. 장기 시간스케일에서 SDN 컨트롤러는 EXP3 기반 단일 에이전트 MDP를 통해 자원 블록(RB)을 gNodeB에 할당하며, 단기 시간스케일에서는 gNodeB가 다중 에이전트 딥 Q러닝(DQL)을 사용해 RB를 사용자에게 스케줄링하고 필요에 따라 이웃 gNodeB로부터 빌려 쓰며, 동적 트래픽 하에서 두 서비스의 QoS를 크게 향상시킨다.

ABSTRACT

Radio access network (RAN) slicing is a key technology that enables 5G network to support heterogeneous requirements of generic services, namely ultra-reliable low-latency communication (URLLC) and enhanced mobile broadband (eMBB). In this paper, we propose a two time-scales RAN slicing mechanism to optimize the performance of URLLC and eMBB services. In a large time-scale, an SDN controller allocates radio resources to gNodeBs according to the requirements of the eMBB and URLLC services. In a short time-scale, each gNodeB allocates its available resources to its end-users and requests, if needed, additional resources from adjacent gNodeBs. We formulate this problem as a non-linear binary program and prove its NP-hardness. Next, for each time-scale, we model the problem as a Markov decision process (MDP), where the large-time scale is modeled as a single agent MDP whereas the shorter time-scale is modeled as a multi-agent MDP. We leverage the exponential-weight algorithm for exploration and exploitation (EXP3) to solve the single-agent MDP of the large time-scale MDP and the multi-agent deep Q-learning (DQL) algorithm to solve the multi-agent MDP of the short time-scale resource allocation. Extensive simulations show that our approach is efficient under different network parameters configuration and it outperforms recent benchmark solutions.

연구 동기 및 목표

  • 중앙집중식 및 다수 레벨의 RAN 슬라이싱 접근 방식에서 높은 신호 전송 오버헤드와 유연하지 못한 자원 할당 문제를 해결하기 위해.
  • SDN 기반 RAN에서 이질적인 5G 서비스(URRLC 및 eMBB)를 위한 동적이고 확장 가능하며 QoS 인식 자원 할당을 가능하게 하기 위해.
  • gNodeB에서 단기 시간스케일 자원 스케줄링을 분산화하여 빈번한 SDN 컨트롤러 상호작용에 대한 의존도를 줄이기 위해.
  • 동적 네트워크 조건 하에서 URLLC에 대한 신뢰성 있고 저지연 지원 및 eMBB 서비스에 대한 고대역폭을 확보하기 위해.
  • 변동하는 사용자 수요와 제한된 사전 할당 자원을 처리할 수 있는 견고하고 적응 가능한 자원 할당 메커니즘을 개발하기 위해.

제안 방법

  • 라디오 자원 블록(RB) 할당 문제를 비선형 이진 프로그래밍으로 수식화하고, NP-난이도임을 증명한다.
  • SDN 컨트롤러가 장기 시간스케일에서 RB 할당을 수행하는 것을 단일 에이전트 마르코프 결정 과정(MDP)으로 모델링하고, 탐색과 이용을 위해 EXP3 알고리즘을 사용하여 해결한다.
  • gNodeB 수준의 단기 시간스케일 자원 할당을 다중 에이전트 MDP로 모델링하고, 안정성과 성능 향상을 위해 더블 DQN과 경험 재생을 사용한 다중 에이전트 딥 Q러닝(DQL)으로 해결한다.
  • 사전 할당된 자원이 부족할 경우, gNodeB가 이웃 gNodeB로부터 사용하지 않는 RB를 동적으로 빌려 쓰도록 허용하여 자원 활용도와 QoS를 향상시킨다.
  • 학습 수렴성과 의사결정 품질 향상을 위해 타겟 네트워크와 재생 메모리와 같은 견고한 딥 강화 학습 구성 요소를 통합한다.
  • 이중 계층 아키텍처를 사용한다: SDN 컨트롤러가 gNodeB에 장기적인 RB 할당을 수행한 후, 각 gNodeB에서 실시간 사용자 수요에 기반한 국지적이고 빠른 스케줄링을 수행한다.
Figure 1 : Resource block allocation procedure
Figure 1 : Resource block allocation procedure

실험 결과

연구 질문

  • RQ1동적 트래픽 조건 하에서 SDN 기반 RAN 슬라이싱은 URLLC 및 eMBB 서비스 간 자원 할당을 어떻게 효율적으로 균형 잡을 수 있는가?
  • RQ2계층적 RAN 슬라이싱 아키텍처에서 신호 전송 오버헤드와 QoS 만족도 사이의 최적의 트레이드오���은 무엇인가?
  • RQ3다중 에이전트 딥 강화 학습 접근 방식은 국지적 gNodeB 수준 자원 스케줄링에서 중앙집중식 또는 단일 에이전트 방법보다 뛰어나게 작동할 수 있는가?
  • RQ4gNodeB 간 RB 빌림 기능은 돌발적인 트래픽 증가 상황에서 자원 가용성과 서비스 신뢰성에 어떻게 기여하는가?
  • RQ5제안된 이중 시간스케일 메커니즘은 지연 민감 서비스 및 고대역폭 서비스의 QoS를 유지하면서 빈번한 SDN 컨트롤러 상호작용에 대한 의존도를 얼마나 줄일 수 있는가?

주요 결과

  • SAMA-RL(제안된 방법)은 모든 테스트된 최소 데이터 전송 속도 기준 이하에서 총 합계 데이터 전송 속도를 최대화하는 데 3-SRA 및 1-SRA를 지속적으로 능가한다.
  • 최소 데이터 전송 속도 기준이 높아질수록 SAMA-RL과 벤치마크 간 성능 격차가 커지며, 이는 엄격한 QoS 제약 조건 하에서도 메서드의 견고성을 입증한다.
  • 모든 구성에서 SAMA-RL은 3-SRA 및 1-SRA보다 더 많은 최종 사용자가 최소 데이터 전송 속도 기준을 충족시킨다.
  • SAMA-RL은 특히 높은 지연 기준 이하에서 최종 사용자 지연 요구 사항을 충족시키는 데 3-SRA 및 1-SRA를 크게 능가한다.
  • 다중 에이전트 DQL 기반 빌림 메커니즘은 gNodeB가 추가 RB에 동적으로 액세스할 수 있도록 하여 서비스 차단을 줄이고 QoS 회복력을 향상시킨다.
  • 시뮬레이션 결과는 제안된 이중 시간스케일 메커니즘이 신호 전송 오버헤드를 감소시키면서도 URLLC 및 eMBB 서비스의 QoS를 유지하거나 향상시킨다는 것을 확인한다.
Figure 2 : Single-agent multi-agent interaction with the MDP environment.
Figure 2 : Single-agent multi-agent interaction with the MDP environment.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.