Skip to main content
QUICK REVIEW

[논문 리뷰] Federated Deep Reinforcement Learning for Resource Allocation in O-RAN Slicing

Han Zhang, Hao Zhou|arXiv (Cornell University)|2022. 08. 02.
Energy Harvesting in Wireless Networks인용 수 4
한 줄 요약

이 논문은 오픈 RAN 네트워크 슬라이싱에서 서로 독립적인 두 개의 xAPP—파워 제어 및 슬라이스 기반 리소스 할당—을 조율하기 위해 연합 딥 강화학습(Federated DRL) 프레임워크를 제안한다. 지역 Q-테이블을 조율 모델을 통해 융합하여 글로벌 Q-테이블을 형성함으로써, 학습 효율성과 네트워크 성능을 향상시키며, 중앙집중식 학습에 가까운 성능을 달성한다. 독립적 DRL 대비 eMBB 대역폭은 11% 높고, URLLC 지연은 33% 낮아져, 데이터 공유 제약 조건에서도 개인정보 보호가 보장된 채로 확장 가능한 자원 할당이 가능하다.

ABSTRACT

Recently, open radio access network (O-RAN) has become a promising technology to provide an open environment for network vendors and operators. Coordinating the x-applications (xAPPs) is critical to increase flexibility and guarantee high overall network performance in O-RAN. Meanwhile, federated reinforcement learning has been proposed as a promising technique to enhance the collaboration among distributed reinforcement learning agents and improve learning efficiency. In this paper, we propose a federated deep reinforcement learning algorithm to coordinate multiple independent xAPPs in O-RAN for network slicing. We design two xAPPs, namely a power control xAPP and a slice-based resource allocation xAPP, and we use a federated learning model to coordinate two xAPP agents to enhance learning efficiency and improve network performance. Compared with conventional deep reinforcement learning, our proposed algorithm can achieve 11% higher throughput for enhanced mobile broadband (eMBB) slices and 33% lower delay for ultra-reliable low-latency communication (URLLC) slices.

연구 동기 및 목표

  • 오픈 RAN 네트워크 슬라이싱 환경에서 서로 다른 행동 공간과 상태 공간을 가진 다수의 독립적 xAPP 에이전트를 조율하는 문제를 해결하기 위해.
  • 중앙집중식 데이터 공유가 불가능한 분산형, 개인정보 보호가 보장된 환경에서 학습 효율성과 네트워크 성능을 향상시키기 위해.
  • 중앙집중식 제어나 글로벌 상태 정보에 대한 가시성이 없이도 이질적인 xAPP 간—파워 제어 및 자원 할당—의 조율을 가능하게 하기 위해.
  • 중앙집중식 학습 수준에 근접한 성능을 달성하면서도 데이터 프라이버시를 유지하고 학습 자원 소비를 줄이기 위해.
  • 분산형, 연합 학습 아키텍처에서 두 개 이상의 xAPP에 대해 조율 프레임워크를 확장 가능하게 하기 위해.

제안 방법

  • 다양한 기능을 가진 두 개의 별도 xAPP를 설계한다: 파워 제어 xAPP와 계층적 라디오 리소스 할당 xAPP로, 각각 독립된 강화학습 에이전트로 운영된다.
  • 각 xAPP는 자체 로컬 데이터와 상태-행동 관측치를 사용하여 로컬 딥 Q-네트워크(DQN) 모델을 학습시킨다.
  • 두 xAPP의 로컬 Q-테이블이 중앙 조율 모델로 제출되어 연합 방식으로 융합되어 글로벌 Q-테이블을 형성한다.
  • 형성된 글로벌 Q-테이블을 기반으로 공동 행동을 선택하고, 이를 다시 각 개별 xAPP로 분해하여 실행한다.
  • 프레임워크는 연합 방식으로 파rameter 융합을 사용하여 데이터 프라이버시를 유지하면서도 이질적인 에이전트 간 협업 학습을 가능하게 한다.
  • 조율 모델은 서로 다른 상태 및 행동 공간을 가진 에이전트 간 정보 공유를 가능하게 하여 전체 시스템 성능 향상에 기여한다.

실험 결과

연구 질문

  • RQ1연합 딥 강화학습이 오픈 RAN 네트워크 슬라이싱 환경에서 서로 다른 상태 및 행동 공간을 가진 다수의 이질적 xAPP를 효과적으로 조율할 수 있는가?
  • RQ2eMBB 및 URLLC 슬라이스의 대역폭과 지연 측면에서, 연합 DRL은 독립적 DRL 및 중앙집중식 DRL에 비해 어떤 성능을 보이는가?
  • RQ3분산형 O-RAN 환경에서 연합 방식이 학습 수렴 속도와 확장성에 얼마나 기여하는가?
  • RQ4연합 프레임워크는 중앙집중식 학습 수준의 성능을 달성하면서도 데이터 프라이버시를 유지할 수 있는가?
  • RQ5다양한 트래픽 부하 조건 하에서 연합 조율이 QoS 지표인 지연과 대역폭에 어떤 영향을 미치는가?

주요 결과

  • 제안된 연합 DRL 프레임워크는 eMBB 트래픽 부하 10 Mbps 조건에서 독립적 DRL 대비 eMBB 슬라이스의 대역폭을 11% 높게 달성한다.
  • eMBB 부하가 10 Mbps일 때, 연합 DRL은 독립적 DRL 대비 URLLC 슬라이스의 지연을 33% 감소시킨다.
  • 연합 DRL은 중앙집중식 DRL 수준에 매우 가까운 네트워크 성능을 달성하여, 분산 학습임에도 불구하고 강력한 조율 능력을 입증한다.
  • 연합 DRL 알고리즘의 수렴 속도는 중앙집중식 DRL보다 빠르며, 이는 각 에이전트의 상태 및 행동 공간이 작아졌기 때문이다.
  • URLLC 지연의 ECCDF 분석 결과, 연합 DRL은 독립적 DRL보다 더 우수한 지연 분포를 보이며, 꼬리 지연이 낮다.
  • 프레임워크는 두 개 이상의 xAPP로도 확장 가능하며, 계산 비용은 모든 xAPP의 행동 공간의 합과 동일한 입력/출력 차원을 가진 단일 DNN 학습 비용과 동일하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.