Skip to main content
QUICK REVIEW

[논문 리뷰] Competitive MA-DRL for Transmit Power Pool Design in Semi-Grant-Free NOMA Systems.

Muhammad Fayaz, Wenqiang Yi|arXiv (Cornell University)|2021. 06. 21.
Advanced Wireless Communication Technologies참고 문헌 35인용 수 8
한 줄 요약

이 논문은 대규모 IoT 네트워크에서 반할당 자유 비정규 다중접근(SGF-NOMA)을 위한 동적 전송 전력 풀(PP) 설계를 위해 경쟁적 다중에이전트 딥 강화학습(MA-DRL) 프레임워크를 제안한다. 자원 선택을 확률적 마르코프 게임로 모델링하고, 학습 효율성을 향상시키기 위해 듀얼링 DDQN을 적용함으로써, 순수 할당 자유 프로토콜 대비 22.2% 높은 시스템 스루풋과 고정 전력 제어 대비 17.5% 향상된 성능를 달성하였으며, 비유효 동작 제거를 통한 훈련 시간 단축도 이루어졌다.

ABSTRACT

In this paper, we exploit the capability of multi-agent deep reinforcement learning (MA-DRL) technique to generate a transmit power pool (PP) for Internet of things (IoT) networks with semi-grant-free non-orthogonal multiple access (SGF-NOMA). The PP is mapped with each resource block (RB) to achieve distributed transmit power control (DPC). We first formulate the resource (sub-channel and transmit power) selection problem as stochastic Markov game, and then solve it using two competitive MA-DRL algorithms, namely double deep Q network (DDQN) and Dueling DDQN. Each GF user as an agent tries to find out the optimal transmit power level and RB to form the desired PP. With the aid of dueling processes, the learning process can be enhanced by evaluating the valuable state without considering the effect of each action at each state. Therefore, DDQN is designed for communication scenarios with a small-size action-state space, while Dueling DDQN is for a large-size case. Our results show that the proposed MA-Dueling DDQN based SGF-NOMA with DPC outperforms the SGF-NOMA system with the fixed-power-control mechanism and networks with pure GF protocols with 17.5% and 22.2% gain in terms of the system throughput, respectively. Moreover, to decrease the training time, we eliminate invalid actions (high transmit power levels) to reduce the action space. We show that our proposed algorithm is computationally scalable to massive IoT networks. Finally, to control the interference and guarantee the quality-of-service requirements of grant-based users, we find the optimal number of GF users for each sub-channel.

연구 동기 및 목표

  • 반할당 자유 NOMA를 갖는 대규모 IoT 네트워크에서 자원 할당의 효율성을 높이기 위해 분산 전송 전력 제어를 가능하게 하여 도전 과제를 해결한다.
  • 서비스 품질과 스펙트럼 효율성을 유지하는 데 한계가 있는 고정 전력 제어 및 순수 할당 자유 프로토콜의 한계를 극복한다.
  • 대규모 연결성과 간섭 관리를 지원하는 확장 가능하고 저지연 전력 풀 메커니즘을 설계한다.
  • 하나의 서브채널당 할당 자유 사용자 수를 최적화하여 할당 기반 사용자의 QoS와 스루풋을 균형 잡는다.
  • 듀얼링 네트워크 아키텍처와 비유효 동작 제거를 통해 다중에이전트 환경에서의 학습 효율성을 향상시킨다.

제안 방법

  • 할당 자유 사용자 간의 상호작용을 모델링하기 위해 공동 서브채널 및 전송 전력 선택 문제를 확률적 마르코프 게임으로 수립한다.
  • 두 가지 경쟁적 MA-DRL 알고리즘—DDQN과 듀얼링 DDQN—을 구현하며, 각 할당 자유 사용자는 독립된 에이전트로서 자신의 전력과 서브채널 선택을 최적화한다.
  • 상태 가치와 이점 추정을 분리함으로써 학습 안정성과 수렴 속도를 향상시키기 위해 듀얼링 네트워크를 통합한다.
  • 유효하지 않거나 비현실적인 고전력 수준을 제거함으로써 행동 공간을 축소하여 훈련 속도를 향상시키고 확장성을 높인다.
  • 최적의 전력 수준을 자원 블록당 전송 전력 풀(PP)로 매핑하여 네트워크 전역의 분산 전력 제어를 구현한다.
  • 간섭을 최소화하고 할당 기반 사용자의 QoS를 확보하기 위해 하나의 서브채널당 최적의 할당 자유 사용자 수를 결정한다.

실험 결과

연구 질문

  • RQ1다중에이전트 딥 강화학습은 반할당 자유 NOMA IoT 네트워크에서 동적 전송 전력 풀 설계에 어떻게 효과적으로 적용될 수 있는가?
  • RQ2표준 DDQN 대비 듀얼링 DDQN을 사용할 경우, 대규모 행동-상태 공간에서 학습 효율성과 시스템 스루풋에 어떤 영향을 미치는가?
  • RQ3비유효 동작 제거는 대규모 IoT 구현에서 훈련 시간과 확장성에 얼마나 기여하는가?
  • RQ4제안된 MA-DRL 기반 전력 풀 설계는 고정 전력 제어 및 순수 할당 자유 프로토콜에 비해 시스템 스루풋 측면에서 어떻게 비교되는가?
  • RQ5할당 기반 사용자의 QoS를 유지하면서 시스템 스루풋을 최대화하는 하나의 서브채널당 할당 자유 사용자의 최적 수는 얼마인가?

주요 결과

  • 제안된 MA-듀얼링 DDQN 기반 SGF-NOMA와 분산 전력 제어는 순수 할당 자유 프로토콜 대비 22.2% 높은 시스템 스루풋을 달성한다.
  • 고정 전력 제어 메커니즘 대비 17.5% 높은 시스템 스루풋을 기록하여 적응형 전력 할당의 이점을 입증한다.
  • 비유효 고전력 동작 제거가 효과적인 행동 공간을 크게 축소하여 빠른 훈련 수렴과 향상된 계산 확장성을 이끌어낸다.
  • 듀얼링 아키텍처는 상태 가치와 이점 추정을 분리함으로써 대규모 행동-상태 환경에서 학습 안정성과 성능을 향상시킨다.
  • 하나의 서브채널당 최적의 할당 자유 사용자 수는 스펙트럼 효율성과 간섭을 균형 잡기 위해 결정되었으며, 할당 기반 사용자의 QoS를 보장한다.
  • 전체 프레임워크는 계산적으로 확장 가능하며 고밀도 사용자 환경을 가진 대규모 IoT 네트워크에 적합한 배포가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.