[논문 리뷰] AI-based Radio Resource Management and Trajectory Design for PD-NOMA Communication in IRS-UAV Assisted Networks
이 논문은 IoT 시스템에서 정보 갱신의 최신성 요구 사항을 충족하기 위해 UAV-IRS를 활용한 PD-NOMA 네트워크에서 연령 정보(AAoI)를 최소화하기 위한 AI 기반 무선 자원 관리 및 궤적 최적화 프레임워크를 제안한다. 이중 딥 Q 네트워크(DDQN)와 프록시멀 정책 최적화(PPO)를 결합한 방법은 전력, 서브-carrier, 궤적, 위상 이동을 동시에 최적화하여, 대응하는 매칭 및 무작위 궤적 기반 알고리즘 대비 각각 10% 및 15% 향상된 AAoI 성능을 달성한다.
In this paper, we consider that the unmanned aerial vehicles (UAVs) with attached intelligent reflecting surfaces (IRSs) play the role of flying reflectors that reflect the signal of users to the destination, and utilize the power-domain non-orthogonal multiple access (PD-NOMA) scheme in the uplink. We investigate the benefits of the UAV-IRS on the internet of things (IoT) networks that improve the freshness of collected data of the IoT devices via optimizing power, sub-carrier, and trajectory variables, as well as, the phase shift matrix elements. We consider minimizing the average age-of-information (AAoI) of users subject to the maximum transmit power limitations, PD-NOMA-related restriction, and the constraints related to UAV's movement. The optimization problem consists of discrete and continuous variables. Hence, we divide the resource allocation problem into two sub-problems and use two different reinforcement learning (RL) based algorithms to solve them, namely the double deep Qnetwork (DDQN) and a proximal policy optimization (PPO). Our numerical results illustrate the performance gains that can be achieved for IRS enabled UAV communication systems. Moreover, we compare our deep RL (DRL) based algorithm with matching algorithm and random trajectory, showing the combination of DDQN and PPO algorithm proposed in this paper performs 10% and 15% better than matching algorithm and random-trajectory algorithm, respectively.
연구 동기 및 목표
- 고도의 데이터 최신성 요구 사항을 가진 IoT 네트워크에서 신속한 상태 업데이트 전달의 과제를 해결한다.
- 실제 제약 조건 하에서 UAV-IRS를 활용한 PD-NOMA 업링크 통신에서 평균 정보 연령(AAoI)을 최소화한다.
- 동시에 전력 할당, 서브-carrier 할당, UAV 궤적, 지능형 반사 표면(IRS) 위상 이동을 최적화한다.
- 동적 무선 환경에서 혼합 정수 비볼록 최적화의 복잡성을 딥 강화 학습을 통해 극복한다.
- 기존 기반선 알고리즘인 매칭 및 무작위 궤적 알고리즘과 비교하여 제안된 DRL 기반 프레임워크의 성능 향상을 입증한다.
제안 방법
- 전력, PD-NOMA, UAV 이동성 제약 조건 하에서 AAoI를 최소화하기 위한 혼합 정수 비볼록 최적화 문제를 수립한다.
- 문제를 두 개의 하위 문제로 분해한다: 서브-carrier 및 전력 할당(DDQN를 통해 해결), UAV 궤적 설계(PPO를 통해 해결).
- 상태 기반 보상이 AAoI를 반영하는 바탕으로 최적의 전력 및 서브-carrier 할당을 학습하는 이중 딥 Q 네트워크(DDQN) 에이전트를 사용한다.
- 연속적인 액션 공간 제어를 통해 AAoI를 감소시키는 최적의 UAV 궤적을 학습하는 프록시멀 정책 최적화(PPO) 에이전트를 활용한다.
- IRS 위상 이동을 동적 beamforming 구성 요소로 통합하여 먼 사용자에 대한 신호 강도와 신뢰성을 향상시킨다.
- 사용자 위치, 채널 상태 및 AAoI 이력이 포함된 상태 표현을 사용하여 시뮬레이션 환경에서 양 에이전트를 종단 간(end-to-end)으로 훈련한다.
실험 결과
연구 질문
- RQ1UAV-IRS를 지원하는 PD-NOMA 시스템은 IoT 네트워크에서 평균 정보 연령(AAoI)를 최소화하기 위해 어떻게 최적화될 수 있는가?
- RQ2단독 UAV 시스템과 비교할 때, 지능형 반사 표면(IRS)을 UAV와 통합함으로써 AAoI 성능은 어느 정도 향상되는가?
- RQ3DDQN과 PPO의 조합은 AAoI 최소화를 위해 전력, 서브-carrier, 궤적, 위상 이동을 동시에 최적화하는 데 얼마나 효과적인가?
- RQ4매칭 및 무작위 궤적과 같은 기반선 기반 알고리즘과 비교하여 제안된 DRL 기반 프레임워크는 어떤 성능 향상을 달성할 수 있는가?
- RQ5송신 전력 제한이 AAoI 감소에 어떤 영향을 미치며, 어떤 상황에서 IRS 배치가 가장 유익한가?
주요 결과
- 제안된 DDQN-PPO 프레임워크는 매칭 알고리즘 기반선 대비 AAoI 성능을 10% 향상시켰다.
- 무작위 궤적 기반선 대비 15%의 AAoI 감소를 달성하여 지능적인 궤적 설계의 효과성을 입증했다.
- DRL 에이전트의 수렴은 4,000 에피소드 내에 달성되었으며, 안정적인 학습 행동과 개선되는 AAoI를 반영하는 음의 보상 추세를 보였다.
- PPO에 의해 학습된 UAV 궤적은 더 높은 AAoI와 약한 채널 조건을 가진 사용자 쪽으로 적응적으로 이동하여 데이터 전송률을 향상시키고 연령을 감소시켰다.
- 저전력 송신 조건 하에서 IRS 도입은 시스템 성능을 크게 향상시켜, 전력 제한이 있는 IoT 응용 분야에서 핵심적 인프라가 되었다.
- 사용자 수가 증가함에 따라 스펙트럼 및 시간 자원의 제한으로 인해 AAoI가 증가하지만, 제안된 방법은 모든 사용자 수에서 기반선 대비 낮은 AAoI를 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.