Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Trajectory and Passive Beamforming Design for Intelligent Reflecting Surface-Aided UAV Communications: A Deep Reinforcement Learning Approach

Liang Wang, Kezhi Wang|arXiv (Cornell University)|2020. 07. 16.
Advanced Wireless Communication Technologies인용 수 12
한 줄 요약

이 논문은 에너지 효율성을 극대화하기 위해 IRS를 활용한 UAV 통신에서 UAV 경로와 수동 beamforming을 공동 최적화하기 위한 딥 강화학습(DRL) 기반 접근법을 제안한다. 이는 이산 경로 제어를 위한 DQN 기반 방법과 연속 경로 최적화를 위한 DDPG 기반 방법을 도입하여 기존의 FF 및 RR 기준보다 높은 에너지 효율성을 달성한다.

ABSTRACT

In this paper, the intelligent reflecting surface (IRS)-aided unmanned aerial vehicle (UAV) communication system is studied, where the UAV is deployed to serve the user equipment (UE) with the assistance of multiple IRSs mounted on several buildings to enhance the communication quality between UAV and UE. We aim to maximize the energy efficiency of the system, including the data rate of UE and the energy consumption of UAV via jointly optimizing the UAV's trajectory and the phase shifts of reflecting elements of IRS, when the UE moves and the selection of IRSs is considered for the energy saving purpose. Since the system is complex and the environment is dynamic, it is challenging to derive low-complexity algorithms by using conventional optimization methods. To address this issue, we first propose a deep Q-network (DQN)-based algorithm by discretizing the trajectory, which has the advantage of training time. Furthermore, we propose a deep deterministic policy gradient (DDPG)-based algorithm to tackle the case with continuous trajectory for achieving better performance. The experimental results show that the proposed algorithms achieve considerable performance compared to other traditional solutions.

연구 동기 및 목표

  • 이동하는 UEs와 동적 IRS 선택을 고려한 IRS를 활용한 UAV 통신 시스템에서 에너지 효율성을 극대화하는 데 도전하는 문제를 해결한다.
  • 이동하는 UEs와 다수의 IRS를 포함한 동적이고 고차원적인 환경에서 전통적인 최적화의 복잡성을 극복한다.
  • 실제 제약 조건 하에서 공동 UAV 경로 및 수동 위상 이동 최적화를 위한 저복잡도이자 적응형 알고리즘을 설계한다.
  • 딥 강화학습을 활용하여 UAV 이동성과 IRS 반사 beam 제어를 실시간으로 확장 가능하게 제어한다.
  • 이동하는 사용자 이동성과 IRS 선택을 지원하면서도 데이터 전송률과 에너지 소비 측면에서 시스템 성능을 향상시킨다.

제안 방법

  • UAV 경로와 IRS 위상 이동을 행동으로 하는 마르코프 결정 과정(MDP)으로 공동 최적화 문제를 수식화한다.
  • 더 빠른 학습과 낮은 복잡도를 위해 이산화된 UAV 경로와 행동 공간을 사용하는 DQN 기반 알고리즘을 구현한다.
  • 성능 향상을 위해 연속적인 UAV 경로와 위상 이동 최적화를 가능하게 하는 DDPG 기반 알고리즘을 개발한다.
  • 데이터 전송률과 UAV 에너지 소비를 균형 잡는 보상 함수를 사용하며, 나쁜 성능(예: 범위를 벗어나는 비행)에 대해서는 음수 보상을 적용한다.
  • 학습 안정성과 수렴성 향상을 위해 경험 재생과 타겟 네트워크를 사용하여 DQN 및 DDPG 에이전트를 훈련시킨다.
  • 완전히 연결된 신경망을 사용하여 Q-값(DDQN)과 정책 함수(DDPG)를 근사하며, 위상 이동 최적화는 각 타임슬롯마다 수행된다.

실험 결과

연구 질문

  • RQ1동적이고 이동성이 높은 UEs 환경에서 UAV 경로와 IRS 수동 beamforming을 공동 최적화하여 시스템의 에너지 효율성을 극대화하는 방법은 무엇인가?
  • RQ2IRS를 활용한 UAV 통신에서 전통적인 히우리스틱 또는 최적화 기반 접근법에 비해 DRL 기반 방법이 가지는 성능 향상은 무엇인가?
  • RQ3반사 요소의 수가 제안된 DRL 알고리즘의 학습 성능 및 에너지 효율성에 미치는 영향은 무엇인가?
  • RQ4DQN(이산)과 DDPG(연속) 접근법 간에 학습 시간과 성능 사이의 상충 관계는 어떻게 되는가?
  • RQ5활성화된 IRS 선택이 시스템의 에너지 효율성과 학습 수렴에 미치는 영향은 무엇인가?

주요 결과

  • DDPG 기반 알고리즘은 DQN(약 70 bps/J 미만)보다 높은 평균 에너지 효율성(70 bps/J)을 달성하며, FF 및 RR 기준보다 뚜렷이 뛰어난 성능을 보인다.
  • 반사 요소의 수가 증가할수록 DQN과 DDPG 모두 평균 보상과 에너지 효율성이 향상되어 IRS 크기에 대한 확장성 잠재력을 보여준다.
  • DDPG는 연속 행동 공간 최적화 덕분에 DQN보다 높은 보상을 지속적으로 달성하여 보다 매끄럽고 효과적인 UAV 경로 계획이 가능하다.
  • 반사 요소의 수가 증가함에 따라 학습 시간이 증가하지만, 더 단순한 이산 행동 공간 덕분에 DQN은 DDPG보다 더 빠르게 학습된다.
  • DDPG가 학습한 UAV 경로는 더 적응형이며 효율적이며, 선택된 IRS들과의 LOS 링크를 유지하기 위해 고도와 위치를 동적으로 조정한다.
  • DQN 및 DDPG 에이전트는 충분한 학습 후 안정된 정책에 수렴하며, 평균 보상이 에피소드 수에 따라 증가하여 고수준에서 안정화된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.