Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Agent Deep Reinforcement Learning Based Trajectory Planning for Multi-UAV Assisted Mobile Edge Computing

Liang Wang, Kezhi Wang|arXiv (Cornell University)|2020. 09. 23.
UAV Applications and Optimization참고 문헌 37인용 수 8
한 줄 요약

이 논문은 다중 UAV 기반 모바일 엣지 컴퓨팅을 위한 다중 에이gent 강화학습(MADDPG) 기반의 경로 계획 프레임워크를 제안하며, 사용자 기지국(UE)의 공정성, UAV 부하 균형, 에너지 효율성을 동시에 최적화한다. 3~4架 UAV 시뮬레이션에서 RANDOM 및 CIRCLE와 같은 벤치마크 대비 뛰어난 성능을 보이며, 공정성 지수 0.9를 달성하고 UE 에너지 소비를 감소시킨다.

ABSTRACT

An unmanned aerial vehicle (UAV)-aided mobile edge computing (MEC) framework is proposed, where several UAVs having different trajectories fly over the target area and support the user equipments (UEs) on the ground. We aim to jointly optimize the geographical fairness among all the UEs, the fairness of each UAV' UE-load and the overall energy consumption of UEs. The above optimization problem includes both integer and continues variables and it is challenging to solve. To address the above problem, a multi-agent deep reinforcement learning based trajectory control algorithm is proposed for managing the trajectory of each UAV independently, where the popular Multi-Agent Deep Deterministic Policy Gradient (MADDPG) method is applied. Given the UAVs' trajectories, a low-complexity approach is introduced for optimizing the offloading decisions of UEs. We show that our proposed solution has considerable performance over other traditional algorithms, both in terms of the fairness for serving UEs, fairness of UE-load at each UAV and energy consumption for all the UEs.

연구 동기 및 목표

  • 다중 UAV MEC 시스템에서 지리적 공정성, UAV 부하 공정성, 전체 UE 에너지 소비를 동시에 최적화하는 문제를 해결하기 위해.
  • 혼합 정수 및 연속 최적화 변수가 존재하는 상황에서도 분산형, 협업형 방식으로 UAV 경로를 관리하기 위해.
  • UAV 경로가 결정된 후에 UE가 저복잡도의 오프로딩 결정을 내릴 수 있도록 하여 실용적 구현을 보장하기 위해.
  • 기존의 무작위 이동, 원형 비행, 고정 패턴과 같은 전통적인 경로 전략에 비해 시스템 성능을 향상시키기 위해.
  • 실제 세계의 제약 조건 하에서 복잡하고 동적인 UAV-UE 상호작용을 다룰 수 있도록 MADDPG의 효과성을 입증하기 위해.

제안 방법

  • 각 UAV가 공동 보상 함수를 최대화하는 데 목적이 있는 최적의 경로를 독립적으로 학습할 수 있도록 다중 에이전트 딥 디터민리스틱 정책 그래디언트(MADDPG) 알고리즘을 적용한다.
  • 보상 함수는 세 가지 구성 요소를 포함한다: UE 간 공정성, UAV 별 UE 부하 공정성, 전체 UE 에너지 소비 감소.
  • UAV는 UE 위치를 관찰하고 효율적으로 더 많은 UE를 서비스할 수 있도록 위치를 조정하면서 시뮬레이션 환경과의 지속적인 상호작용을 통해 경로를 학습한다.
  • 경로 최적화 이후, UAV의 접근성과 채널 조건을 기반으로 저복잡도 알고리즘이 UE의 오프로딩 결정을 도출한다.
  • 중앙집중적 훈련과 분산 실행(CTDE) 파라다임을 사용하여 협업 행동을 가능하게 하면서도 개별 제어를 유지한다.
  • 벤치마크 전략으로는 MAT(제안된 방법), RANDOM(무작위 UAV 이동), CIRCLE(UAV가 UE 클러스터 주변을 원형으로 비행)가 포함된다.

실험 결과

연구 질문

  • RQ1다중 에이전트 딥 강화학습 기반 접근법이 다중 UAV MEC 시스템에서 지상 UE 간 공정성과 UAV 간 부하 균형을 효과적으로 균형 잡을 수 있는가?
  • RQ2제안된 MADDPG 기반 경로 제어는 고정 패턴 기반 벤치마크(예: CIRCLE, RANDOM)에 비해 공정성과 에너지 효율성 측면에서 어떻게 비교되는가?
  • RQ3제안된 방법은 높은 서비스 품질을 유지하면서 전체 UE 에너지 소비를 어느 정도 감소시킬 수 있는가?
  • RQ4분산형 학습 프레임워크는 중앙집중적 조율 없이도 협업형 UAV 행동을 가능하게 하는가?
  • RQ5시간 슬롯(TS) 수와 UAV 수가 제안된 경로 계획의 수렴성과 성능에 어떤 영향을 미치는가?

주요 결과

  • 4 UAV를 사용한 조건에서 제안된 MAT 방법은 UE 서비스 공정성 지수 0.9를 달성하였으며, 동일 조건에서 CIRCLE(0.6)와 RANDOM(0.5)에 비해 뚜렷한 우수성을 보였다.
  • MAT는 UAV 별 UE 부하 공정성 지수를 거의 1.0로 유지하여 균형 잡힌 부하 분배를 보였고, RANDOM은 단지 0.75에 머물렀다.
  • MAT는 CIRCLE 및 RANDOM보다 전체 UE 에너지 소비를 더 효과적으로 감소시켜 뛰어난 에너지 효율성을 입증하였다.
  • 4 UAV 조건에서 MAT는 3 UAV 대비 각 UE의 최소 서비스 시간 슬롯 수를 약 2.5에서 약 6으로 증가시켜 서비스 신뢰성을 향상시켰다.
  • MAT의 성능 향상은 시간 슬롯 수에 관계없이 일관되게 유지되었으며, 더 많은 TS가 할당될수록 공정성과 에너지 효율성이 향상되었다.
  • 히트맵 시각화 결과, MAT를 통해 UAV가 고수요 지역을 협업적으로 커버하며 중복 또는 누락 서비스를 방지함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.