Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-UAV Mobile Edge Computing and Path Planning Platform based on Reinforcement Learning

Huan Chang, Yi‐Cheng Chen|arXiv (Cornell University)|2021. 02. 03.
UAV Applications and Optimization참고 문헌 16인용 수 5
한 줄 요약

이 논문은 질서 있는 서비스(QoS), 위험 회피, 에너지 효율성을 동시에 최적화하기 위해 딥 강화학습을 활용한 다중 UAV 모바일 에지 컴퓨팅 및 경로 계획 플랫폼을 제안한다. 시그모이드 유사 수요 함수와 기하학적 거리, 위험, 사용자 수요를 종합한 보상 행렬을 통합함으로써, 특히 장애물이 많고 동적인 환경에서 사각지대 최소화로 인해 A* 및 게으른 기준선 대비 뛰어난 QoS와 뛰어난 내성 확보를 달성한다.

ABSTRACT

Unmanned Aerial vehicles (UAVs) are widely used as network processors in mobile networks, but more recently, UAVs have been used in Mobile Edge Computing as mobile servers. However, there are significant challenges to use UAVs in complex environments with obstacles and cooperation between UAVs. We introduce a new multi-UAV Mobile Edge Computing platform, which aims to provide better Quality-of-Service and path planning based on reinforcement learning to address these issues. The contributions of our work include: 1) optimizing the quality of service for mobile edge computing and path planning in the same reinforcement learning framework; 2) using a sigmoid-like function to depict the terminal users' demand to ensure a higher quality of service; 3) applying synthetic considerations of the terminal users' demand, risk and geometric distance in reinforcement learning reward matrix to ensure the quality of service, risk avoidance, and the cost-savings. Simulations have shown the effectiveness and feasibility of our platform, which can help advance related researches.

연구 동기 및 목표

  • 기존 UAV 기반 모바일 에지 컴퓨팅의 경로 계획 기술이 동적인 환경에 적응하지 못하고 사각지대가 자주 발생하는 등의 한계를 해결하기 위해.
  • 사용자 수요, 위험, 기하학적 제약 조건을 고려한 단일 강화학습 프레임워크를 통해 QoS 최적화와 경로 계획을 통합하기 위해.
  • 복잡하고 장애물이 많은 환경에서 적응형 실시간 정책 학습을 통해 QoS와 임무 신뢰성을 향상시키기 위해.
  • 공유된 상태 정보를 통한 다중 UAV 협업을 통해 비용 절감과 충돌 방지를 가능하게 하기 위해.

제안 방법

  • 최적의 UAV 경로와 작업 할당을 학습하기 위해 딥 Q넷(DQN) 기반 강화학습 프레임워크를 사용한다.
  • 비선형 서비스 만족도를 더 잘 반영하고 QoS를 향상시키기 위해 종단 사용자 수요를 시그모이드 유사 함수로 모델링한다.
  • 보상 함수는 기하학적 거리, 위험(충돌 확률), 사용자 수요의 세 가지 구성 요소를 조합하며, 튜닝 가능한 계수를 통해 상호 보완적 조정이 가능하다.
  • 사용자 위치와 장애물 정보를 실시간으로 공유하여 공동 경로 계획을 가능하게 하고 국소 최적해를 피한다.
  • 변동하는 사용자 수요와 환경 조건에 따라 정책을 동적으로 조정함으로써 실시간 적응이 가능하다.
  • 성능 평가를 위해 장애물과 이동하는 사용자가 있는 3차원 시뮬레이션 환경에서 시스템을 훈련시켰다.

실험 결과

연구 질문

  • RQ1다중 UAV 모바일 에지 컴퓨팅 환경에서 QoS, 경로 계획, 위험 회피를 동시에 최적화할 수 있는 통합 강화학습 프레임워크는 가능한가?
  • RQ2동적인 UAV 서비스 환경에서 선형 모델 대비 시그모이드 유사 사용자 수요 함수가 QoS에 어떤 영향을 미치는가?
  • RQ3A*와 같은 전통적 알고리즘 대비 제안된 RL 기반 플랫폼은 QoS, 경로 효율성, 사각지대 내성 측면에서 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ4보상 함수의 계수(K: 경로 길이, M: 위험)가 QoS, 안전성, 에너지 효율성 간의 상호 보완적 조정에 어떤 영향을 미치는가?

주요 결과

  • 제안된 RL 플랫폼은 모든 테스트 조건에서 QoS=1.00을 달성하여, 경로 길이 및 위험 페널티가 높은 조건에서 A*(최대 QoS 0.61)를 크게 앞서는 성능을 보였다.
  • K=50 및 M=0.5 조건에서 QoS=1.00을 유지하면서 평균 경로 길이를 1.13으로 줄이고 위험도 0.36으로 낮춰, 뛰어난 효율성과 안전성을 입증했다.
  • A* 알고리즘은 K > 10 조건에서 빈번히 사각지대에 갇히지만, RL 프레임워크는 모든 테스트 조건에서 안정적으로 작동하며 임무 완수를 보장했다.
  • K=5 및 M=0.5 조건의 보상 함수가 가장 균형 잡힌 성능을 보였으며, QoS=1.00, 경로 길이=1.09, 위험도=4.42를 기록하여 A*보다 모든 지표에서 뛰어난 성능을 보였다.
  • 시그모이드 수요 함수는 비선형 사용자 만족도를 반영함으로써 고수요 상황에서 특히 효과적으로 작업 할당과 QoS 향상을 가능하게 했다.
  • 고위험 조건에서 A* 대비 평균 위험을 최대 75%까지 감소시켜, 효과적인 충돌 방지 및 안전성 최적화를 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.