Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-UAV Speed Control with Collision Avoidance and Handover-aware Cell Association: DRL with Action Branching

Zijiang Yan, Wael Jaafar|arXiv (Cornell University)|2023. 07. 24.
Autonomous Vehicle Technology and SafetyEngineering인용 수 3
한 줄 요약

이 논문은 3차원 공중 고속도로에서 다중 UAV의 속도 제어, 셀 연결, 충돌 회피를 종합적으로 최적화하기 위한 행동 분기 기반 딥 강화학습(DRL) 프레임워크를 제안한다. Branching Dueling Q-Network(BDQ)와 그 더블 버전인 BDDQN을 사용하여, 교통 흐름과 핸드오버(HO) 인식 통신 성능의 균형을 18.32% 향상시켰다.

ABSTRACT

This paper presents a deep reinforcement learning solution for optimizing multi-UAV cell-association decisions and their moving velocity on a 3D aerial highway. The objective is to enhance transportation and communication performance, including collision avoidance, connectivity, and handovers. The problem is formulated as a Markov decision process (MDP) with UAVs' states defined by velocities and communication data rates. We propose a neural architecture with a shared decision module and multiple network branches, each dedicated to a specific action dimension in a 2D transportation-communication space. This design efficiently handles the multi-dimensional action space, allowing independence for individual action dimensions. We introduce two models, Branching Dueling Q-Network (BDQ) and Branching Dueling Double Deep Q-Network (Dueling DDQN), to demonstrate the approach. Simulation results show a significant improvement of 18.32% compared to existing benchmarks.

연구 동기 및 목표

  • 3차원 공중 고속도로에서 다중 UAV의 운동 역학과 통신 성능을 통합적으로 최적화할 수 있는 방법의 부족을 해결한다.
  • 충돌 회피를 보장하면서도 동시에 항공 교통 흐름을 최대화하고 핸드오버(HO) 손실을 최소화한다.
  • 동적 조건 하에서 UAV 속도, 차선 변경, 기지국(BS) 할당을 동시에 처리할 수 있는 DRL 기반 솔루션을 개발한다.
  • 다차원 행동 공간에서 수렴성과 정책 품질에 한계가 있는 기존 Q-학습 기반 방법의 문제점을 해결한다.
  • 동적 무선 연결 요구 사항을 충족하는 고밀도 공중 교통 환경에서 강건하고 확장 가능한 의사결정을 가능하게 한다.

제안 방법

  • UAV 속도와 통신 데이터 전송 속도를 상태로 정의하여 다중 UAV 제어 문제를 마르코프 결정 과정(MDP)으로 수식화한다.
  • UAV 가속/감속, 차선 변경, 기지국 할당 결정을 포함한 2차원 행동 공간을 설계한다.
  • 다차원 행동을 효율적으로 처리하기 위해 공유된 결정 모듈과 각 행동 차원별로 독립된 브랜치를 갖춘 신경망 아키텍처를 제안한다.
  • 행동 분기 기반 DRL 에이전트 두 종류를 제안한다: Branching Dueling Q-Network(BDQ)와 Branching Dueling Double DQN(BDDQN)으로 탐색-이용 균형과 안정성을 향상시킨다.
  • Q-값을 근사하기 위해 ReLU 활성화 함수를 사용하는 완전히 연결된 피드포워드 네트워크(FNN)를 사용하고, 개별 행동 출력을 위한 분기 헤드를 적용한다.
  • 출력층에 선형 활성화 함수를 적용하고, 경험 재생과 타겟 네트워크를 사용하여 학습 안정성을 향상시킨다.

실험 결과

연구 질문

  • RQ13차원 공중 고속도로 환경에서 다중 UAV의 속도 제어, 차선 변경, 셀 연결을 동시에 최적화하여 교통 흐름과 통신 품질을 극대화할 수 있는 방법은 무엇인가?
  • RQ2UAV 속도가 충돌 빈도, 핸드오버 비율, 데이터 전송 속도 성능에 미치는 영향은 무엇인가?
  • RQ3행동 분기 기반 DRL 아키텍처는 기존의 DQN과 DDQN보다 다차원 UAV 제어 행동을 다룰 때 더 우수한 성능을 보일 수 있는가?
  • RQ4가용 기지국 수가 통신 보상과 핸드오버 빈도 간의 트레이드오프에 미치는 영향은 무엇인가?
  • RQ5다이나믹한 UAV 네트워크에서 데이터 전송 속도를 극대화하고 핸드오버 관련 페널티를 최소화하는 최적의 균형은 무엇인가?

주요 결과

  • 제안된 BDDQN 알고리즘은 DDQN과 SDB를 포함한 기존 기준 대비 총 성능에서 18.32% 향상되었다.
  • 목표 속도 10 m/s에서 통신 보상이 최대가 되며, 높은 속도(예: 20 m/s)일 경우 충돌 빈도가 증가하고 운송 보상이 감소한다.
  • BDDQN은 약 1000개의 학습 에피소드 후 핸드오버 비율이 1% 이하로 수렴하여 효과적인 핸드오버 회피 학습을 이룬다.
  • 15개의 BS가 존재할 경우 BDQN과 BDDQN의 통신 보상이 최고에 도달하지만, 더 높은 BS 밀도로 증가하면 과도한 셀 재선택으로 인해 핸드오버 페널티가 증가한다.
  • 5개의 BS만 존재할 경우 15개의 BS가 있는 경우보다 핸드오버 비율이 더 높으며, 이는 알고리즘이 목표 속도에 도달하는 것을 우선시하여 더 많은 핸드오버를 유도하기 때문이다.
  • 10 m/s 속도에서 BDDQN은 SDB 기준 대비 운송 보상 16.7%, 통신 보상 23.4%, 핸드오버 비율 10.9% 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.