Skip to main content
QUICK REVIEW

[논문 리뷰] UAV-to-Device Underlay Communications: Age of Information Minimization by Multi-agent Deep Reinforcement Learning

Fanyi Wu, Hongliang Zhang|arXiv (Cornell University)|2020. 03. 12.
Age of Information Optimization참고 문헌 30인용 수 4
한 줄 요약

이 논문은 셀룰러 드론 인터넷 내에서 드론-to-디바이스(U2D) 언더레이 통신 환경에서 정보의 나이(AoI)를 최소화하기 위해 다중 에이전트 딥 강화학습(DRL) 프레임워크를 제안한다. 드론의 항로 설계를 연속 상태-행동 공간을 가진 마르코프 결정 과정으로 모델링함으로써, 저널리스트와 정책 그래디언트 기반 기준선보다 낮은 AoI를 달성하는 딥 디터미니스틱 정책 그래디언트 implemendation을 사용하여 드론의 감지 및 전송을 위한 궤적을 공동 최적화한다.

ABSTRACT

In recent years, unmanned aerial vehicles (UAVs) have found numerous sensing applications, which are expected to add billions of dollars to the world economy in the next decade. To further improve the Quality-of-Service (QoS) in such applications, the 3rd Generation Partnership Project (3GPP) has considered the adoption of terrestrial cellular networks to support UAV sensing services, also known as the cellular Internet of UAVs. In this paper, we consider a cellular Internet of UAVs, where the sensory data can be transmitted either to base station (BS) via cellular links, or to mobile devices by underlay UAV-to-Device (U2D) communications. To evaluate the freshness of data, the age of information (AoI) is adopted, in which a lower AoI implies fresher data. Since UAVs' AoIs are determined by their trajectories during sensing and transmission, we investigate the AoI minimization problem for UAVs by designing their trajectories. This problem is a Markov decision problem (MDP) with an infinite state-action space, and thus we utilize multi-agent deep reinforcement learning (DRL) to approximate the state-action space. Then, we propose a multi-UAV trajectory design algorithm to solve this problem. Simulation results show that our algorithm achieves a lower AoI than greedy algorithm and policy gradient algorithm.

연구 동기 및 목표

  • 셀룰러 드론 인터넷 내에서 드론-to-디바이스(U2D) 언더레이 통신에서 정보의 나이(AoI)를 최소화하는 문제를 해결하기 위해.
  • AoI가 이동성과 전송 동역학에 모두 의존하므로, 감지 및 전송을 위한 드론 궤적을 공동 최적화하기 위해.
  • 무한한 상태-행동 공간과 관측 불가능한 간섭을 다루기 위해, 기존의 모델 기반 방법이 복잡해지는 다중 드론 시스템에서.
  • 마르코프 전이를 가능하게 하는 감지 및 전송 프로토콜을 설계하여, 정보의 나이 최소화 문제를 마르코프 결정 과정(MDP)으로 모델링하기 위해.
  • 실시간 적응을 위한 동적 드론 네트워크에서 사용 가능한 분산 궤적 설계 알고리즘을 개발하기 위해.

제안 방법

  • 드론 이동성과 전송 전력 제어로 인해 연속적인 상태 및 행동 공간을 가진 마르코프 결정 과정(MDP)으로 정보의 나이 최소화 문제를 수립한다.
  • 드론의 감지 및 전송를 마르코프 체인의 상태 전이로 모델링하여 정보의 나이 변화에서 시간적 의존성을 포착한다.
  • 각 드론에 대해 탈중앙화된 정책을 학습하기 위해 다중 에이전트 딥 강화학습(DRL)과 딥 디터미니스틱 정책 그래디언트(DDPG) 알고리즘을 적용한다.
  • 중앙집중식 크리틱 네트워크를 사용하여 가치 함수를 추정하고, 각 드론은 자신의 국지적 관측 기반으로 행동함으로써 다중 에이전트 환경에서 신뢰도 할당을 가능하게 한다.
  • 드론 운영을 조율하고 시기적절한 업데이트를 통해 데이터 신선도를 보장하기 위해 감지 및 전송을 통합한 프로토콜을 구현한다.
  • 정책 학습을 이끄는 데 도움을 주기 위해 높은 AoI에 대한 보상 페널티를 제공하고 자주이고 신뢰할 수 있는 데이터 업데이트를 장려하는 보상 함수를 사용한다.

실험 결과

연구 질문

  • RQ1다중 드론 셀룰러 네트워크에서 정보의 나이(AoI)를 최소화하기 위해 드론 궤적을 감지 및 전송을 위해 공동 최적화할 수 있는 방법은 무엇인가?
  • RQ2다른 드론으로부터 오는 간섭이 관측 불가능하고 동적인 상황에서 언더레이 U2D 통신이 AoI에 미치는 영향은 무엇인가?
  • RQ3다중 에이전트 딥 강화학습이 정보의 나이 최소화를 위한 드론 궤적 설계에서 무한한 상태-행동 공간과 부분 관측 가능성을 효과적으로 다룰 수 있는가?
  • RQ4제안된 DRL 기반 궤적 설계는 고급 및 정책 그래디언트 기준선 대비 정보의 나이 성능에서 어떻게 비교되는가?
  • RQ5데이터 수요 및 서브채널 가용성과 같은 시스템 파라미터와 정보의 나이 사이의 관계는 무엇인가?

주요 결과

  • 제안된 다중 에이전트 DRL 알고리즘이 모든 시험 환경에서 고급 알고리즘과 정책 그래디언트 기준선보다 낮은 평균 AoI를 달성한다.
  • 드론의 AoI는 감지 데이터 수요에 따라 선형적으로 증가하며, 데이터 양과 신선도 사이의 직접적인 트레이드오프를 나타낸다.
  • 가용 서브채널 수가 증가할수록 AoI는 감소하지만, 간섭 한계와 자원 제약로 인해 결국 포화 상태에 도달한다.
  • 알고리즘은 드론 이동성과 전송 스케줄링을 효과적으로 균형 잡아, 조율된 궤적 계획을 통해 데이터 노후화를 줄인다.
  • 시뮬레이션 결과는 DRL 기반 접근법이 동적 환경에 잘 적응하고 히وري스틱 방법보다 데이터 나이 최소화에서 뛰어난 성능을 보임을 확인한다.
  • 이 방법은 연속적이고 고차원적인 상태-행동 공간과 부분 관측 가능성을 효과적으로 다루며, 다중 드론 시스템에서의 확장성과 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.