Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Agent Reinforcement Learning based Joint Cooperative Spectrum Sensing and Channel Access for Cognitive UAV Networks.

Weiheng Jiang, Wanxin Yu|arXiv (Cornell University)|2021. 03. 15.
Cognitive Radio Networks and Spectrum Sensing참고 문헌 44인용 수 5
한 줄 요약

이 논문은 가중치가 부여된 보상 함수를 사용하여 감지 비용과 전송 유틸리티를 균형 잡는 다중 에이전트 강화학습(MARL) 프레임워크를 제안하여 인지 UAV 네트워크에서 공동 협력적 스펙트럼 감지 및 채널 접근을 수행한다. IL-Q, IL-DQN, VC-EXH 알고리즘은 동적인 비정적 환경에서 빠른 수렴을 이룩하고 스펙트럼 이용률을 크게 향상시킨다.

ABSTRACT

Designing clustered unmanned aerial vehicle (UAV) communication networks based on cognitive radio (CR) and reinforcement learning can significantly improve the intelligence level of clustered UAV communication networks and the robustness of the system in a time-varying environment. Among them, designing smarter systems for spectrum sensing and access is a key research issue in CR. Therefore, we focus on the dynamic cooperative spectrum sensing and channel access in clustered cognitive UAV (CUAV) communication networks. Due to the lack of prior statistical information on the primary user (PU) channel occupancy state, we propose to use multi-agent reinforcement learning (MARL) to model CUAV spectrum competition and cooperative decision-making problem in this dynamic scenario, and a return function based on the weighted compound of sensing-transmission cost and utility is introduced to characterize the real-time rewards of multi-agent game. On this basis, a time slot multi-round revisit exhaustive search algorithm based on virtual controller (VC-EXH), a Q-learning algorithm based on independent learner (IL-Q) and a deep Q-learning algorithm based on independent learner (IL-DQN) are respectively proposed. Further, the information exchange overhead, execution complexity and convergence of the three algorithms are briefly analyzed. Through the numerical simulation analysis, all three algorithms can converge quickly, significantly improve system performance and increase the utilization of idle spectrum resources.

연구 동기 및 목표

  • 주어진 우선 지식이 부족한 상태에서 주요 사용자 활동에 대한 통계적 정보 없이 군집화된 인지 UAV 네트워크에서의 동적 스펙트럼 접근 문제를 해결하기 위해.
  • 시간에 따라 변화하는 무선 환경에서 UAV 간 자율적이고 협력적인 의사결정을 통해 시스템 지능성과 강건성을 향상시키기 위해.
  • 스펙트럼 감지 및 접근 의사결정에서 감지 비용과 전송 유틸리티 사이의 트레이드오프를 최적화하기 위해.
  • 정보 교환 오버헤드와 실행 복잡도를 감소시키는 스케일러블하고 수렴 가능한 학습 알고리즘을 설계하기 위해.
  • 다중 UAV 에이전트 간 공동 감지 및 접근 조율을 통해 유휴 스펙트럼 자원의 이용률을 향상시키기 위해.

제안 방법

  • UAV가 독립적인 학습자로 작동하는 다중 에이전트 강화학습 게임으로 스펙트럼 감지 및 접근 문제를 수립한다.
  • 실시간 성능 향상을 반영하기 위해 감지 비용과 전송 유틸리티를 조합한 가중치가 부여된 복합 보상 함수를 도입한다.
  • 가상 컨트롤러를 사용하여 에이전트 결정을 조율하는 시간슬롯 다중라운드 재방문 완전 탐색 알고리즘(VC-EXH)을 제안한다.
  • 표 형태의 Q-값 학습을 사용하는 분산형 의사결정을 위한 독립형 Q-학습(IL-Q) 알고리즘을 개발한다.
  • 고차원 상태 공간을 처리하고 학습 안정성을 향상시키기 위해 독립형 딥 Q-네트워크(IL-DQN)를 설계한다.
  • 알고리즘 복잡도, 수렴 속도, 통신 오버헤드를 분석하여 확장성과 실용성을 평가한다.

실험 결과

연구 질문

  • RQ1다양하고 비정적인 인지 UAV 네트워크에서 다중 에이전트 강화학습이 스펙트럼 감지 및 접근을 효과적으로 조율할 수 있는 방법은 무엇인가?
  • RQ2협동 스펙트럼 감지에서 감지 비용과 전송 유틸리티를 균형 잡는 데 가장 적합한 보상 함수 설계는 무엇인가?
  • RQ3IL-Q, IL-DQN, VC-EXH는 수렴 속도, 시스템 성능, 통신 오버헤드 측면에서 어떻게 비교되는가?
  • RQ4사전 통계적 지식 없이도 MARL 기반 접근법이 스펙트럼 이용률을 크게 향상시킬 수 있는가?
  • RQ5분산형 UAV 스펙트럼 접근에서 알고리즘 복잡도, 정보 교환, 수렴 간의 상호 트레이드오프는 무엇인가?

주요 결과

  • VC-EXH, IL-Q, IL-DQN의 세 가지 제안된 알고리즘 모두 동적 스펙트럼 접근 시나리오에서 빠른 수렴을 달성한다.
  • MARL 기반 접근법은 유휴 스펙트럼 자원의 이용률을 향상시켜 시스템 성능을 크게 향상시킨다.
  • 가중치가 부여된 복합 보상 함수는 감지 비용과 전송 유틸리티를 효과적으로 균형 잡아 더 나은 실시간 의사결정을 이끈다.
  • IL-DQN은 표 형태의 IL-Q에 비해 고차원 상태 공간에서 더 뛰어난 학습 안정성을 보였다.
  • VC-EXH는 전체 통신 없이 가상 컨트롤러를 사용해 에이전트 행동을 조율함으로써 정보 교환 오버헤드를 감소시켰다.
  • 이 알고리즘들은 시스템 지연을 줄이고 시간에 따라 변화하는 무선 환경에서 강건성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.