Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning Based Multi-Access Edge Computing Schedule for Internet of Vehicle

Xiaoyu Dai, Kaoru Ota|arXiv (Cornell University)|2022. 02. 15.
IoT and Edge/Fog Computing인용 수 5
한 줄 요약

이 논문은 드론 기반 인터넷 오브 차 things (IoV) 네트워크에서 다중접근 엣지 컴퓨팅(MEC) 스케줄링을 최적화하기 위해 다중 에이전트 그래프 컨볼루션 딥 강화학습(M-AGCDRL) 알고리즘을 제안한다. 그래프 어텐션 네트워크를 활용한 다중 에이전트 협업과 액터-크리틱 딥 강화학습을 융합함으로써, 표준 Q-학습 및 액터-크리틱 기반 알고리즘 대비 더 빠른 수렴 속도와 향상된 경험 품질(QoE)을 달성하며, 오프로딩 성능은 최대 20% 향상되고 동적 트래픽 조건 하에서도 안정적인 QoS를 확보한다.

ABSTRACT

As intelligent transportation systems been implemented broadly and unmanned arial vehicles (UAVs) can assist terrestrial base stations acting as multi-access edge computing (MEC) to provide a better wireless network communication for Internet of Vehicles (IoVs), we propose a UAVs-assisted approach to help provide a better wireless network service retaining the maximum Quality of Experience(QoE) of the IoVs on the lane. In the paper, we present a Multi-Agent Graph Convolutional Deep Reinforcement Learning (M-AGCDRL) algorithm which combines local observations of each agent with a low-resolution global map as input to learn a policy for each agent. The agents can share their information with others in graph attention networks, resulting in an effective joint policy. Simulation results show that the M-AGCDRL method enables a better QoE of IoTs and achieves good performance.

연구 동기 및 목표

  • 제한된 지상 기지국 용량을 가진 고속 이동성의 IoV 환경에서 동적이고 저지연성, 고신뢰성 무선 통신을 해결하기 위해.
  • 드론에 탑재된 MEC 서버를 통한 효율적 컴퓨팅 오프로딩을 통해 차량의 경험 품질(QoE)을 향상시키기 위해.
  • 변동하는 차량 밀도와 이동 패턴에 적응하는 다수의 드론을 위한 확장 가능하고 탈중앙화된 스케줄링 메커니즘을 개발하기 위해.
  • 단일 드론 시스템의 한계와 고성능 및 스펙트럼 수요가 높은 밀도의 IoV 환경에서의 전통적 자원 할당 방식의 한계를 극복하기 위해.

제안 방법

  • M-AGCDRL 알고리즘은 각 드론이 로컬 관측치와 저해상도 전역 지ap을 접근 가능한 다중 에이전트 딥 강화학습 프레임워크를 사용한다.
  • 에이전트 간 관계를 모델링하고 그래프 어텐션 메커니즘을 통해 정보 공유를 가능하게 하기 위해 그래프 컨볼루션 네트워크(GCNs)를 활용하여 공동 정책 학습을 향상시킨다.
  • 정책 네트워크는 이점 기반 가치 추정과 정책 기반 기울기 업데이트를 조합한 액터-크리틱 아키텍처로 구현되어 학습 안정성 향상과 수렴성 향상을 도모한다.
  • 중앙 집중식 학습과 분산 실행(CTDE) 패러다임을 채택하여 에이전트들이 협업 행동을 학습하면서 추론 시 독립적으로 행동할 수 있도록 한다.
  • 상태 공간은 차량 위치, 작업 큐 길이, 드론 위치를 포함하며, 행동 공간은 작업 오프로딩 결정과 드론 경로 조정을 제어한다.
  • 상태 공간은 차량 위치, 작업 큐 길이, 드론 위치를 포함하고, 행동 공간은 작업 오프로딩 결정과 드론 경로 조정을 제어한다. 알고리즘은 QoE(MOS 기반 모델링), 오프로딩 성공률, 에너지 효율성을 균형 잡는 보상 함수를 사용하여 훈련되며, 초모델 하이퍼파rameter는 그리드 서치를 통해 최적화된다.

실험 결과

연구 질문

  • RQ1고속 이동성과 높은 차량 밀도를 가진 동적 IoV 환경에서 다중 드론 MEC 스케줄링을 어떻게 최적화하여 QoE를 극대화할 수 있는가?
  • RQ2드론 기반 IoV 네트워크에서 그래프 기반 다중 에이전트 간 통신을 통합할 경우, 독립적인 에이전트 대비 협업 및 성능 향상 정도는 어느 정도인가?
  • RQ3M-AGCDRL 알고리즘이 합성 및 실제 도시 교통 시나리오에서 표준 Q-학습 및 액터-크리틱 기반 알고리즘 대비 수렴 속도와 오프로딩 성능에서 어떤 차이를 보이는가?
  • RQ4밀도 높은 IoV 네트워크에서 오프로딩 성과와 자원 오버헤드를 균형 잡기 위해 최적의 드론 수는 얼마인가?
  • RQ5드론 및 차량 수가 증가함에 따라 MOS 기반 안정적인 QoS를 유지하는 시스템의 메커니즘은 무엇인가?

주요 결과

  • M-AGCDRL 알고리즘은 격자 세계 및 실제 사도리 시 도시 교통 시뮬레이션 모두에서 표준 Q-학습 및 액터-크리틱 방법 대비 더 빠른 수렴 속도와 더 높은 누적 보상 총합을 달성한다.
  • 제안된 방법은 기준 알고리즘 대비 오프로딩 성능을 최대 20% 향상시키며, 드론 수가 증가함에 따라 안정적이고 높은 오프로딩 비율을 유지한다.
  • 10대의 드론을 사용할 경우 M-AGCDRL 방법은 약 92%의 안정된 오프로딩 비율을 유지하며, 표준 Q-학습 기반 알고리즘의 78% 비율을 크게 능가한다.
  • M-AGCDRL 하에서 평균 MOS(Mean Opinion Score)는 드론 수 증가에 따라 점진적으로 증가하여 최대 5.0 중 4.6에 도달하며, 운전자에게 높은 QoE를 제공함을 나타낸다.
  • 고밀도 차량 환경(최대 100대)에서도 효과적인 드론 경로 및 작업 스케줄링 덕분에 낮은 지연과 높은 신뢰성을 유지하며 뛰어난 내구성을 입증한다.
  • 알고리즘은 약 1,000 에피소드 후에 수렴하며, 1,500 에피소드 이후로 보상 변동성이 크게 감소하여 안정적인 정책 학습을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.