Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Agent Deep Reinforcement Learning enabled Computation Resource Allocation in a Vehicular Cloud Network

Shilin Xu, Caili Guo|arXiv (Cornell University)|2020. 08. 14.
Vehicular Ad Hoc Networks (VANETs)인용 수 6
한 줄 요약

이 논문은 인프라가 없는 차량 클라우드 네트워크에서 다중 에이전트 강화학습(MADDPG) 기반의 계산 자원 할당 기법을 제안하며, 동적 오프로딩을 위한 분산 가상 클라우드 네트워크(VCN)를 활용한다. 문제를 마르코프 게임으로 모델링하고 중심화된 훈련과 분산 실행을 통해 비정상적인 환경에서도 효율적이고 실시간 자원 할당을 달성한다. 시뮬레이션을 통해 동적 차량 환경에서의 효과성을 확인하였다.

ABSTRACT

In this paper, we investigate the computational resource allocation problem in a distributed Ad-Hoc vehicular network with no centralized infrastructure support. To support the ever increasing computational needs in such a vehicular network, the distributed virtual cloud network (VCN) is formed, based on which a computational resource sharing scheme through offloading among nearby vehicles is proposed. In view of the time-varying computational resource in VCN, the statistical distribution characteristics for computational resource are analyzed in detail. Thereby, a resource-aware combinatorial optimization objective mechanism is proposed. To alleviate the non-stationary environment caused by the typically multi-agent environment in VCN, we adopt a centralized training and decentralized execution framework. In addition, for the objective optimization problem, we model it as a Markov game and propose a DRL based multi-agent deep deterministic reinforcement learning (MADDPG) algorithm to solve it. Interestingly, to overcome the dilemma of lacking a real central control unit in VCN, the allocation is actually completed on the vehicles in a distributed manner. The simulation results are presented to demonstrate our scheme's effectiveness.

연구 동기 및 목표

  • 중앙 집중식 인프라가 없는 애드혹 차량 네트워크에서 동적이고 분산된 계산 자원 할당 문제를 해결하기 위해.
  • 차량 클라우드 네트워크(VCN)에서 계산 자원의 시간에 따라 변하는 성질을 모델링하고 통계적 분포 특성을 분석하기 위해.
  • 차량 간 자원 가용성의 변동성에 적응하는 자원 인식 조합 최적화 목표를 설계하기 위해.
  • 극도로 동적인 차량 환경에서 실시간 자원 할당을 위한 확장 가능한 분산 솔루션을 개발하기 위해.
  • 다중 에이전트 환경의 비정상성에 대응하기 위해 중심화된 훈련과 분산 실행 프레임워크를 통해.

제안 방법

  • 다중 자율 차량 간 상호작용을 포착하기 위해 자원 할당 문제를 마르코프 게임으로 모델링하기 위해.
  • 마르코프 게임를 해결하고 자원 할당을 최적화하기 위해 다중 에이전트 딥 디터민리스틱 정책 그래디언트(MADDPG) 알고리즘을 제안하기 위해.
  • 비정상적인 다중 에이전트 환경에서 학습을 안정화하기 위해 중심화된 훈련과 분산 실행(CTDE) 프레임워크를 구현하기 위해.
  • 가용 계산 자원의 통계적 분포를 고려하는 자원 인식 조합 최적화 목표를 설계하기 위해.
  • 근처 차량들 간에 분산 가상 클라우드 네트워크(VCN)를 형성하여 피어 투 피어 계산 오프로딩을 가능하게 하기 위해.
  • 개별 차량에서 정책 실행을 완전히 분산화하여 중심 제어 장치에 의존하지 않기 위해.

실험 결과

연구 질문

  • RQ1중앙 집중식 인프라가 없는 분산 차량 클라우드 네트워크에서 계산 자원을 어떻게 효율적으로 할당할 수 있는가?
  • RQ2시간에 따라 변하는 계산 자원 가용성이 차량 네트워크의 자원 할당 성능에 어떤 영향을 미치는가?
  • RQ3비정상적인 차량 환경에서 다중 에이전트 강화학습을 효과적으로 적용하여 안정성과 수렴성을 유지할 수 있는가?
  • RQ4중심화된 훈련과 분산 실행 프레임워크는 차량 자원 할당에서 학습 효율성과 확장성 향상에 기여하는가?
  • RQ5제안된 MADDPG 기반 기법은 자원 활용도와 오프로딩 성공률 측면에서 기준 대비 방법보다 어떻게 비교되는가?

주요 결과

  • 제안된 MADDPG 기반 기법은 동적 차량 네트워크의 비정상적 환경에서도 안정적인 학습과 수렴을 달성한다.
  • 자원 인식 조합 최적화 목표는 가용 계산 자원의 통계적 분포에 효과적으로 적응한다.
  • 중심화된 훈련과 분산 실행 프레임워크는 정책 실행에서 완전한 분산성을 유지하면서도 높은 성능을 달성한다.
  • 시뮬레이션 결과는 기준 방법 대비 향상된 자원 활용도와 오프로딩 효율성을 입증한다.
  • 이 기법은 중심 제어 장치가 필요 없이 실시간으로 분산 계산 오프로딩을 성공적으로 구현한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.