[논문 리뷰] Multi-Agent Reinforcement Learning for Joint Channel Assignment and Power Allocation in Platoon-Based C-V2X Systems.
이 논문은 플atoon 기반 C-V2X 시스템에서 복수의 채널 할당 및 전력 할당을 위한 다중 에이전트 강화학습(MARL) 방법을 제안한다. 여기서 각 플atoon 리더는 국소 채널 상태를 기반으로 하위대역 및 전력 선택을 최적화하기 위해 독립된 에이전트로 작동하며, 더블 딥 Q-학습(DDQN)을 사용한다. 이 방법은 전수 검색에 비해 거의 최적의 성능를 달성하면서도 낮은 지연 시간을 갖는 V2V 신뢰성과 V2I 합산 속도를 극대화한다.
We consider the problem of joint channel assignment and power allocation in underlaid cellular vehicular-to-everything (C-V2X) systems where multiple vehicle-to-infrastructure (V2I) uplinks share the time-frequency resources with multiple vehicle-to-vehicle (V2V) platoons that enable groups of connected and autonomous vehicles to travel closely together. Due to the nature of fast channel variant in vehicular environment, traditional centralized optimization approach relying on global channel information might not be viable in C-V2X systems with large number of users. Utilizing a reinforcement learning (RL) approach, we propose a distributed resource allocation (RA) algorithm to overcome this challenge. Specifically, we model the RA problem as a multi-agent system. Based solely on the local channel information, each platoon leader, who acts as an agent, collectively interacts with each other and accordingly selects the optimal combination of sub-band and power level to transmit its signals. Toward this end, we utilize the double deep Q-learning algorithm to jointly train the agents under the objectives of simultaneously maximizing the V2I sum-rate and satisfying the packet delivery probability of each V2V link in a desired latency limitation. Simulation results show that our proposed RL-based algorithm achieves a close performance compared to that of the well-known exhaustive search algorithm.
연구 동기 및 목표
- 중앙집중식 최적화가 비현실적인 대규모 C-V2X 시스템에서 동적인 빠른 fading 차량 채널 문제를 해결하기 위해.
- 전체 채널 상태 정보가 필요하지 않은 분산형 실시간 자원 할당을 가능하게 하기 위해.
- 지연 시간 제약 조건 하에서 V2I 합산 속도를 극대화하고 V2V 신뢰성 있는 통신을 보장하기 위해.
- 강화학습을 활용한 확장 가능한 솔루션을 플atoon 기반 차량 네트워크에 설계하기 위해.
제안 방법
- 각 플atoon 리더를 독립된 에이전트로 간주하여 자원 할당 문제를 다중 에이전트 강화학습 시스템으로 모델링한다.
- 에이전트를 분산 방식으로 학습하기 위해 더블 딥 Q-학습(DDQN)을 사용하며, 국소 채널 상태 정보에만 의존한다.
- 에이전트의 전송에 대해 하위대역과 전력 수준의 조합으로 행동 공간을 정의한다.
- 지연 시간 제약 조건 하에서 V2I 합산 속도 극대화와 V2V 패킷 전달 확률을 균형 잡는 보상 함수를 설정한다.
- 에이전트를 환경과의 상호작용을 통해 훈련시키며, 경험 재현과 타겟 네트워크를 사용하여 Q-값을 업데이트함으로써 안정성을 향상시킨다.
- 국소 의사결정을 통해 빠르게 변화하는 차량 환경에 적응하고 확장 가능한 성능을 확보한다.
실험 결과
연구 질문
- RQ1분산형 다중 에이전트 강화학습 접근법이 대규모 C-V2X 시스템에서 통합 채널 할당 및 전력 할당을 효과적으로 처리할 수 있는가?
- RQ2제안된 MARL 방법은 V2I 합산 속도와 V2V 신뢰성 측면에서 중앙집중식 전수 검색에 비해 얼마나 우수한 성능를 보이는가?
- RQ3국소 채널 상태 정보만으로도 빠르게 변하는 차량 환경에서 고성능 자원 할당을 지원할 수 있는가?
- RQ4더블 딥 Q-학습 프레임워크는 동적인 플atoon 기반 C-V2X 환경에서 안정성과 수렴성을 유지하는가?
주요 결과
- 제안된 MARL 기반 알고리즘은 전수 검색 알고리즘(최적으로 간주됨)과 매우 유사한 V2I 합산 속도 성능를 달성한다.
- 알고리즘은 지정된 지연 시간 제약 조건 내에서 각 V2V 링크의 요구되는 패킷 전달 확률을 성공적으로 유지한다.
- 더블 딥 Q-학습의 사용으로 차량 채널의 동적이고 비정상적인 특성에도 불구하고 안정적이고 효율적인 훈련이 가능해졌다.
- 분산형 접근법은 전체 채널 상태 정보가 필요 없게 하여 확장성과 실시간 적용 가능성을 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.