[논문 리뷰] Deep Reinforcement Learning for URLLC data management on top of scheduled eMBB traffic
본 논문은 PPO 기반 DRL 에이전트를 통해 URLLC 트래픽을 수용하기 위해 eMBB 자원을 동적으로 puncture하는 방식을 제안하고, URLLC 대기 시간 및 신뢰도 제약을 충족한다.
With the advent of 5G and the research into beyond 5G (B5G) networks, a novel and very relevant research issue is how to manage the coexistence of different types of traffic, each with very stringent but completely different requirements. In this paper we propose a deep reinforcement learning (DRL) algorithm to slice the available physical layer resources between ultra-reliable low-latency communications (URLLC) and enhanced Mobile BroadBand (eMBB) traffic. Specifically, in our setting the time-frequency resource grid is fully occupied by eMBB traffic and we train the DRL agent to employ proximal policy optimization (PPO), a state-of-the-art DRL algorithm, to dynamically allocate the incoming URLLC traffic by puncturing eMBB codewords. Assuming that each eMBB codeword can tolerate a certain limited amount of puncturing beyond which is in outage, we show that the policy devised by the DRL agent never violates the latency requirement of URLLC traffic and, at the same time, manages to keep the number of eMBB codewords in outage at minimum levels, when compared to other state-of-the-art schemes.
연구 동기 및 목표
- 공유 자원 격자에서 URLLC와 eMBB 트래픽의 공존 문제를 다룬다.
- URLLC 지연을 위반하지 않으면서 URLLC 패킷의 전송 시점과 위치를 결정하는 DRL 기반 스케줄러를 개발한다.
- URLLC 스케줄링에 일부 여유를 허용하여 puncturing 정책 학습을 통해 eMBB에 대한 영향을 최소화한다.
- URLLC puncturing에 견딜 수 있도록 puncturing 허용치를 가진 eMBB 코드워드로 신뢰성을 모델링한다.
제안 방법
- 상태가 URLLC 큐, 지연 여유, eMBB 코드워드 단절(outages)을 포착하는 상태를 갖는 마코프 의사결정 프로세스로 시스템을 모델링한다.
- 전송 의사결정을 학습하기 위해 정책 그래디언트 DRL 방법인 Proximal Policy Optimization (PPO)을 사용한다.
- URLLC 전송을 위한 주파수 자원을 선택하거나 미니슬롯에서 전송하지 않는 것을 선택하는 형태로 행동을 표현한다.
- eMBB 중단과 URLLC 지연 위반을 페널티로 부여하는 보상을 정의하여 두 가지 슬라이스의 균형을 맞춘다.
- PPO를 위한 별도의 정책 네트워크와 가치 네트워크를 갖춘 신경망 아키텍처를 제시한다.
실험 결과
연구 질문
- RQ1DRL 기반 스케줄러가 URLLC 지연 요건을 위반하지 않으면서 eMBB 자원을 puncture하여 URLLC를 수용할 수 있는가?
- RQ2PPO로 학습된 에이전트가 휴리스틱(heuristic) 스킴에 비해 URLLC 지연 보장과 eMBB 중단율에서 어떤 차이를 보이는가?
- RQ3학습된 정책이 서로 다른 URLLC 도착률과 코드워드 puncturing 구성에 대해 일반화되는가?
주요 결과
- PPO 에이전트는 평가된 URLLC 도착률에서 전체 보상 측면에서 휴리스틱 스킴을 능가한다.
- PPO 정책은 eMBB 코드워드 중단을 최소화하면서 URLLC 지연 제약을 만족시킨다.
- 학습된 정책은 재학습 없이도 서로 다른 에피소드 길이와 코드워드 분포에 일반화되는 것을 시연한다.
- 무작위 스킴은 지연 위반으로 인해 때때로 중단율이 더 낮아 보일 수 있지만, PPO는 이를 피한다.
- PPO는 코드워드가 이질적인 puncturing 허용도(C_w in {0,1})를 가질 때도 강력한 성능을 유지한다.
- 결과는 재학습 없이도 더 긴 시선 horizon으로의 확장 가능성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.