Skip to main content
QUICK REVIEW

[논문 리뷰] Traffic Prediction and Random Access Control Optimization: Learning and Non-learning based Approaches

Nan Jiang, Yansha Deng|arXiv (Cornell University)|2020. 02. 18.
IoT Networks and Protocols참고 문헌 14인용 수 7
한 줄 요약

이 논문은 순환 신경망(RNN)을 통한 교통량 예측과 딥 강화학습(DRL)을 통한 액세스 제어 설정을 분리함으로써 기존의 단일 단계 DRL 방법에 비해 훈련 효율성과 액세스 성능을 크게 향상시키는 이중 단계 협업 미리 훈련 및 학습(CPCL) 기반 최적화기를 제안한다. CPCL 방법은 4G/5G 네트워크에서 랜덤 액세스 제어에 대해 최대 100배 빠른 수렴 속도와 더 높은 성공 액세스 비율을 달성한다.

ABSTRACT

Random access schemes in modern wireless communications are generally based on the framed-ALOHA (f-ALOHA), which can be optimized by flexibly organizing devices' transmission and re-transmission. However, this optimization is generally intractable due to the lack of information about complex traffic generation statistics and the occurrence of the random collision. In this article, we first summarize the general structure of access control optimization for different random access schemes, and then review the existing access control optimization based on Machine Learning (ML) and non-ML techniques. We demonstrate that the ML-based methods can better optimize the access control problem compared with non-ML based methods, due to their capability in solving high complexity long-term optimization problem and learning experiential knowledge from reality. To further improve the random access performance, we propose two-step learning optimizers for access control optimization, which individually execute the traffic prediction and the access control configuration. In detail, our traffic prediction method relies on online supervised learning adopting Recurrent Neural Networks (RNNs) that can accurately capture traffic statistics over consecutive frames, and the access control configuration can use either a non-ML based controller or a cooperatively trained Deep Reinforcement Learning (DRL) based controller depending on the complexity of different random access schemes. Numerical results show that the proposed two-step cooperative learning optimizer considerably outperforms the conventional Deep Q-Network (DQN) in terms of higher training efficiency and better access performance.

연구 동기 및 목표

  • 대규모 IoT 및 5G 네트워크에서 동적이고 불확실한 교통량과 충돌 조건 하에서 랜덤 액세스 제어 최적화의 비가역성 문제를 해결하기 위해.
  • 단순화된 모델에 의존하고 고도의 복잡성과 실제 세계의 동적 특성에 대응하기 어려운 비학습 기반 방법의 한계를 극복하기 위해.
  • 느린 수렴 속도와 높은 계산 비용으로 인해 어려움을 겪는 단일 단계 딥 강화학습(DRL) 접근법을 개선하기 위해.
  • 교차 학습을 통한 교통량 예측과 제어 설정 구성의 협업 학습을 통해 온라인 적응과 더 나은 성능를 가능하게 하는 학습 기반 프레임워크를 개발하기 위해.

제안 방법

  • 이 방법은 이중 단계 학습 프레임워크를 사용한다: 먼저, RNN 기반의 온라인 지도 교통량 예측기가 연속 프레임에서 향후 교통량 부하를 추정한다.
  • 예측된 교통량을 사용해 액세스 제어 설정을 위한 DRL 에이전트를 사전 훈련함으로써 수렴 속도를 향상시킨다.
  • DRL 에이전트는 예측된 교통량에 기반해 실시간으로 액세스 제어 설정 매개변수(예: 액세스 클래스 차단 및 백오프 요소)를 구성한다.
  • RNN 훈련을 위한 오차 보정된 교통량 값을 추정하기 위해 별도의 DNN을 오프라인으로 사용하여 예측 정확도를 향상시킨다.
  • RNN과 DRL 에이전트는 협업하여 훈련되며, RNN이 DRL 에이전트에게 맥락을 제공함으로써 종단 간 학습 과제의 복잡성을 감소시킨다.
  • 이 프레임워크는 온라인 적응을 지원하며, 공유된 예측과 다중 에이전트를 사용해 다중 액세스 제어 매개변수로 확장 가능하다.

실험 결과

연구 질문

  • RQ1이중 단계 학습 접근법이 랜덤 액세스 제어의 훈련 효율성과 액세스 성능에서 단일 단계 DRL보다 뛰어나게 되는가?
  • RQ2예측과 제어 설정을 분리함으로써 수렴 속도와 최적화 품질에 어떤 영향을 미치는가?
  • RQ3예측된 교통량을 사용해 DRL 에이전트를 사전 훈련하는 것이 종단 간 훈련에 비해 학습 효율성을 얼마나 향상시키는가?
  • RQ4제안된 CPCL 프레임워크는 다중 제어 매개변수를 가진 복잡한 랜덤 액세스 방식(예: ACB & BO)에 효과적으로 적용될 수 있는가?
  • RQ5CPCL 기반 최적화기와 비머신러닝 및 기존 머신러닝 기반 방법 간 성공 액세스 비율과 계산 비용 측면에서의 비교는 어떠한가?

주요 결과

  • CPCL 기반 최적화기는 기존의 DRL 기반 최적화기 대비 최대 100배 빠른 수렴 속도를 달성하며, 수렴에 약 2 에피소드만 소요되는 반면 기존 방법은 170 에피소드가 필요하다.
  • CPCL 기반 최적화기는 훈련 효율성과 최종 액세스 성능 양면에서 DRL 기반 최적화기보다 뛰어나며, 에피소드당 평균 성공 액세스 장치 수가 더 높다.
  • DRL 에이전트의 사전 훈련은 수렴 속도를 크게 가속화하며, 제어 정책 학습에 예측된 교통량을 사전 지식으로 사용할 경우의 이점이 입증된다.
  • 이중 단계 접근법은 예측과 제어를 분리함으로써 종단 간 최적화 문제의 복잡성을 감소시켜 학습의 안정성과 효율성을 높인다.
  • CPCL 프레임워크는 동적 교통량에 대한 더 나은 적응성을 제공하며, 공유된 예측을 통해 다중 매개변수 액세스 제어 설정 구성도 용이하게 한다.
  • 수치적 결과는 CPCL 기반 최적화기가 기존의 비머신러닝 및 머신러닝 기반 방법보다 더 높은 성공 액세스 비율과 더 나은 확장성을 확보함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.