Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning for Scheduling in Cellular Networks

Jian Wang, Xu Chen|arXiv (Cornell University)|2019. 05. 15.
Advanced MIMO Systems Optimization참고 문헌 10인용 수 4
한 줄 요약

이 논문은 훈련 효율성과 성능 향상을 위해 전문 지식을 통합한 딥 강화학습(DRL) 기반 셰두링 기법을 제안한다. 기존의 비례 공정(PF) 셰두링 기법을 대체하는 대신, 저자들은 PF 알고리즘 또는 이중 DRL 에이전트로부터 학습하는 AI 셰두링 기법을 도입하여 직접 DRL 훈련에 비해 수렴 속도가 빠르고, 최적에 가까운 공정성-throughput 트레이드오프를 달성한다.

ABSTRACT

Integrating artificial intelligence (AI) into wireless networks has drawn significant interest in both industry and academia. A common solution is to replace partial or even all modules in the conventional systems, which is often lack of efficiency and robustness due to their ignoring of expert knowledge. In this paper, we take deep reinforcement learning (DRL) based scheduling as an example to investigate how expert knowledge can help with AI module in cellular networks. A simulation platform, which has considered link adaption, feedback and other practical mechanisms, is developed to facilitate the investigation. Besides the traditional way, which is learning directly from the environment, for training DRL agent, we propose two novel methods, i.e., learning from a dual AI module and learning from the expert solution. The results show that, for the considering scheduling problem, DRL training procedure can be improved on both performance and convergence speed by involving the expert knowledge. Hence, instead of replacing conventional scheduling module in the system, adding a newly introduced AI module, which is capable to interact with the conventional module and provide more flexibility, is a more feasible solution.

연구 동기 및 목표

  • 전문 지식이 무선 네트워크 스케줄링에서 DRL 훈련을 어떻게 향상시킬 수 있는지 조사하기 위해.
  • 직접 DRL 훈련과 이중 에이전트, 전문 지식 기반 훈련 방법을 비교하기 위해.
  • 기존 셰두링 기법을 대체하는 것보다 AI 셰두링 기법을 통합하는 것이 더 실현 가능할지 평가하기 위해.
  • 실제 기법들인 AMC 및 피드백을 포함한 현실적인 시뮬레이션 플랫폼을 개발하기 위해.
  • AI 셰두링 기법 통합이 안정성을 해치지 않으면서도 시스템의 유연성과 적응성을 향상시킬 수 있음을 입증하기 위해.

제안 방법

  • 실제 무선 네트워크 동역학, 즉 링크 어댑테이션, 피드백, 채널 변동성을 고려한 시뮬레이션 플랫폼을 구축하였다.
  • 세 가지 훈련 방법을 평가하였다: 직접 DRL 훈련, 상호 학습을 하는 이중 DRL 에이전트 훈련, PF 알고리즘을 사용한 전문 지식 전이.
  • DRL 에이전트는 320개의 유닛을 가진 완전 연결층과 ReLU 활성화 함수를 사용하는 듀얼링 DQN 아키텍처를 사용한다; 액터 네트워크에서는 소프트맥스가 사용된다.
  • 보상 함수는 가중 계수 α와 β를 사용하여 스루풋과 공정성을 균형 잡는다; 성능은 PF 기준선 대비 정규화된다.
  • 수렴성과 일반화를 향상시키기 위해 28개의 병렬 시뮬레이터를 사용하여 훈련을 수행한다.
  • PF 알고리즘이 전문 지식 전이 방법에서 DRL 에이전트를 이민 학습을 통해 안내하는 데 사용되는 기준 전문 정책으로 사용된다.

실험 결과

연구 질문

  • RQ1실제 제약 조건이 존재하는 현실적인 셀룰러 네트워크 환경에서 DRL이 스케줄링 정책을 효과적으로 학습할 수 있는가?
  • RQ2전문 지식(예: PF 알고리즘)을 통합할 경우 DRL 훈련의 수렴성과 성능에 어떤 영향을 미치는가?
  • RQ3이중 에이전트 훈련은 단일 에이전트 직접 학습에 비해 수렴성을 향상시키는가?
  • RQ4기존 PF 셰두링 기법이 활성 상태일 동안 AI 셰두링 기법을 온라인으로 훈련시킬 수 있는가? 이는 시스템 안정성을 보장하는가?
  • RQ5DRL 기반 스케줄링에서 스루풋과 공정성의 트레이드오프는 무엇이며, 이를 어떻게 최적화할 수 있는가?

주요 결과

  • 직접 DRL 훈련은 약 1000개의 업데이트 후에 수렴하지만, 비정적 채널 조건에서 PF 알고리즘의 공정성과는 격차를 보인다.
  • 서로를 상호 학습시키는 이중 학습은 약 2000개의 업데이트 후에 근사 최적 성능으로 수렴하며 局부 최적값을 피할 수 있지만, 훈련 속도는 느리다.
  • 전문 지식 전이 방법은 DRL 에이전트가 약 1000개의 업데이트 후에 근사 최적 성능으로 수렴하고, 약 4000개의 업데이트까지 도달하여 PF 성능을 완전히 재현한다.
  • 전문 지식 학습 방법은 훈련 속도와 최종 성능 사이의 최고의 균형을 달성하여, 직접 학습에 비해 수렴성과 공정성 면에서 뚜렷이 뛰어나다.
  • 결과는 기존 셰두링 기법에 AI 모듈을 통합하는 것이 대체하는 것보다 실현 가능하며, 안정성과 적응성을 확보할 수 있음을 지지한다.
  • 이 연구는 전문 지식을 DRL 훈련에 통합할 경우 무선 스케줄링에서 효율성과 성능 향상에 기여함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.