Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning Framework for Server Placement and Workload Allocation in Multi-Access Edge Computing

Anahita Mazloomi, Hani Sami|arXiv (Cornell University)|2022. 02. 21.
IoT and Edge/Fog Computing인용 수 4
한 줄 요약

이 논문은 네트워크 지연과 서버 수를 최소화하기 위해 다중접근 엣지 컴퓨팅(MEC)에서 엣지 서버 위치 결정과 기지국 할당을 동시에 최적화하기 위한 새로운 강화학습 프레임워크인 TDMC/QMC를 제안한다. 최적화된 상태/행동 공간과 페널티 함수를 갖춘 효율적인 마르코프 결정 과정(MDP)을 설계함으로써 안정적인 시간차 학습(TD(λ)))과 Q-학습을 가능하게 하여 실제 상하이 데이터셋에서 벤치마크를 능가하는 비용 절감 성능을 달성한다.

ABSTRACT

Cloud computing is a reliable solution to provide distributed computation power. However, real-time response is still challenging regarding the enormous amount of data generated by the IoT devices in 5G and 6G networks. Thus, multi-access edge computing (MEC), which consists of distributing the edge servers in the proximity of end-users to have low latency besides the higher processing power, is increasingly becoming a vital factor for the success of modern applications. This paper addresses the problem of minimizing both, the network delay, which is the main objective of MEC, and the number of edge servers to provide a MEC design with minimum cost. This MEC design consists of edge servers placement and base stations allocation, which makes it a joint combinatorial optimization problem (COP). Recently, reinforcement learning (RL) has shown promising results for COPs. However, modeling real-world problems using RL when the state and action spaces are large still needs investigation. We propose a novel RL framework with an efficient representation and modeling of the state space, action space and the penalty function in the design of the underlying Markov Decision Process (MDP) for solving our problem.

연구 동기 및 목표

  • MEC에서 네트워크 지연을 최소화하고 서버 수를 줄이기 위해 엣지 서버 위치 결정과 기지국 할당을 동시에 최적화하기 위한 것이다.
  • 복잡한 상태 및 행동 공간을 가진 대규모 실세계 조합 최적화 문제(COPs)에 강화학습(RL)을 적용하는 데 도전 과제를 극복하기 위한 것이다.
  • 안정적인 TD(λ) 및 Q-학습 학습을 가능하게 하기 위해 정밀한 상태 표현, 행동 공간 모델링, 페널티 함수를 갖춘 효율적인 마르코프 결정 과정(MDP)을 설계하기 위한 것이다.
  • 전체 네트워크 설계 비용을 최소화하는 데 있어 TDMC 및 QMC 알고리즘의 성능을 K-means, GA, DQN과 같은 벤치마크와 비교 평가하기 위한 것이다.
  • 학습 수렴성과 해 품질에 영향을 미치는 초기화수 α와 γ의 영향을 조사하기 위한 것이다.

제안 방법

  • 기지국 위치, 서버 가용성, 워크로드 분포를 모두 반영하는 압축된 상태 공간 표현을 갖춘 맞춤형 MDP 수식을 제안한다.
  • 에이전트가 이산적이고 조합적인 방식으로 서버 위치 결정과 기지국 할당을 선택할 수 있도록 동적 행동 공간을 정의한다.
  • 네트워크 지연과 서버 수를 균형 있게 조정하여 비용 최소화 해를 향해 학습을 이끌어내는 다목적 페널티 함수를 도입한다.
  • 유용성 추정치 근사에서 과대평가 편향을 줄이고 학습을 안정화하기 위해 유전성 추적(eligibility traces)을 사용하는 TD(λ)와 Q-학습(QMC, λ=0일 때)을 활용한다.
  • 실제 상하이 통신 데이터를 활용해 기지국 및 요청 분포를 현실적으로 시뮬레이션하여 학습 및 평가에 사용한다.
  • 딥 Q-학습(DQN)을 통해 탭류 Q-학습과의 성능 대비를 평가함으로써, 이 MDP 설계에서는 비선형 근사가 불필요하고 해를 악화시킬 수 있음을 밝혀낸다.

실험 결과

연구 질문

  • RQ1대규모 상태 및 행동 공간을 가진 MEC 환경에서 엣지 서버 위치 결정과 기지국 할당 문제를 효과적으로 해결할 수 있는 강화학습 프레임워크가 존재하는가?
  • RQ2이 조합 최적화 문제(COP)에서 상태 공간, 행동 공간, 페널티 함수의 설계가 TD(λ) 및 Q-학습의 수렴성과 성능에 어떤 영향을 미치는가?
  • RQ3이 MEC 환경에서 전체 네트워크 비용을 최소화하기 위해 학습률(α)과 할인 요소(γ)의 최적 설정은 무엇인가?
  • RQ4딥 Q-학습(DQN)이 이 문제에서 탭류 Q-학습을 능가하는가, 아니면 비선형 함수 근사가 불안정성과 열악한 정책을 유발하는가?
  • RQ5제안된 TDMC 및 QMC 알고리즘은 K-means, GA, 무작위 할당과 같은 전통적 벤치마크와 비교해 비용, 지연, 서버 수 측면에서 어떻게 성능을 냈는가?

주요 결과

  • TDMC 및 QMC는 GA 및 K-means를 포함한 모든 벤치마크를 능가하여 총 네트워크 비용을 최소화하며, QMC가 성능에서 略으로 약간 우수하다.
  • α=0.4 및 γ=0.9일 때 도달한 최소 비용은 2967.9766로, 테스트한 모든 초기화수 조합 중에서 가장 낮았다.
  • DQN은 수렴하거나 안정화되지 않아 TDMC 및 QMC보다 더 높고 변동성이 큰 비용을 기록했으며, 이는 이 문제에서 탭류 방법이 유리하고 비선형 근사는 불필요하기 때문이다.
  • 압축된 상태 표현과 잘 설계된 페널티 함수를 포함한 효율적인 MDP 설계 덕분에, 문제의 대규모 성격에도 불구하고 안정적인 학습과 수렴이 가능했다.
  • TDMC/QMC를 통한 지연과 서버 수의 동시 최적화는 K-means나 Top-K처럼 단일 목표만 최적화하는 방법보다 더 우수한 트레이드오프를 달성했다.
  • 초기화수 α와 γ가 학습 성능에 상당한 영향을 미친다는 점이 확인되었으며, α=0.4 및 γ=0.9가 수렴 속도와 해 품질의 최적 균형을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.