Skip to main content
QUICK REVIEW

[논문 리뷰] Online Service Migration in Mobile Edge with Incomplete System Information: A Deep Recurrent Actor-Critic Learning Approach

Jin Wang, Jia Hu|arXiv (Cornell University)|2020. 12. 16.
IoT and Edge/Fog Computing참고 문헌 29인용 수 4
한 줄 요약

이 논문은 부족한 시스템 정보 하에서 모바일 엣지 컴퓨팅 환경에서 온라인 서비스 마이그레이션을 위한 사용자 중심의 딥 강화학습 방법인 DRACM을 제안한다. 문제를 부분 관측 마르코프 결정 과정(POMDP)으로 모델링하고, 새로운 LSTM-임bedding 인코더와 클리핑된 서rogate 오프-폴리시 액터-크리틱 알고리즘을 사용함으로써, 다양한 실제 이동성 시나리오에서 안정적인 훈련과 거의 최적의 성능을 달성한다.

ABSTRACT

Multi-access Edge Computing (MEC) is an emerging computing paradigm that extends cloud computing to the network edge to support resource-intensive applications on mobile devices. As a crucial problem in MEC, service migration needs to decide how to migrate user services for maintaining the Quality-of-Service when users roam between MEC servers with limited coverage and capacity. However, finding an optimal migration policy is intractable due to the dynamic MEC environment and user mobility. Many existing studies make centralized migration decisions based on complete system-level information, which is time-consuming and also lacks desirable scalability. To address these challenges, we propose a novel learning-driven method, which is user-centric and can make effective online migration decisions by utilizing incomplete system-level information. Specifically, the service migration problem is modeled as a Partially Observable Markov Decision Process (POMDP). To solve the POMDP, we design a new encoder network that combines a Long Short-Term Memory (LSTM) and an embedding matrix for effective extraction of hidden information, and further propose a tailored off-policy actor-critic algorithm for efficient training. The extensive experimental results based on real-world mobility traces demonstrate that this new method consistently outperforms both the heuristic and state-of-the-art learning-driven algorithms and can achieve near-optimal results on various MEC scenarios.

연구 동기 및 목표

  • 부족한 시스템 수준의 정보 하에서 다중접근 엣지 컴퓨팅(MEC) 환경에서 온라인 서비스 마이그레이션의 과제를 해결한다.
  • 동적인 이동 환경에서 정보가 완전한 중심집중식 접근 방식의 확장성 및 지연 한계를 극복한다.
  • 모바일 사용자가 인간 전문 지식을 최소로 요구하면서도 효과적인 마이그레이션 결정을 자율적으로 내릴 수 있도록 분산형, 모델 기반 학습 방법을 개발한다.
  • 연속 상태 공간과 동적인 사용자 이동성을 가진 복잡한 MEC 환경에서 훈련을 안정화하고 성능을 향상시킨다.
  • 실시간 온라인 마이그레이션 결정을 가능하게 하기 위해 오프라인 정책 훈련을 수행하면서 실시간 MEC 환경과의 직접 상호작용을 최소화한다.

제안 방법

  • 복잡한 시스템 동역학과 정보 부족을 반영하기 위해 서비스 마이그레이션 문제를 부분 관측 마르코프 결정 과정(POMDP)으로 공식화한다.
  • 이력 데이터에서의 부분 관측치로부터 은닉 상태 표현을 추출하기 위해 장기 순환 신경망(LSTM)과 임베딩 행렬을 조합한 하이브리드 인코더 네트워크를 설계한다.
  • 훈련 안정성과 샘플 효율성을 향상시키기 위해 클리핑된 서rogate 목적 함수를 갖춘 맞춤형 오프-폴리시 액터-크리틱 강화학습 알고리즘을 제안한다.
  • 정책 훈련(오프라인)과 추론(온라인)을 분리함으로써 실시간 마이그레이션 결정을 내릴 수 있도록 하며, 실시간 MEC 시스템과의 직접 상호작용을 피한다.
  • 원시 환경 관측치에서 직접 정책을 학습하기 위해 엔드 투 엔드 딥 강화학습을 활용하여 수작업 히ュ리스틱에 대한 의존도를 최소화한다.
  • 실제 이동성 트레이스를 활용해 훈련 및 평가를 수행함으로써, 다양한 이동 패턴과 MEC 구현 환경에서의 일반화 능력을 보장한다.

실험 결과

연구 질문

  • RQ1모델 기반의 사용자 중심 딥 강화학습 접근 방식은 정보가 불완전한 MEC 환경에서 온라인 서비스 마이그레이션을 효과적으로 처리할 수 있는가?
  • RQ2제안된 DRACM 방법은 QoS 및 마이그레이션 비용 측면에서 히ュ리스틱 및 최신 기술 기반 기준 대비 어떻게 성능을 내는가?
  • RQ3POMDP 환경에서 LSTM과 임베딩 레이어의 통합이 부분 관측 이력의 표현을 얼마나 향상시키는가?
  • RQ4오프-폴리시 액터-크리틱 프레임워크에서 클리핑된 서rogate 목적 함수의 사용이 연속 상태 MEC 환경에서 기존 Q-학습 기반 방법보다 더 안정적이고 효율적인 훈련을 이끌어내는가?
  • RQ5DRACM 프레임워크는 실시간 MEC 환경과의 직접 상호작용을 최소화하면서도 거의 최적의 성능을 달성할 수 있는가?

주요 결과

  • DRACM는 다양한 실제 이동성 시나리오에서 서비스 마이그레이션 비용과 QoS 유지 측면에서 히ュ리스틱 및 최신 기술 기반 기준 모두를 일관되게 능가한다.
  • 이 방법은 다양한 MEC 배포 구성 및 사용자 이동 패턴 간 강력한 일반화 능력을 보이며 거의 최적의 성능를 달성한다.
  • LSTM-임베딩 인코더의 사용은 정보가 불완전한 관측 이력에서 은닉된 시간적 의존성을 효과적으로 추출하여 의사결정 정확도를 향상시킨다.
  • 오프-폴리시 액터-크리틱 알고리즘에서 클리핑된 서rogate 목적 함수는 독립적 Q-학습 기반 기준 대비 훨씬 더 안정적인 훈련을 이끌어낸다.
  • 정책 네트워크의 오프라인 훈련은 낮은 지연 시간으로 온라인 추론을 가능하게 하여, 이론적 실시간 구현에 실용성을 부여한다.
  • 이 프레임워크는 훈련과 온라인 운영을 성공적으로 분리함으로써 실시간 MEC 환경과의 직접 상호작용으로 인한 비용과 위험을 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.