Skip to main content
QUICK REVIEW

[논문 리뷰] Com-DDPG: A Multiagent Reinforcement Learning-based Offloading Strategy for Mobile Edge Computing

Honghao Gao, Xuejie Wang|arXiv (Cornell University)|2020. 12. 09.
IoT and Edge/Fog Computing참고 문헌 44인용 수 9
한 줄 요약

이 논문은 작업 의존성, 하위작업 우선순위 지정, 그리고 LSTM 및 양방향 RNN를 활용하여 통신 및 의사결정을 향상시키는 다중 에이전트 강화학습 기반의 모바일 엣지 컴퓨팅을 위한 Com-DDPG를 제안한다. Alibaba 클러스터 데이터셋에서 DQN, DRQN 및 엣지 기반 기준선보다 에너지 소비와 로드 밸런싱 측면에서 뛰어난 성능을 달성하며, 작업 부하가 증가함에 따라 지연 시간이 감소한다.

ABSTRACT

The development of mobile services has impacted a variety of computation-intensive and time-sensitive applications, such as recommendation systems and daily payment methods. However, computing task competition involving limited resources increases the task processing latency and energy consumption of mobile devices, as well as time constraints. Mobile edge computing (MEC) has been widely used to address these problems. However, there are limitations to existing methods used during computation offloading. On the one hand, they focus on independent tasks rather than dependent tasks. The challenges of task dependency in the real world, especially task segmentation and integration, remain to be addressed. On the other hand, the multiuser scenarios related to resource allocation and the mutex access problem must be considered. In this paper, we propose a novel offloading approach, Com-DDPG, for MEC using multiagent reinforcement learning to enhance the offloading performance. First, we discuss the task dependency model, task priority model, energy consumption model, and average latency from the perspective of server clusters and multidependence on mobile tasks. Our method based on these models is introduced to formalize communication behavior among multiple agents; then, reinforcement learning is executed as an offloading strategy to obtain the results. Because of the incomplete state information, long short-term memory (LSTM) is employed as a decision-making tool to assess the internal state. Moreover, to optimize and support effective action, we consider using a bidirectional recurrent neural network (BRNN) to learn and enhance features obtained from agents' communication. Finally, we simulate experiments on the Alibaba cluster dataset. The results show that our method is better than other baselines in terms of energy consumption, load status and latency.

연구 동기 및 목표

  • 기존의 오프로딩 전략이 작업 간 의존성과 다중 사용자 자원 경쟁을 다루는 데에 한계가 있음을 해결하기 위해.
  • 실제 MEC 환경을 반영하기 위해 서버 클러스터에서 작업 의존성, 우선순위, 에너지 소비 및 지연 시간을 모델링하기 위해.
  • 부분 관측 가능성과 동적 워크로드 하에서 협업 의사결정을 지원하는 다중 에이전트 강화학습 프레임워크를 개발하기 위해.
  • 내부 상태 추적을 위한 LSTM과 에이전트 간 통신 특징 학습을 위한 양방향 RNN을 통합하여 오프로딩 성능을 향상시키기 위해.

제안 방법

  • 프레임워크는 오프로딩 결정을 이끌기 위해 형식적 작업 및 서버 클러스터 표현을 사용하여 작업 의존성과 우선순위를 모델링한다.
  • 연속적 행동 공간을 허용하는 다중 에이전트 환경에서의 딥 디터미니스틱 정책 그래เดียน트(DDPG)를 적용하여 서버 선택을 가능하게 한다.
  • 부분 관측 가능성 하에서 불완전한 관측치로부터 내부 상태를 유지하고 추론하기 위해 LSTM을 사용하여 의사결정 성능을 향상시킨다.
  • 에이전트 간 통신 특징을 처리하기 위해 양방향 RNN(BRNN)을 활용하여 표현 학습 및 협업 성능을 향상시킨다.
  • 강화학습 학습 과정에서 에너지 소비, 로드 상태, 지연 시간, 네트워크 사용량을 다목적 보상으로 통합한다.
  • 다양한 워크로드 하에서 100개의 작업을 대상으로 Alibaba 클러스터 데이터셋에서 실험을 수행한다.

실험 결과

연구 질문

  • RQ1다중 에이전트 MEC 오프로딩 프레임워크에서 작업 의존성과 하위작업 통합을 효과적으로 모델링할 수 있는 방법은 무엇인가?
  • RQ2부분 관측 가능성 하에서 에이전트 간 소통은 오프로딩 결정 향상에 어떤 역할을 하는가?
  • RQ3LSTM과 BRNN를 통합함으로써 다이나믹한 MEC 환경에서 의사결정 성능이 어떻게 향상되는가?
  • RQ4증가하는 워크로드 하에서 Com-DDPG는 DQN, DRQN 및 엣지 기반 전략에 비해 에너지 효율성, 로드 밸런싱 및 지연 시간 측면에서 어떻게 비교되는가?
  • RQ5제안된 방법은 워크로드 증가에 따라 지연 시간이 감소하는 방향으로 확장 가능하고 적응 가능한 오프로딩을 달성할 수 있는가?

주요 결과

  • Com-DDPG는 평가된 모든 알고리즘 중에서 에너지 소비와 로드 상태 측면에서 최고의 성능을 기록하며, DQN, DRQN 및 엣지 기반 전략보다 뚜렷하게 뛰어나다.
  • Com-DDPG의 지연 시간은 작업 수가 증가함에 따라 감소하는 경향을 보이며, 이는 스케일러빌리티와 적응형 성능 향상을 시사한다. 반면 다른 방법들은 지연 시간이 증가하거나 일정하게 유지된다.
  • 특히 고부하 상황에서 최적화된 서버 활용도와 중복 전송 감소 덕분에 Com-DDPG는 DQN 및 DRQN보다 에너지 소비를 더 효과적으로 줄인다.
  • 히트맵 분석 결과, Com-DDPG는 DQN 및 DRQN이 일부 자주 사용되는 서버에 집중하는 것과 달리, 서버 간 오프로딩을 더 균일하게 분배함을 보여준다.
  • BRNN와 LSTM의 통합은 에이전트 간 소통 및 내부 상태에서의 특징 추출을 향상시켜 더 견고하고 조율된 오프로딩 결정을 가능하게 한다.
  • 로컬 실행 전략은 지연 시간과 네트워크 사용량 측면에서 가장 우수한 성능를 보였지만, 에너지 소비가 가장 열악하여, Com-DDPG가 이 상호 갈등을 효과적으로 해결하고 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.