Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning for Delay-Oriented IoT Task Scheduling in Space-Air-Ground Integrated Network

Conghao Zhou, Wen Wu|arXiv (Cornell University)|2020. 10. 04.
UAV Applications and Optimization참고 문헌 40인용 수 10
한 줄 요약

이 논문은 우주-공중-지상 통합망(SAGIN)에서 지연 민감한 IoT 애플리케이션을 위한 딥 강화학습 기반 작업 스케줄링 기법(DOTS)을 제안한다. 여기서 무인 항공기(UAV)는 에너지 제약 하에서 처리 지연을 최소화하기 위해 근처 기지국 또는 위성에 작업을 오프로드한다. 이 방법은 지연과 에너지 소비를 균형 있게 조절하기 위해 위험 감수성 딥 Q-네트워크를 사용하며, 기준 방법 대비 지연을 최대 30% 감소시킨다. 또한 UAV의 에너지 한도를 충족시킨다.

ABSTRACT

In this paper, we investigate a computing task scheduling problem in space-air-ground integrated network (SAGIN) for delay-oriented Internet of Things (IoT) services. In the considered scenario, an unmanned aerial vehicle (UAV) collects computing tasks from IoT devices and then makes online offloading decisions, in which the tasks can be processed at the UAV or offloaded to the nearby base station or the remote satellite. Our objective is to design a task scheduling policy that minimizes offloading and computing delay of all tasks given the UAV energy capacity constraint. To this end, we first formulate the online scheduling problem as an energy-constrained Markov decision process (MDP). Then, considering the task arrival dynamics, we develop a novel deep risk-sensitive reinforcement learning algorithm. Specifically, the algorithm evaluates the risk, which measures the energy consumption that exceeds the constraint, for each state and searches the optimal parameter weighing the minimization of delay and risk while learning the optimal policy. Extensive simulation results demonstrate that the proposed algorithm can reduce the task processing delay by up to 30% compared to probabilistic configuration methods while satisfying the UAV energy capacity constraint.

연구 동기 및 목표

  • 공간-공중-지상 통합망(SAGIN) 내에서 지연 민감한 IoT 애플리케이션의 작업 처리 지연을 최소화하는 데 도전하는 것.
  • 작업 오프로딩을 위해 사용되는 무인 항공기(UAV)의 제한된 에너지 용량을 고려한 온라인 작업 스케줄링 정책을 설계하는 것.
  • 특히 지상 기지국이 희박한 상황에서 실시간으로 발생하는 동적이고 급격한 작업 도착을 처리하는 것.
  • UAV 비행 중 작업 처리 지연과 에너지 소비 사이의 트레이드오프를 최적화하는 것.

제안 방법

  • 에너지 제약이 있는 마르코프 결정 과정(CMDP)으로 온라인 작업 스케줄링 문제를 수식화하여 상태 전이와 보상 함수를 모델링한다.
  • UAV의 용량 제약을 초과하는 에너지 소비를 위험으로 평가하는 새로운 딥 리스크 감수성 강화학습 알고리즘을 개발한다.
  • 지연과 위험을 동시에 최소화하는 가중치 손실 함수를 도입하며, 정책 학습 중 두 목표를 균형 잡기 위한 조정 가능한 하이퍼파라미터를 제공한다.
  • 학습 안정성 향상과 정책 수렴 향상을 위해 더블 딥 Q-네트워크(DDQN) 아키텍처를 사용한다.
  • 에너지 제약 위반 가능성을 기반으로 정책을 동적으로 조정하는 위험 평가 메커니즘을 통합한다.
  • 샘플 효율성과 학습 안정성을 향상시키기 위해 경험 리플레이와 타겟 네트워크 기법을 활용한다.

실험 결과

연구 질문

  • RQ1SAGIN에서 지연 민감한 IoT 서비스의 엔드 투 엔드 지연을 최소화하기 위해 작업 오프로딩 결정을 어떻게 최적화할 수 있는가?
  • RQ2작업 처리 지연을 최소화하면서 UAV 에너지 용량 위반을 방지하는 데 최적의 트레이드오프는 무엇인가?
  • RQ3동적이고 급격한 작업 도착이 발생하는 환경에서 강화학습 에이전트는 효과적인 스케줄링 정책을 어떻게 학습할 수 있는가?
  • RQ4위험 감수성 RL 접근 방식이 에너지 제약을 유지하면서 지연을 줄이는 데 있어 확률적 또는 결정적 기준 방법보다 뛰어나게 작용할 수 있는가?
  • RQ5제안된 방법은 UAV 커버리지와 데이터 전송 속도 변화와 같은 다양한 네트워크 조건에 어떻게 적응하는가?

주요 결과

  • 제안된 DOTS 기법은 동일한 에너지 제약 조건 하에서 확률적 구성(RPC) 방법 대비 최대 30%의 작업 처리 지연 감소를 기록한다.
  • DOTS는 1,000개의 시뮬레이션 비행 경로 전역에서 UAV 에너지 용량 제약을 성공적으로 충족시키며, RPC 방법은 이를 이행하지 못한다.
  • SPC 기준 방법은 에너지 제약을 충족시키지만 더 높은 지연을 보이며, 8.5초를 초과하는 비행이 60% 이상 발생하는 반면, DOTS는 90% 이상의 비행에서 낮은 지연을 유지한다.
  • DOTS 정책는 약 60개의 학습 에피소드 후에 낮은 지연과 낮은 위험 전략으로 수렴하여 안정적이고 효율적인 학습을 보여준다.
  • DOTS가 학습한 오프로딩 전략은 커버리지와 채널 조건에 따라 기지국과 위성 간에 동적으로 전환하며, 기지국 범위 외부에서는 큐잉 지연을 감소시킨다.
  • 정책 수렴 후 시간 평균 지연 측면에서 DOTS는 SPC 및 RPC 모두를 능가하며, 실시간 에너지 제약 환경에서의 우수성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.