[논문 리뷰] Energy Minimization in UAV-Aided Networks: Actor-Critic Learning for Constrained Scheduling Optimization
이 논문은 UAV 보조 네트워크에서 에너지 효율적인 스케줄링을 위해 사용자 스케줄링과 UAV 정지 시간을 공동 최적화하는 액터-크리틱 딥 강화학습 알고리즘인 AC-DSOS를 제안한다. 큰 이산 행동 공간과 비가능한 행동을 해결하기 위해 행동 공간 제약화와 맞춤형 보상 함수를 적용하여, 기존의 DRL 대비 29.94%의 에너지 절감을 달성하였으며, 밀리초 수준의 계산 시간을 확보하여 오프라인 벤치마크보다 계산 효율성이 뛰어나면서도 거의 최적 성능를 유지한다.
In unmanned aerial vehicle (UAV) applications, the UAV's limited energy supply and storage have triggered the development of intelligent energy-conserving scheduling solutions. In this paper, we investigate energy minimization for UAV-aided communication networks by jointly optimizing data-transmission scheduling and UAV hovering time. The formulated problem is combinatorial and non-convex with bilinear constraints. To tackle the problem, firstly, we provide an optimal relax-and-approximate solution and develop a near-optimal algorithm. Both the proposed solutions are served as offline performance benchmarks but might not be suitable for online operation. To this end, we develop a solution from a deep reinforcement learning (DRL) aspect. The conventional RL/DRL, e.g., deep Q-learning, however, is limited in dealing with two main issues in constrained combinatorial optimization, i.e., exponentially increasing action space and infeasible actions. The novelty of solution development lies in handling these two issues. To address the former, we propose an actor-critic-based deep stochastic online scheduling (AC-DSOS) algorithm and develop a set of approaches to confine the action space. For the latter, we design a tailored reward function to guarantee the solution feasibility. Numerical results show that, by consuming equal magnitude of time, AC-DSOS is able to provide feasible solutions and saves 29.94% energy compared with a conventional deep actor-critic method. Compared to the developed near-optimal algorithm, AC-DSOS consumes around 10% higher energy but reduces the computational time from minute-level to millisecond-level.
연구 동기 및 목표
- 동적이고 실시간적인 스케줄링 수요를 가진 에너지 제약이 있는 UAV 보조 네트워크의 과제를 해결한다.
- 에너지 및 지연 제약 하에서 사용자 스케줄링과 정지 시간 최적화의 조합적이고 비볼록적인 성격을 다룬다.
- 에너지 효율성과 계산 속도를 균형 잡은 확장 가능한 온라인 솔루션을 개발하여 결정적 최적화와 전통적인 DRL의 한계를 극복한다.
- 기존 DRL 방법이 비가능한 행동으로 실패하는 고차원 이산 행동 공간에서의 솔루션 타당성을 보장한다.
- 사용자 수요 만족을 강제하면서 총 에너지 소비를 최소화하는 보상 함수를 설계한다.
제안 방법
- 대규모 이산 행동 공간을 다룰 수 있는 액터-크리틱 기반의 딥 스토하스틱 온라인 스케줄링(AC-DSOS) 알고리즘을 제안한다.
- 검색 공간을 줄이고 학습 효율을 향상시키기 위해 행동 공간 제약화 기법을 구현한다.
- 불만족한 사용자 수요를 페널티로 삼고 에너지 효율적이고 타당한 솔루션을 장려하는 맞춤형 보상 함수를 설계한다.
- 학습 안정성과 수렴 가속화를 위해 정책(액터)과 가치 함수(크리틱)에 별도의 네트워크를 사용하는 듀얼 액터-크리틱 프레임워크를 사용한다.
- 성능 평가를 위해 릴랙스-근사 방법과 GSS 기반 휴리스틱을 오프라인 벤치마크로 통합한다.
- 샘플 효율성과 학습 안정성을 향상시키기 위해 경험 리플레이와 타겟 네트워크를 사용하여 AC-DSOS 에이전트를 훈련시킨다.
실험 결과
연구 질문
- RQ1다수의 사용자와 시간 슬롯이 존재하는 UAV 스케줄링에서 지수적으로 증가하는 이산 행동 공간을 다룰 수 있도록 딥 강화학습을 어떻게 적응시킬 수 있는가?
- RQ2사용자 수요 만족을 포함하는 제약 조건이 있는 조합 최적화 문제에서 솔루션의 타당성을 보장하기 위한 보상 형상 전략은 무엇인가?
- RQ3AC-DSOS는 DQN 및 DDPG와 같은 전통적인 DRL 방법에 비해 에너지 효율성과 계산 속도에서 어느 정도 뛰어나게 성능을 발휘하는가?
- RQ4에너지 소비와 런타임 확장성 측면에서 제안된 방법은 최적 및 휴리스틱 오프라인 벤치마크와 어떻게 비교되는가?
- RQ5AC-DSOS 학습 과정에서 안정적이고 최적의 수렴을 이끌어내는 하이퍼파rameter 설정(예: 학습률)은 무엇인가?
주요 결과
- AC-DSOS는 최적 방법의 분 단위 계산 시간을 밀리초 수준으로 줄여 K=7일 때 최적의 릴랙스-근사 방법 대비 99.23%의 시간 절감을 달성한다.
- AC-DSOS는 DDPG와 같은 전통적인 딥 액터-크리틱 방법에 비해 29.94%의 에너지 절감을 이루었으며, 거의 최적의 휴리스틱보다 10% 높은 에너지 비용을 유발함에도 불구하고 성능이 뛰어나다.
- ε=1.2로 설정된 제안된 보상 함수는 에너지 소비를 최소화하면서도 100% 수요 만족을 보장하며, 타당성을 보장하지 못하는 표준 보상 함수보다 뛰어나다.
- AC-DSOS는 K에 관계없이 낮은 계산 시간을 유지하면서 거의 최적의 성능를 달성한다. 반면 GSS-HEU와 최적 방법는 K 증가에 따라 성능가 낮아지는 경향이 있다.
- 액터 네트워크의 학습률은 수렴에 강한 영향을 미치며, αa=0.003일 때 최고의 성능를 보이고, αa=0.005일 경우 불안정성이 발생하고 수렴 보상이 7.2% 낮아진다.
- 에너지 소비는 T_max 증가에 따라 일정 수준까지 감소하다가 안정화되며, 통신 에너지는 T_max=140 이전에 급격히 감소하고, 정지 에너지는 선형적으로 증가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.