Skip to main content
QUICK REVIEW

[論文レビュー] Energy Minimization in UAV-Aided Networks: Actor-Critic Learning for Constrained Scheduling Optimization

Yaxiong Yuan, Lei Lei|ArXiv.org|Jun 24, 2020
UAV Applications and Optimization参考文献 37被引用数 5
ひとこと要約

本稿では、無人航空機(UAV)支援ネットワークにおけるエネルギ効率的スケジューリングのため、ユーザースケジューリングとUAVのホバリング時間の共同最適化を実現する、アクタ・クリティック型深層強化学習アルゴリズムAC-DSOSを提案する。大規模な離散的アクション空間と不適切なアクションの問題に対処するため、アクション空間の制限と特化した報酬関数を採用し、従来のDRLと比較して29.94%のエネルギー削減を達成した。計算時間はミリ秒レベルであり、オフラインベンチマークを上回る計算効率を発揮しながら、ほぼ最適性能を維持した。

ABSTRACT

In unmanned aerial vehicle (UAV) applications, the UAV's limited energy supply and storage have triggered the development of intelligent energy-conserving scheduling solutions. In this paper, we investigate energy minimization for UAV-aided communication networks by jointly optimizing data-transmission scheduling and UAV hovering time. The formulated problem is combinatorial and non-convex with bilinear constraints. To tackle the problem, firstly, we provide an optimal relax-and-approximate solution and develop a near-optimal algorithm. Both the proposed solutions are served as offline performance benchmarks but might not be suitable for online operation. To this end, we develop a solution from a deep reinforcement learning (DRL) aspect. The conventional RL/DRL, e.g., deep Q-learning, however, is limited in dealing with two main issues in constrained combinatorial optimization, i.e., exponentially increasing action space and infeasible actions. The novelty of solution development lies in handling these two issues. To address the former, we propose an actor-critic-based deep stochastic online scheduling (AC-DSOS) algorithm and develop a set of approaches to confine the action space. For the latter, we design a tailored reward function to guarantee the solution feasibility. Numerical results show that, by consuming equal magnitude of time, AC-DSOS is able to provide feasible solutions and saves 29.94% energy compared with a conventional deep actor-critic method. Compared to the developed near-optimal algorithm, AC-DSOS consumes around 10% higher energy but reduces the computational time from minute-level to millisecond-level.

研究の動機と目的

  • 動的なリアルタイムスケジューリング要件を満たすエネルギー制約付きUAV支援ネットワークの課題に対処する。
  • エネルギーおよび遅延制約下での、ユーザースケジューリングとホバリング時間の最適化という組み合わせ的かつ非凸的問題に取り組む。
  • 決定的最適化と従来のDRLの限界を克服し、エネルギー効率と計算速度の両立を図るスケーラブルなオンラインソリューションを開発する。
  • 従来のDRL手法が不適切なアクションのため失敗する高次元離散的アクション空間において、ソリューションの実行可能性を保証する。
  • ユーザー要件の満足度を強制しつつ、総合的エネルギー消費量を最小化する報酬関数を設計する。

提案手法

  • 大規模な離散的アクション空間を扱える、アクタ・クリティックに基づく深層確率的オンラインスケジューリング(AC-DSOS)アルゴリズムを提案する。
  • 探索空間の縮小と学習効率の向上を図るため、アクション空間の制限技術を実装する。
  • 未満たされたユーザー要件をペナルティ化し、エネルギー効率的かつ実行可能なソリューションを促進するカスタマイズされた報酬関数を設計する。
  • トレーニングの安定化と収束の加速を図るため、ポリシー(アクタ)と価値関数(クリティック)の別々のネットワークを用いたダブル・アクタ・クリティックフレームワークを採用する。
  • 性能評価のため、リラックス・アプロキメート法とGSSベースのヒューリスティックをオフラインベンチマークとして統合する。
  • サンプル効率とトレーニング安定性を向上させるために、経験リプレイとターゲットネットワークをAC-DSOSエージェントのトレーニングに用いる。

実験結果

リサーチクエスチョン

  • RQ1複数のユーザーと時間スロットを含むUAVスケジューリングにおいて、指数関数的に増大する離散的アクション空間を扱うために、深層強化学習をどのように適合させられるか?
  • RQ2ユーザー要件の満足度を含む制約付き組み合わせ最適化問題において、ソリューションの実行可能性を保証する報酬形状戦略は何か?
  • RQ3AC-DSOSは、DQN や DDPG といった従来のDRL手法と比較して、エネルギー効率と計算速度の両面でどの程度優れているか?
  • RQ4エネルギー消費量と実行時間のスケーラビリティの観点から、本手法は最適およびヒューリスティックなオフラインベンチマークと比較してどの程度優れているか?
  • RQ5AC-DSOSトレーニングプロセスにおいて、安定的かつ最適な収束を達成するハイパーパrameter設定(例:学習率)は何か?

主な発見

  • K=7の条件下で、最適法に比べて計算時間を分単位からミリ秒単位に短縮し、99.23%の削減を達成した。
  • 従来の深層アクタ・クリティック手法(例:DDPG)と比較して、29.94%のエネルギー削減を達成したが、近似的に最適なヒューリスティックより10%高いエネルギーコストを有した。
  • ε=1.2の条件下で、提案された報酬関数は100%の要件満足度を達成しながらエネルギー消費量を最小化した。標準報酬関数は実行可能性を保証できず、劣っている。
  • Kに依存しない低計算時間でほぼ最適性能を維持した。一方、GSS-HEUおよび最適法はKの増加に伴いスケーリングが著しく悪化した。
  • アクタネットワークの学習率は収束に強く影響する。αa=0.003が最良の性能を示したが、αa=0.005は不安定となり、収束報酬が7.2%低くなった。
  • T_maxの増加に伴いエネルギー消費量は一定の点まで減少し、その後安定化する。通信エネルギーはT_max=140未満で急激に低下し、ホバリングエネルギーは線形に増加する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。