Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning for Online Offloading in Wireless Powered Mobile-Edge Computing Networks.

Liang Huang, Suzhi Bi|arXiv (Cornell University)|Aug 6, 2018
Energy Harvesting in Wireless Networks被引用数 25
ひとこと要約

本稿では、時間変動するチャネル状態を有する無線駆動型モバイルエッジコンピューティング(MEC)ネットワークにおいて、最適なバイナリオーディング意思決定とリソース割り当てを学習することで、リアルタイムでオンラインのタスクオフロードを可能にする深層強化学習フレームワーク、DROOを提案する。従来手法と比較して10倍以上の低遅延を達成し、30ユーザーのネットワークにおいてCPU実行時間を0.1秒未塔にまで短縮する。

ABSTRACT

Wireless powered mobile-edge computing (MEC) has recently emerged as a promising paradigm to enhance the data processing capability of low-power networks, such as wireless sensor networks and internet of things (IoT). In this paper, we consider a wireless powered MEC network that adopts a binary offloading policy, so that each computation task of wireless devices (WDs) is either executed locally or fully offloaded to an MEC server. Our goal is to acquire an online algorithm that optimally adapts task offloading decisions and wireless resource allocations to the time-varying wireless channel conditions. This requires quickly solving hard combinatorial optimization problems within the channel coherence time, which is hardly achievable with conventional numerical optimization methods. To tackle this problem, we propose a Deep Reinforcement learning-based Online Offloading (DROO) framework that implements a deep neural network as a scalable solution that learns the binary offloading decisions from the experience. It eliminates the need of solving combinatorial optimization problems, and thus greatly reduces the computational complexity especially in large-size networks. To further reduce the complexity, we propose an adaptive procedure that automatically adjusts the parameters of the DROO algorithm on the fly. Numerical results show that the proposed algorithm can achieve near-optimal performance while significantly decreasing the computation time by more than an order of magnitude compared with existing optimization methods. For example, the CPU execution latency of DROO is less than $0.1$ second in a $30$-user network, making real-time and optimal offloading truly viable even in a fast fading environment.

研究の動機と目的

  • 時間変動するチャネル状態を有する無線駆動型モバイルエッジコンピューティング(MEC)ネットワークにおけるオンラインタスクオフロードの課題に取り組む。
  • 従来手法によるチャネルコherence時間内にハードな組み合わせ最適化問題を解く際の高い計算複雑性を克服する。
  • 最適化問題をオンラインで解かずに、オフローディング意思決定とリソース割り当てを動的に適応可能なスケーラブルでリアルタイムなソリューションを設計する。
  • 計算遅延を顕著に低減し、特に大規模なIoTおよびセンサーネットワークにおいて、高速フェージング環境での実用的導入を可能にする。

提案手法

  • 経験からバイナリオフローディング意思決定を学習するための深層ニューラルネットワークを用いた、深層強化学習に基づくオンラインオフローディング(DROO)フレームワークを提案する。
  • オフローディング意思決定を、現在のチャネル状態とシステム状態に基づいて行動(ローカル実行または完全なオフロード)を選択するマルコフ意思決定過程としてモデル化する。
  • 行動価値関数を近似するためのQ学習に類似したディープQネットワーク(DQN)アーキテクチャを採用し、最適ポリシーのエンドツーエンド学習を可能にする。
  • 実行時中に動的にDROOアルゴリズムのハイパーパrameterを調整するための適応的パrameter調整手順を導入する。
  • エネルギー効率とタスク完了遅延を同時に最適化する報酬関数を用い、ローカル処理とオフロード処理のトレードオフを反映する。
  • 時間変動するチャネル状態を有するシミュレーテッド環境でDROOエージェントを訓練し、多様なネットワーク状態とユーザー数に一般化可能にする。

実験結果

リサーチクエスチョン

  • RQ1時間変動するチャネルを有する無線駆動型MECネットワークにおいて、深層強化学習フレームワークは、効果的に最適なオンラインオフローディング意思決定を学習できるか?
  • RQ2DROOフレームワークは、従来の最適化手法と比較して、計算遅延と性能スケーラビリティの面でどのように異なるか?
  • RQ3適応的ハイパーパrameterチューニングは、動的環境におけるDROOアルゴリズムの収束性とロバスト性をどの程度向上できるか?
  • RQ4提案されたオンラインオフローディングフレームワークにおいて、エネルギー効率とタスク完了遅延の間に達成可能なトレードオフは何か?
  • RQ5DROOフレームワークは、大規模ネットワークにおいて計算複雑性を1桁以上低減しつつ、近似的最適性能を維持できるか?

主な発見

  • DROOフレームワークは、エネルギー-遅延トレードオフの観点で近似的最適性能を達成し、全探索で得られる理論的最適値に非常に近い。
  • 30ユーザーのネットワークにおいて、DROOのCPU実行遅延は0.1秒未塔であり、高速フェージング環境でもリアルタイム実行が可能であることを示している。
  • 従来の数値最適化手法と比較して、DROOは計算時間を1桁以上短縮し、スケーラビリティが顕著に向上している。
  • 適応的パrameter調整手順により、特に高動的なチャネル状態下でも学習の安定性と収束速度が向上している。
  • さまざまなネットワークサイズにおいて高い性能を維持しており、大規模展開時においても最小限の性能劣化が生じている。
  • DROOの深層ニューラルネットワーク部は、各シナリオごとに再トレーニングを必要とせずに、多様なチャネル状態とユーザー分布に一般化して適応している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。