Skip to main content
QUICK REVIEW

[論文レビュー] Multi-user Resource Control with Deep Reinforcement Learning in IoT Edge Computing

Lei Lei, Huijuan Xu|arXiv (Cornell University)|Jun 19, 2019
IoT and Edge/Fog Computing参考文献 36被引用数 4
ひとこと要約

本稿では、長期間にわたる遅延と消費電力の加重平均を最小化することを目的とした、IoTエッジコンピューティングシステムにおける深層強化学習に基づく共同計算オフロードおよびマルチユーザースケジューリングアルゴリズムを提案する。連続時間マルコフ意思決定過程(CTMDP)モデルと、価値関数近似に特化した新しいニューラルネットワークアーキテクチャを用いることで、次元の呪いを効果的に緩和する半分散型オークションベースのリソース制御が可能となり、シミュレーションにおいてベースラインおよび他の代替DRL手法と比較して顕著な性能向上を達成した。

ABSTRACT

By leveraging the concept of mobile edge computing (MEC), massive amount of data generated by a large number of Internet of Things (IoT) devices could be offloaded to MEC server at the edge of wireless network for further computational intensive processing. However, due to the resource constraint of IoT devices and wireless network, both the communications and computation resources need to be allocated and scheduled efficiently for better system performance. In this paper, we propose a joint computation offloading and multi-user scheduling algorithm for IoT edge computing system to minimize the long-term average weighted sum of delay and power consumption under stochastic traffic arrival. We formulate the dynamic optimization problem as an infinite-horizon average-reward continuous-time Markov decision process (CTMDP) model. One critical challenge in solving this MDP problem for the multi-user resource control is the curse-of-dimensionality problem, where the state space of the MDP model and the computation complexity increase exponentially with the growing number of users or IoT devices. In order to overcome this challenge, we use the deep reinforcement learning (RL) techniques and propose a neural network architecture to approximate the value functions for the post-decision system states. The designed algorithm to solve the CTMDP problem supports semi-distributed auction-based implementation, where the IoT devices submit bids to the BS to make the resource control decisions centrally. Simulation results show that the proposed algorithm provides significant performance improvement over the baseline algorithms, and also outperforms the RL algorithms based on other neural network architectures.

研究の動機と目的

  • 制限された計算リソースと無線リソースを有するマルチユーザーIoTエッジコンピューティングシステムにおける効率的なリソース割り当ての課題に対処すること。
  • 確率的なトラフィック到着を想定した下で、長期間平均加重和遅延と消費電力の最小化を達成すること。
  • スケーラブルな深層強化学習を用いて、マルチユーザーのマルコフ意思決定過程(MDP)における次元の呪いを克服すること。
  • 基地局でのオークションベースのリソース制御により、半分散型実装を可能にすること。
  • 連続時間MDPにおける事後意思決定状態の価値関数を正確に近似できるニューラルネットワークアーキテクチャの設計

提案手法

  • 動的リソース制御問題を、無限ホライズン平均報酬連続時間マルコフ意思決定過程(CTMDP)として定式化する。
  • 事後意思決定システム状態の価値関数を近似するための、単一の畳み込み層を有するニューラルネットワークアーキテクチャを導入し、計算複雑性を低減する。
  • 二重の学習率スキームを採用:一つは価値関数の更新用、もう一つは平均報酬推定用であり、収束を保証する。
  • IoTデバイスが基地局にリソース割り当て意思決定のための入札を提出する半分散型オークションメカニズムを用いる。
  • 有効性トレースを用いた時系列差分学習を適用し、状態依存勾配を用いて個々のノードの価値関数および重みベクトルを更新する。
  • 畳み込み層と全結合層の重みに対して別々の更新を実装する関数近似フレームワークを採用し、tanh活性化関数の微分を用いる。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習は、マルチユーザーIoTエッジコンピューティングリソース制御における次元の呪い問題を効果的に解消できるか?
  • RQ2本稿で提案する価値関数近似のためのニューラルネットワークアーキテクチャは、他のDRLアーキテクチャと比較して、性能および収束性においてどのように差をつけるか?
  • RQ3半分散型オークションベースの実装は、マルチユーザー環境におけるシステムのスケーラビリティと公平性にどのような影響を及ぼすか?
  • RQ4ベースライン手法と比較して、本アルゴリズムは長期間加重和遅延と消費電力の低減をどの程度達成できるか?
  • RQ5異なる学習率シーケンスは、本アルゴリズムの収束性および安定性にどのように影響を与えるか?

主な発見

  • 提案されたNeural-ICOアルゴリズムは、長期間平均加重和遅延と消費電力の最小化において、ベースラインアルゴリズムと比較して顕著な性能向上を達成した。
  • 特に高次元のマルチユーザー環境において、他のニューラルネットワークアーキテクチャを用いた深層強化学習手法と比較して優れた性能を示した。
  • シミュレーション結果から、変動するトラフィック到着パターンやユーザー負荷の下でも、安定した収束性と頑健性が確認された。
  • 関数近似アーキテクチャにおける単一の畳み込み層の使用が最適な性能をもたらし、追加の全結合層は効果を示さなかった。
  • 平均報酬推定に faster-decaying αk を用いた二重学習率スキームにより、正確な長期報酬追跡と安定したポリシー学習が実現された。
  • 半分散型オークションベースの実装により、実世界のIoTエッジネットワークにおけるスケーラブルかつ実用的な展開が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。