Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning for Task Offloading in Mobile Edge Computing Systems

Ming Tang, Vincent W. S. Wong|arXiv (Cornell University)|Apr 10, 2020
IoT and Edge/Fog Computing参考文献 31被引用数 15
ひとこと要約

本稿では、非分割で遅延に敏感なタスクと未知のエッジ負荷ダイナミクスを有するモバイルエッジコンピューティング(MEC)システムを想定し、モデルフリーの深層強化学習(DRL)に基づく分散タスクオフロードアルゴリズムを提案する。LSTM、デュアルDQN、ダブルDQN技術を統合することで、各デバイスが自律的にタスクをオフロードするかどうか、どこにオフロードするかを決定可能となり、ベンチマークと比較してドロップタスクを最大95.4%削減し、平均遅延を30.1%削減する。

ABSTRACT

In mobile edge computing systems, an edge node may have a high load when a large number of mobile devices offload their tasks to it. Those offloaded tasks may experience large processing delay or even be dropped when their deadlines expire. Due to the uncertain load dynamics at the edge nodes, it is challenging for each device to determine its offloading decision (i.e., whether to offload or not, and which edge node it should offload its task to) in a decentralized manner. In this work, we consider non-divisible and delay-sensitive tasks as well as edge load dynamics, and formulate a task offloading problem to minimize the expected long-term cost. We propose a model-free deep reinforcement learning-based distributed algorithm, where each device can determine its offloading decision without knowing the task models and offloading decision of other devices. To improve the estimation of the long-term cost in the algorithm, we incorporate the long short-term memory (LSTM), dueling deep Q-network (DQN), and double-DQN techniques. Simulation results with 50 mobile devices and five edge nodes show that the proposed algorithm can reduce the ratio of dropped tasks and average task delay by 86.4%-95.4% and 18.0%-30.1%, respectively, when compared with several existing algorithms.

研究の動機と目的

  • エッジノードの負荷ダイナミクスが未知で時間変動するMECシステムにおける分散型タスクオフロードの課題に対処すること。
  • 処理遅延とデッドライン違反によるタスクドロップを含む、タスクオフロードの期待長期コストを最小化すること。
  • 他のデバイスのタスクやグローバルシステム状態の知識なしに、各モバイルデバイスがオフロード意思決定を下せる分散型アルゴリズムを設計すること。
  • 高度な深層強化学習コンponentsを用いて、動的環境における長期コスト推定を改善すること。

提案手法

  • 遅延に敏感で非分割なタスク制約下で長期コストを最小化するため、タスクオフロード問題をマルコフ決定過程(MDP)として定式化する。
  • 状態とアクション価値推定を分離することで学習安定性を向上させる、デュアルアーキテクチャを備えたモデルフリーのディープQネットワーク(DQN)を採用する。
  • タスク到着とエッジ負荷ダイナミクスの時間的依存性をモデル化するため、長短期記憶(LSTM)ネットワークを統合し、より良い長期コスト推定を実現する。
  • Q値関数近似における過大評価バイアスを低減するため、ダブルDQNを用いることで、学習収束性と性能を向上させる。
  • 完全に分散型の意思決定を可能に:各デバイスがローカル観測値と報酬のみを用いて、独自に方策を学習する。
  • 経験再生とターゲットネットワークを用いてDRLエージェントを訓練することで、学習安定性を向上させ、サンプル効率を改善する。

実験結果

リサーチクエスチョン

  • RQ1未知で時間変動するエッジ負荷ダイナミクスを有するMECシステムにおいて、分散型でモデルフリーのDRLベースのアルゴリズムは効果的に機能するか?
  • RQ2LSTM、デュアルDQN、ダブルDQNの統合は、長期コスト推定とオフロード性能をどのように向上させるか?
  • RQ3提案アルゴリズムは、既存の集中型および分散型ベンチマークと比較して、タスクドロップ比と平均処理遅延をどの程度低減するか?
  • RQ4高タスク密度、限界のあるエッジ処理能力、または高いデバイス計算能力といったさまざまなシステム条件下でのアルゴリズムの性能はいかがなものか?

主な発見

  • 高負荷条件下で、提案アルゴリズムはベンチマーク手法と比較して、ドロップタスク比を86.4%から95.4%まで削減した。
  • 全テストシナリオにおいて、平均タスク遅延は18.0%から30.1%まで削減され、特に高タスク密度下で顕著な改善が得られた。
  • モバイルデバイス数が150に増加した場合、本アルゴリズムはPGOAおよびULOOFと比較して平均遅延を9.0%低く抑えた。
  • 高いデバイス処理能力(3.5 GHz)下では、本アルゴリズムがベンチマークと比較してドロップタスクを93.9%から96.5%まで削減した。
  • 低エッジノード処理能力(15 GHz)下では、本アルゴリズムがベンチマークと比較してドロップタスクを最低57.0%、平均遅延を最低9.4%削減した。
  • エッジ処理能力が十分に大きい場合、本アルゴリズムの性能は近似的最適水準に収束するため、強固なスケーラビリティを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。