Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning for Minimizing Age of Information in Real-time Internet of Things Systems with Realistic Physical Dynamics.

Wang Si-hua, Mingzhe Chen|arXiv (Cornell University)|Apr 4, 2021
Age of Information Optimization参考文献 25被引用数 4
ひとこと要約

本稿では、非線形な物理的ダイナミクスを示すIoTシステムにおいて、サンプリング方針とデバイス選択を共同で最適化する分散強化学習フレームワークを提案する。これにより、情報の年齢(AoI)とエネルギー消費の重み付き和を最小化する。実際のPM2.5データを用いた比較では、ベースライン手法に比べ、AoIが最大33.9%低減され、エネルギー消費量が最大35.1%低減された。

ABSTRACT

In this paper, the problem of minimizing the weighted sum of age of information (AoI) and total energy consumption of Internet of Things (IoT) devices is studied. In the considered model, each IoT device monitors a physical process that follows nonlinear dynamics. As the dynamics of the physical process vary over time, each device must find an optimal sampling frequency to sample the real-time dynamics of the physical system and send sampled information to a base station (BS). Due to limited wireless resources, the BS can only select a subset of devices to transmit their sampled information. Meanwhile, changing the sampling frequency will also impact the energy used by each device for sampling and information transmission. Thus, it is necessary to jointly optimize the sampling policy of each device and the device selection scheme of the BS so as to accurately monitor the dynamics of the physical process using minimum energy. This problem is formulated as an optimization problem whose goal is to minimize the weighted sum of AoI cost and energy consumption. To solve this problem, a distributed reinforcement learning approach is proposed to optimize the sampling policy. The proposed learning method enables the IoT devices to find the optimal sampling policy using their local observations. Given the sampling policy, the device selection scheme can be optimized so as to minimize the weighted sum of AoI and energy consumption of all devices. Simulations with real data of PM 2.5 pollution show that the proposed algorithm can reduce the sum of AoI by up to 17.8% and 33.9% and the total energy consumption by up to 13.2% and 35.1%, compared to a conventional deep Q network method and a uniform sampling policy.

研究の動機と目的

  • 非線形な物理的プロセスをリアルタイムでモニタリングするIoTシステムにおいて、情報の年齢(AoI)と総エネルギー消費量の重み付き和を最小化すること。
  • IoTデバイスによる適応的サンプリング周波数選択を必要とする、動的な物理的システムの挙動に起因する課題に対処すること。
  • 限られた無線リソース下で、デバイスのサンプリング方針と基地局(BS)によるデバイス選択を共同で最適化すること。
  • 局所的観測と分散学習を用いて、エネルギー効率的かつリアルタイムな物理的プロセスのモニタリングを可能にすること。
  • 時間変動する物理的ダイナミクスの正確な追跡を維持しつつ、システム全体のAoIとエネルギー消費量を低減すること。

提案手法

  • 情報の年齢とエネルギーコストのバランスを取る報酬関数を備えた、マーカフ連鎖過程(MDP)としてのサンプリング周波数とデバイス選択の共同最適化を定式化する。
  • 各IoTデバイスが物理プロセスおよびシステム状態の局所的観測に基づいて、最適なサンプリング方針を学習する分散強化学習アルゴリズムを提案する。
  • 連続的な状態空間と行動空間を扱うために関数近似を用い、大規模なIoT展開におけるスケーラブルな学習を可能にする。
  • 基地局に統合されたデバイス選択メカニズムを採用し、現在のAoIとエネルギー制約に基づいて、どのデバイスをスケジューリングするかを動的に選択する。
  • スケーラビリティと動的環境への適応性を確保するため、集中学習・分散実行(CTDE)パラダイムを採用する。
  • 経験再生とターゲットネットワークを用いて学習の安定性を高めた、深層Qネットワーク(DQN)を用いてサンプリング方針を最適化する。

実験結果

リサーチクエスチョン

  • RQ1非線形な物理的ダイナミクスを示すシステムにおいて、IoTデバイスはどのように動的にサンプリング周波数を調整することで、AoIとエネルギー消費の合計コストを最小化できるか?
  • RQ2サンプリング方針とデバイス選択の共同最適化が、システム全体のAoIとエネルギー効率に与える影響は何か?
  • RQ3提案された分散強化学習アプローチは、従来のDQNおよび均一サンプリングと比較して、AoIとエネルギー削減の面でどの程度優れているか?
  • RQ4部分観測下での局所的学習は、リソース制限のあるIoTネットワークにおいて、グローバルに最適または近似最適なシステム性能を達成できるか?
  • RQ5PM2.5汚染のような実世界の物理的プロセスにおいて、アルゴリズムはエネルギー消費を低減しつつ、どの程度低いAoIを維持できるか?

主な発見

  • 提案された強化学習手法は、実際のPM2.5データを用いた比較において、均一サンプリング方針に比べ、合計AoIを最大33.9%低減した。
  • アルゴリズムは、従来の深層Qネットワーク(DQN)ベースラインに比べ、合計エネルギー消費量を35.1%削減した。
  • 標準的なDQNアプローチに比べ、AoIを最大17.8%低減した。これは、学習効率の向上と方策収束の改善を示している。
  • 分散学習フレームワークにより、各IoTデバイスが局所的観測のみを用いて独立してサンプリング周波数を最適化でき、スケーラビリティが保証された。
  • サンプリングとデバイス選択の共同最適化により、AoIとエネルギー効率の両面で顕著な向上が得られ、従来のヒューリスティック法やベースライン学習手法を上回った。
  • 実世界のPM2.5データを用いたシミュレーションにより、実際の無線制約下で、非線形的かつ時間変動する物理的プロセスのモニタリングにおいて、本手法の有効性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。