Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning for Distributed Uncoordinated Cognitive Radios Resource Allocation

Ankita Tondwalkar, Dr Andres Kwasinski|arXiv (Cornell University)|Oct 29, 2019
Cognitive Radio Networks and Spectrum Sensing被引用数 6
ひとこと要約

本稿では、下位動的スペクトラムアクセス(DSA)環境下で動作する、協調しない分散型認知無線(CR)ネットワークを対象として、非定常環境において最適な送信電力割り当て方針に収束する、新しいマルチエージェント深層Q学習(DQL)アルゴリズムを提案する。標準の単一エージェントDQLが失敗する状況においても、経験再生とターゲットネットワークの更新を伴う集中型トレーニングにより、収束を達成している。有限の学習時間内に、全探索法の97%程度の性能を達成し、69%のケースで最適方策に到達している。

ABSTRACT

This paper presents a novel deep reinforcement learning-based resource allocation technique for the multi-agent environment presented by a cognitive radio network that coexists through underlay dynamic spectrum access (DSA) with a primary network. The resource allocation technique presented in this work is distributed, not requiring coordination with other agents. The presented algorithm is the first deep reinforcement learning technique for which convergence to equilibrium policies can be shown in the non-stationary multi-agent environment that results from the uncoordinated dynamic interaction between radios through the shared wireless environment. Moreover, simulation results show that in a finite learning time the presented technique is able to find policies that yield performance within 3 % of an exhaustive search solution, finding the optimal policy in nearly 70 % of cases. Moreover, it is shown that standard single-agent deep reinforcement learning may not achieve convergence when used in a non-coordinated, coupled multi-radio scenario.

研究の動機と目的

  • CRがプライマリネットワークと周波数を共有する非定常的でマルチエージェントの強化学習の課題に対処すること。
  • CRが自律的かつ自己調整的に最適送信電力レベルを学習できる、分散型で協調不要なリソース割り当てメカニズムを開発すること。
  • 非定常的で弱く巡回的な確率的動的ゲーム(弱く巡回的確率的動的ゲーム)という、これまでに収束性を有するDQL解が知られていなかった問題クラスにおいて、均衡方策への収束を証明すること。
  • 非定常性とノイズの多いQ値推定による影響により、標準の単一エージェントDQLが協調しない、結合的なマルチラジオ環境で収束しないことを評価すること。
  • 全探索法との比較による性能評価および、現実的で協調しない報酬関数下でのロバストネスの評価

提案手法

  • 非定常性に対しても安定した学習を可能にするために、経験再生とターゲットネットワークの更新を併用した集中型トレーニングを採用する。
  • 全CRからの遷移を格納する共有のリプレイバッファを用いることで、集団的相互作用からの学習を可能にする。
  • 各CRの行動選択のQ値関数近似に、経験再生とターゲットネットワークを用いた深層Qネットワーク(DQN)を採用する。
  • グローバル最適性への収束を促すために、トレーニング中における全CRのスループット合計に基づく報酬関数を採用する。
  • 非定常環境下での学習安定化のため、ターゲットネットワークの更新を遅延させる(パラメータ$c$で制御)修正DQLアルゴリズムを適用する。
  • 実際の協調しない展開を模倣するため、各CRごとの個別スループットを報酬として使用することでロバストネスを検証

実験結果

リサーチクエスチョン

  • RQ1下位認知無線ネットワークに典型的な非定常的で協調しないマルチエージェント環境において、マルチエージェントDQLアルゴリズムは最適方策に収束可能か?
  • RQ2非定常性のため、標準の単一エージェントDQLは協調しない結合的マルチラジオ環境で収束しないのか?
  • RQ3有限の学習時間内において、分散型で協調不要なDQL手法は、全探索法に比べてどの程度の最適解に近づけるか?
  • RQ4報酬関数の選択(スループット合計 vs. 各CRのスループット)が、協調しない環境下での収束性と性能に与える影響は何か?
  • RQ5ハイパーパrameter設定(例:$c$、ミニバッチサイズ)は、収束速度と性能精度の間でどの程度のトレードオフを生じるか?

主な発見

  • 提案手法のマルチエージェントDQLは、有限の学習時間内に69%のケースで最適方策に収束し、標準の単一エージェントDQLを著しく上回っている。
  • 提案手法と全探索法の最適解との間の平均相対差は2.49%であり、グローバル最適解の3%以内の性能を達成していることが示された。
  • 標準の単一エージェントDQLは、ほぼ半数のケースで収束に失敗しており(最適方策到達率55–56%)、平均相対差が7.44–9.45%に達しており、協調しないマルチエージェント環境には不適切であることが示された。
  • ターゲットネットワーク更新頻度パラメータ$c$を大きく(例:$c=60$)することで性能が向上し、平均相対差は0.96%に低下し、最適方策到達率は72%に上昇した。
  • ミニバッチサイズは性能にほとんど影響せず、30と120で類似した結果(平均相対差2.41%および3.75%)を示した。
  • 各CRの報酬関数を用いた場合でも、平均相対差4.11%のロバストネスを示しており、完全に協調しない展開においても有効であることが確認されたが、干渉の結合性のためわずかに最適でない結果となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。