Skip to main content
QUICK REVIEW

[論文レビュー] Joint Time Scheduling and Transaction Fee Selection in Blockchain-based RF-Powered Backscatter Cognitive Radio Network

Tran The Anh, Nguyen Cong Luong|arXiv (Cornell University)|Jan 10, 2020
Energy Harvesting in Wireless Networks被引用数 6
ひとこと要約

本稿では、RF駆動バックスキャター認知的無線ネットワークにおける連携時間スケジューリング、ブロックチェーンネットワーク選択、取引手数料最適化のための深層強化学習(DRL)ベースのフレームワークを提案する。確率的最適化問題を定式化し、Dueling Double Deep Q-Networks(D3QN)を用いることで、ゲートウェイはエネルギー効率的収集、バックスキャタリング、送信のための時間スロットを動的に割り当てるとともに、最適なブロックチェーンと手数料レートを選択し、1フレームあたり最大9.1データユニットのスループットを達成する。これはQ学習やベースライン手法を著しく上回る性能を発揮する。

ABSTRACT

In this paper, we develop a new framework called blockchain-based Radio Frequency (RF)-powered backscatter cognitive radio network. In the framework, IoT devices as secondary transmitters transmit their sensing data to a secondary gateway by using the RF-powered backscatter cognitive radio technology. The data collected at the gateway is then sent to a blockchain network for further verification, storage and processing. As such, the framework enables the IoT system to simultaneously optimize the spectrum usage and maximize the energy efficiency. Moreover, the framework ensures that the data collected from the IoT devices is verified, stored and processed in a decentralized but in a trusted manner. To achieve the goal, we formulate a stochastic optimization problem for the gateway under the dynamics of the primary channel, the uncertainty of the IoT devices, and the unpredictability of the blockchain environment. In the problem, the gateway jointly decides (i) the time scheduling, i.e., the energy harvesting time, backscatter time, and transmission time, among the IoT devices, (ii) the blockchain network, and (iii) the transaction fee rate to maximize the network throughput while minimizing the cost. To solve the stochastic optimization problem, we then propose to employ, evaluate, and assess the Deep Reinforcement Learning (DRL) with Dueling Double Deep Q-Networks (D3QN) to derive the optimal policy for the gateway. The simulation results clearly show that the proposed solution outperforms the conventional baseline approaches such as the conventional Q-Learning algorithm and non-learning algorithms in terms of network throughput and convergence speed. Furthermore, the proposed solution guarantees that the data is stored in the blockchain network at a reasonable cost.

研究の動機と目的

  • RF駆動バックスキャター認知的無線技術を用いて、混雑したIoT展開における周波数帯域不足とエネルギー制約を解決すること。
  • 分散型で信頼性のあるデータ保存と検証を可能にするブロックチェーンの統合により、データの完全性、透明性、セキュリティを向上させること。
  • 動的で不確実で予測不能なシステム状態下において、時間スケジューリング(収集、バックスキャタリング、送信)、ブロックチェーンネットワーク選択、取引手数料レートを共同最適化すること。
  • 変動するチャネル状態、IoTデバイスの状態、ブロックチェーンのダイナミクスを伴う確率的環境下で、ネットワークスループットを最大化するとともに、ストレージコストを最小化すること。

提案手法

  • 動的プライマリチャネル状態、不確実なIoTデバイス状態、予測不能なブロックチェーン環境下で、セカンドリーゲートウェイが時間スケジューリング、ブロックチェーンネットワーク、取引手数料レートを共同で意思決定するための確率的最適化問題を定式化する。
  • スループット最大化とコスト最小化のバランスを取る最適な方策を学習するために、Dueling Double Deep Q-Networks(D3QN)を用いた深層強化学習(DRL)を採用する。
  • 状態空間と行動空間が大きなマルコフ決定過程(MDP)としてシステムをモデル化し、状態にはチャネル使用状況、デバイスのエネルギー状態とデータ利用可能性、ブロックチェーンネットワークの状態が含まれる。
  • D3QNの学習を導くために、ネットワークスループット、取引成功確率、コスト効率を統合した包括的な報酬関数を設計する。
  • シミュレーションベースの訓練と評価を実施し、Q学習、ランダム、HTT、バックスキャターポリシーなどのベースラインと比較してDRL方策の性能を評価する。
  • フレーム長、データ到着率、攻撃者確率、利用可能なブロックチェーンネットワーク数の変動に対する性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1動的で不確実な条件下において、ブロックチェーンベースのRF駆動バックスキャター認知的無線ネットワークで、時間スケジューリング、ブロックチェーンネットワーク選択、取引手数料レートをどのように共同最適化できるか?
  • RQ2フレーム長の変化が、提案フレームワークにおけるネットワークスループットと取引手数料レートに与える影響は何か?
  • RQ3データ到着率の変化が、従来のベースライン方式と比較してDRLベースのスケジューリング方策の性能に与える影響は何か?
  • RQ4攻撃者が新しいブロックを発見する確率が上昇した場合、異なるブロックチェーン環境下でスループットと取引手数料レートにどのような影響が生じるか?
  • RQ5利用可能なブロックチェーンネットワーク数の増加が、スループット、取引手数料、および全体のシステム報酬に与える影響は何か?

主な発見

  • 提案されたDRL方式は、データ到着率が8の条件下で、平均して1フレームあたり9.1データユニットのスループットを達成し、ランダム、HTT、バックスキャターポリシー(それぞれ4.4、3.3、1.6ユニット)を著しく上回る性能を示した。
  • フレーム長が延長されても、固定のビジー状態のチャネル期間中に一貫したバックスキャタリング動作が継続するため、スループットは安定している。
  • フレーム長が延びるに従い、すべての方式でパケットサイズが大きくなるため取引手数料レートが上昇するが、DRL方式はコスト効率を維持している。
  • 攻撃者が新しいブロックを発見する確率が上昇すると、すべての方式でスループットが低下し、取引手数料レートが急激に上昇するが、DRL方式が最も高い性能を維持している。
  • 利用可能なブロックチェーンネットワーク数の増加により、システム性能が向上する:スループットが上昇し、取引手数料が低下し、総報酬が増加する。これは、より良いネットワーク選択の機会が得られるためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。