Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Player Multi-Armed Bandit Based Resource Allocation for D2D Communications

Anushree Neogi, Prasanna Chaporkar|arXiv (Cornell University)|Dec 12, 2018
Advanced Bandit Algorithms Research参考文献 15被引用数 6
ひとこと要約

本稿は、部分的チャネル状態情報(CSI)下でのデバイス・ツー・デバイス(D2D)通信におけるパワーおよびリソース割り当てのためのマルチプレイヤー・マルチアームバンディット(MP-MAB)フレームワークを提案する。UCB1およびExp3アルゴリズムを用いて、探索と活用のバランスを図っている。5Gネットワーク環境下で、セルラーユーザー(CUs)にQoSを保証しつつ、MP-UCB1がkth-UCB1、DLF、およびExp3ベースのポリシーと比較して優れた合計スループットと公平性を達成することを示している。

ABSTRACT

Device-to-device (D2D) communications is expected to play a significant role in increasing the system capacity of the fifth generation (5G) wireless networks. To accomplish this, efficient power and resource allocation algorithms need to be devised for the D2D users. Since the D2D users are treated as secondary users, their interference to the cellular users (CUs) should not hamper the CU communications. Most of the prior works on D2D resource allocation assume full channel state information (CSI) at the base station (BS). However, the required channel gains for the D2D pairs may not be known. To acquire these in a fast fading channel requires extra power and control overhead. In this paper, we assume partial CSI and formulate the D2D power and resource allocation problem as a multi-armed bandit problem. We propose a power allocation scheme for the D2D users in which the BS allocates power to the D2D users if a certain signal-to-interference-plus-noise ratio (SINR) is maintained for the CUs. In a single player environment a D2D user selects a CU in every time slot by employing UCB1 algorithm. Since this resource allocation problem can also be considered as an adversarial bandit problem we have applied the exponential-weight algorithm for exploration and exploitation (Exp3) to solve it. In a multiple player environment, we extend UCB1 and Exp3 to multiple D2D users. We also propose two algorithms that are based on distributed learning algorithm with fairness (DLF) and kth-UCB1 algorithms in which the D2D users are ranked. Our simulation results show that our proposed algorithms are fair and achieve good performance.

研究の動機と目的

  • 完全なチャネル状態情報(CSI)が高コストなため、部分的CSI下でのD2D通信におけるパワーおよびリソース割り当ての課題に対処すること。
  • D2Dユーザーがセルラーユーザー(CUs)のスペクトルを機会的に再利用する際、CUsが最低限のSINRを満たすように保証すること。
  • 複数のD2Dユーザーが同じリソースブロックをめぐって競合する状況において、衝突を最小限に抑え、公平性を確保する分散型学習アルゴリズムを設計すること。
  • 単一プレイヤー用バンディットアルゴリズム(UCB1、Exp3)を、順位付けされたユーザーを想定したマルチプレイヤー設定に拡張し、スケーラブルで公平なD2Dアクセスを可能にすること。

提案手法

  • 部分的CSI下でのD2Dのパワーおよびリソース割り当て問題を、マルチプレイヤー・マルチアームバンディット(MP-MAB)問題として定式化する。
  • 各D2Dユーザーに対してUCB1アルゴリズムを適用し、期待スループットを最大化するためのCUリソースブロックを選択する。探索と活用のバランスを取る。
  • UCB1およびExp3をマルチプレイヤー状況に拡張し、衝突を低減し、公平性を確保するためのメカニズムを導入する。
  • 2つの新規アルゴリズム—DLF(Fairnessを備えた分散学習)およびkth-UCB1—を提案。ユーザーは順位付けされ、自身の順位に基づいてアームを選択する学習を行うことで、干渉を低減する。
  • CUsに最小SINRしきい値(γ^tgt)を課し、CUsのSINRがこのしきい値を下回らない場合にのみ、D2Dユーザーにパワーを割り当てる。
  • ユーザーおよびチャネル間でバンディットフィードバックを標準化するため、即時の報酬(スループット)を区間[0,1]に正規化する。

実験結果

リサーチクエスチョン

  • RQ1部分的CSI下で、CUsの最低限のQoSを維持しつつ、D2Dユーザーがセルラーユーザーのリソースブロックを効率的に選択する方法は何か?
  • RQ2ユーザーの順位付けと公平性メカニズムが、マルチプレイヤーD2Dバンディット学習における衝突低減とシステムスループットに与える影響は何か?
  • RQ3マルチユーザーD2Dリソース割り当て環境下で、UCB1およびExp3ベースのポリシーは公平性と累積スループットの観点でどのように比較されるか?
  • RQ4アドバーシャルバンディットアルゴリズム(例:Exp3)は、QoS制約を満たすD2Dスペクトル共有に効果的に適用可能か?
  • RQ5kth-UCB1およびDLFは、標準的なUCB1と比較して、マルチユーザーD2Dシナリオにおける公平性をどの程度向上させるか?

主な発見

  • MP-UCB1は、衝突率が低く、最適なCUsの選択頻度が高いため、全評価アルゴリズムの中で最高の合計スループットを達成する。
  • 公平性パcent—各D2Dユーザーが最適なCUを選択する時間の割合—はMP-UCB1が最も高く、次いでDLF、kth-UCB1、Exp3の順に低下する。
  • 高い衝突率と低い公平性を示すものの、kth-UCB1およびDLFは、ユーザーが自身の順位に基づく最適アームを選択するため、干渉が低減され、依然として高い合計スループットを達成する。
  • CUsの合計スループットは安定しており、一定の平均値に近いが、パワー割り当ての意思決定および衝突の影響でわずかな変動を示す。
  • D2Dユーザーの合計スループットは、通信距離が短く、D2Dリンクのスペクトル効率が高いため、CUsのそれよりも上回る。
  • 提案されたアルゴリズムにより、CUsのSINRはしきい値γ^tgtを超えて維持され、QoSが保証され、性能の劣化が防止される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。