Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement learning techniques for Outer Loop Link Adaptation in 4G/5G systems

Saishankar Katri Pulliyakode, Sheetal Kalyani|arXiv (Cornell University)|Aug 3, 2017
Advanced Bandit Algorithms Research参考文献 19被引用数 10
ひとこと要約

本稿では、ブロック誤り率(BLER)の目標値を高いスループットで達成するために、2値探索と大偏差境界を用いたマルチアームバンディット(MAB)フレームワークを用いた強化学習ベースの外ループリンク適応(OLLA)方式を提案する。この手法により、90%のユーザーが目標BLERを満たすかそれを上回り、クラスタリングなどのヒューリスティック手法よりもBLER制御とスペクトル効率の両面で優れた性能を発揮する。

ABSTRACT

Wireless systems perform rate adaptation to transmit at highest possible instantaneous rates. Rate adaptation has been increasingly granular over generations of wireless systems. The base-station uses SINR and packet decode feedback called acknowledgement/no acknowledgement (ACK/NACK) to perform rate adaptation. SINR is used for rate anchoring called inner look adaptation and ACK/NACK is used for fine offset adjustments called Outer Loop Link Adaptation (OLLA). We cast the OLLA as a reinforcement learning problem of the class of Multi-Armed Bandits (MAB) where the different offset values are the arms of the bandit. In OLLA, as the offset values increase, the probability of packet error also increase, and every user equipment (UE) has a desired Block Error Rate (BLER) to meet certain Quality of Service (QoS) requirements. For this MAB we propose a binary search based algorithm which achieves a Probably Approximately Correct (PAC) solution making use of bounds from large deviation theory and confidence bounds. In addition to this we also discuss how a Thompson sampling or UCB based method will not help us meet the target objectives. Finally, simulation results are provided on an LTE system simulator and thereby prove the efficacy of our proposed algorithm.

研究の動機と目的

  • CQIフィードバックの不正確さ、SINR推定誤差、UE固有のバイアスによる4G/5Gシステムにおける正確なブロック誤り率(BLER)制御の課題に対処すること。
  • 独自のUEアルゴリズムに依存せず、基地局側で動的に伝送レートオフセットを調整するOLLAアルゴリズムを設計すること。
  • 数学的に厳密でスケーラブルかつ適応可能なOLLAソリューションを提供し、各ユーザーの目標BLERを保証するとともにスペクトル効率を最大化すること。
  • クラスタリングなどのヒューリスティックOLLA手法に見られるような理論的保証の欠如やスループットの低下といった制限を克服すること。
  • 強化学習、特に信頼区間を備えたMABが、低サンプル複雑性でリアルタイムの無線リンク適応に効果的に適用可能であることを示すこと。

提案手法

  • 各オフセット値をアームとして扱い、ACK/NACKフィードバックを確率的報酬とするマルチアームバンディット(MAB)問題としてOLLAを定式化する。
  • 大偏差理論を活用した2値探索ベースのMABアルゴリズムを提案し、必要なアームプル回数を最小限に抑える。
  • ホフディングの不等式に基づく信頼区間を用いて、非最適なアームを効率的に除外することで、サンプル複雑性を低減する。
  • 高い確率で最適なオフセットに収束することを保証する、おそらく近似的に正しい(PAC)学習フレームワークを採用する。
  • トムソンサンプリングやUCBと比較し、特定のBLER目標制約下では収束保証が欠如しているため、これらは不適切であると主張する。
  • LTEシステムシミュレータを用いた体系的なシミュレーション設定を採用し、複数の目標BLER(7.5%および10%)における性能を評価し、ベースライン手法と比較する。

実験結果

リサーチクエスチョン

  • RQ1強化学習に基づくMABフレームワークは、4G/5Gシステムにおける外ループリンク適応に効果的に適用可能であり、正確なBLER制御を達成できるか?
  • RQ2大偏差理論と信頼区間を活用することで、OLLAにおける必要なフィードバックサンプル数をどのように低減できるか?
  • RQ3トムソンサンプリングやUCBといった標準的なMAB手法が、厳密なBLER制約下ではなぜOLLAに不適切であるか?
  • RQ4提案手法のMABベースOLLAは、BLERの正確性とスペクトル効率の面で、クラスタリングなどのヒューリスティック手法をどの程度上回るか?
  • RQ5提案手法は、高い割合のユーザーに対して目標BLERを保証するとともに、OLLAなしやヒューリスティック手法と比較してスループットを向上させることができるか?

主な発見

  • 提案されたMABベースOLLAは、7.5%の目標BLERを達成し、80%のユーザーがBLER ≤ 7.5%を達成した。これは誤り率制御の強力な性能を示している。
  • 7.5%の目標値におけるユーザー平均BLERは6.66%であり、目的を精度高く達成する高水準の一貫性を示している。
  • スループット性能は優れており、MABを用いた場合30%のユーザーが2 Mbpsを超えるスループットを達成したが、クラスタリング手法ではわずか18%にとどまり、むしろOLLAなしのベースラインよりも劣っていた。
  • MABの平均オフセット値は-2.39であり、信頼性とレートのバランスの取れた妥当な選択を示している。一方、クラスタリング手法は過剰に慎重なオフセット< -4を採用していた。
  • MABベース手法の平均スループットは1.55 Mbpsであり、クラスタリング手法(1.25 Mbps)およびOLLAなしベースライン(1.43 Mbps)を上回った。
  • 大偏差境界と信頼区間を用いることで、サンプル複雑性が顕著に低減され、最適なオフセットへの高速かつ信頼性の高い収束が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。