Skip to main content
QUICK REVIEW

[論文レビュー] Fast Online Learning with Gaussian Prior-Driven Hierarchical Unimodal Thompson Sampling

Tianchi Zhao, He Liu|arXiv (Cornell University)|Feb 17, 2026
Advanced Bandit Algorithms Research被引用数 0
ひとこと要約

論文はガウスアームを持つクラスタリングされた構造および一様モーダリティを持つバンディットに対して、二つの Thompson Sampling 変種(TSCG と UTSCG)を導入し、より厳密な後悔境界を証明するとともに、mmWave およびポートフォリオの状況での性能を検証します。

ABSTRACT

We study a type of Multi-Armed Bandit (MAB) problems in which arms with a Gaussian reward feedback are clustered. Such an arm setting finds applications in many real-world problems, for example, mmWave communications and portfolio management with risky assets, as a result of the universality of the Gaussian distribution. Based on the Thompson Sampling algorithm with Gaussian prior (TSG) algorithm for the selection of the optimal arm, we propose our Thompson Sampling with Clustered arms under Gaussian prior (TSCG) specific to the 2-level hierarchical structure. We prove that by utilizing the 2-level structure, we can achieve a lower regret bound than we do with ordinary TSG. In addition, when the reward is Unimodal, we can reach an even lower bound on the regret by our Unimodal Thompson Sampling algorithm with Clustered Arms under Gaussian prior (UTSCG). Each of our proposed algorithms are accompanied by theoretical evaluation of the upper regret bound, and our numerical experiments confirm the advantage of our proposed algorithms.

研究の動機と目的

  • クラスタ化されたガウスフィードバックと一意な最適アームを持つ最適化問題のクラスを同定・形式化する。
  • クラスタ構造とモノトニティを活用して後悔を低減するアルゴリズムを開発する。
  • ガウス報酬の下で提案アルゴリズムの理論的後悔境界を提供する。
  • シミュレーションによる mmWave およびポートフォリオタスクでのベースライン手法に対する経験的改善を示す。

提案手法

  • アームをガウス分布としてモデル化し、K個のクラスタに分割して一意な最適アームを持つ。
  • ガウス事前を用いた Thompson Sampling(TSG)を二層構造(TSCG)に拡張し、まずクラスタを選択してからアームを選ぶ。
  • 各クラスタ内のモノモニティを活用するためにリーダーと隣接アームに焦点を当てて UTSCG を導入し、最適クラスタ内のモノモニティを利用する。
  • TSG(定理1)、TSCG(定理2)、UTSCG(定理3)について問題依存的な後悔境界を証明する。
  • より厳密な境界を導くためにクラスタ間強優越性とクラスタ内のモノモニティを仮定する。
  • mmWave ビーム/周波数選択とポートフォリオ型アーム生態系でのシミュレーションを用いて検証する。

実験結果

リサーチクエスチョン

  • RQ1一意な最適アームを持つクラスタ構造を有するガウスアームバンディットは、効率的に学習できるのか。
  • RQ2クラスタ構造とモノモニティを活用することで、標準的なガウス事前 Thompson Sampling を超える後悔低減が可能か。
  • RQ3ガウス報酬とモノモディアクラスタに対して TSCG および UTSCG の後悔境界はどのようになるのか。
  • RQ4mmWave およびポートフォリオ様の設定での経験的結果は理論的改善と整合するのか。

主な発見

  • TSCG はクラスタ構造を活用することで vanilla TSG より後悔を低減する(定理2)。
  • UTSCG は最適クラスタ内のモノモニティを利用してさらに後悔を低減する(定理3)。
  • 両アルゴリズムはシミュレーションにおいてベースライン(TSG、UCB、TLP)より累積後悔と真の最適アーム選択率の双方で優れている。
  • mmWave およびポートフォリオのシナリオにおける実験は、クラスタ情報を組み込んだアプローチが最適アームへの収束を早めることを確認。
  • 理論的結果は後悔境界がクラスタ数、最適クラスタのサイズ、クラスタリングの品質に依存し、総アーム数には依存しないことを示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。