[論文レビュー] The K-Nearest Neighbour UCB algorithm for multi-armed bandits with covariates
本稿では、共変数を伴うマルチアームバンディット問題に対して、メトリック空間内での局所的近傍推定を活用し、探索と活用のバランスを動的に調整するk-Nearest Neighbour UCBアルゴリズムを提案する。低次元の内在次元およびマージン条件のもとで、次元や時間枠の事前知識を必要とせず、最小最大最適なリグレットを達成する。
In this paper we propose and explore the k-Nearest Neighbour UCB algorithm for multi-armed bandits with covariates. We focus on a setting where the covariates are supported on a metric space of low intrinsic dimension, such as a manifold embedded within a high dimensional ambient feature space. The algorithm is conceptually simple and straightforward to implement. The k-Nearest Neighbour UCB algorithm does not require prior knowledge of the either the intrinsic dimension of the marginal distribution or the time horizon. We prove a regret bound for the k-Nearest Neighbour UCB algorithm which is minimax optimal up to logarithmic factors. In particular, the algorithm automatically takes advantage of both low intrinsic dimensionality of the marginal distribution over the covariates and low noise in the data, expressed as a margin condition. In addition, focusing on the case of bounded rewards, we give corresponding regret bounds for the k-Nearest Neighbour KL-UCB algorithm, which is an analogue of the KL-UCB algorithm adapted to the setting of multi-armed bandits with covariates. Finally, we present empirical results which demonstrate the ability of both the k-Nearest Neighbour UCB and k-Nearest Neighbour KL-UCB to take advantage of situations where the data is supported on an unknown sub-manifold of a high-dimensional feature space.
研究の動機と目的
- 既存の共変数付きマルチアームバンディットにおけるUCBベースのアルゴリズムの限界、特にユークリッド構造への依存性およびdyadic cubeへの分割に起因する問題を解決する。
- UCBogram や ABSE のような既存手法が内在次元や時間枠の事前知識を必要としているのを克服する。
- 共変数空間の低内在次元性および低ノイズ(マージン条件)に適応できる手法を開発し、リグレット性能を向上させる。
- UCBおよびKL-UCBの両バージョンに対してk-NNフレームワーク内での理論的保証を提供し、対数要因を除いて最小最大最適性を保証する。
- Wasserstein距離や編集距離によって定義される非ユークリッドメトリック空間(従来の手法が幾何的歪みにより失敗する場面)への応用を可能にする。
提案手法
- 現在の共変数のk-近傍をメトリック空間内で特定し、各アームの期待報酬を推定するk-Nearest Neighbour UCBアルゴリズムを提案する。
- k-近傍内の観測回数の逆数に比例する幅を有する信頼区間を用いて、各アームの上界信頼区間を構築する。
- メトリック空間構造を用いて近傍を定義することで、Wasserstein距離や編集距離によって定義される非ユークリッド空間にも適用可能となる。
- Kullback-Leibler情報量に基づく信頼区間を用いるk-NN KL-UCBの変種を導入し、報酬が有界な場合にタイトなリグレットバウンドを達成する。
- 報酬関数のリプシッツ連続性および報酬分布に対するマージン条件を仮定した理論的分析を実施する。
- 内在次元およびマージンパラメータに最適にスケーリングされるリグレットバウンドを導出する。このバウンドは、対数要因を除いて最小最大最適性を達成する。
実験結果
リサーチクエスチョン
- RQ1k-NNに基づくUCBアルゴリズムは、内在次元や時間枠の事前知識がなくても、共変数付きマルチアームバンディットで最小最大最適なリグレットを達成できるか?
- RQ2従来の分割ベース手法が失敗する非ユークリッドメトリック空間において、k-NN UCBアルゴリズムはどのように性能を発揮するか?
- RQ3高次元特徴空間に埋め込まれた低内在次元多様体に、どの程度適応的に対応できるか?
- RQ4報酬が有界でノイズが小さい条件下で、k-NN KL-UCBの変種は標準k-NN UCBよりもタイトなリグレットバウンドを達成できるか?
- RQ5マージン条件のもとでのk-NN UCBアルゴリズムの理論的リグレットバウンドは何か?また、既知の下界と比較してどうなるか?
主な発見
- k-Nearest Neighbour UCBアルゴリズムは、低内在次元性およびマージン条件のもとで、対数要因を除いて最小最大最適なリグレットバウンドを達成する。
- このアルゴリズムは、共変数の周辺分布の内在次元や時間枠の事前知識を必要とせず、適応的かつ実用的である。
- k-NN KL-UCBの変種は、KL情報量に基づくタイトな信頼区間を用いることで、有界報酬の下でより良好なリグレットバウンドを達成し、実験的性能が向上する。
- 理論的分析により、マージン条件のパラメータ$ \nu $のもとでリグレットが$ O(n^{1 - \frac{\nu+1}{d+2}}) $にスケーリングすることが示され、$ d $を内在次元として、既知の下界と対数要因を除いて一致する。
- 実験結果から、k-NN UCBおよびk-NN KL-UCBは、多様体が未知であっても、高次元特徴空間内の低次元部分多様体を効果的に活用していることが示された。
- 本手法は、Wasserstein距離や編集距離によって定義される非ユークリッドメトリック空間にも適用可能であり、従来の分割ベース手法が幾何的歪みにより失敗する場面でも有効である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。