[論文レビュー] Contextual Bandit with Missing Rewards
本稿では、オンラインクラスタリングを統合して欠損した報酬を補完することで、報酬が観測されない場合でも文脈から学習できるようにする、MLINUCBと呼ばれる文脈的バンディットアルゴリズムを提案する。文脈ベクトルがクラスタリングされた多様体上にあるとモデル化することで、特に報酬欠損率が高い状況下でも標準的なLINUCBよりも精度が向上し、実世界のデータセット(Internet Advertisements や Warfarin)において最大10.9%の精度向上を達成した。
We consider a novel variant of the contextual bandit problem (i.e., the multi-armed bandit with side-information, or context, available to a decision-maker) where the reward associated with each context-based decision may not always be observed("missing rewards"). This new problem is motivated by certain online settings including clinical trial and ad recommendation applications. In order to address the missing rewards setting, we propose to combine the standard contextual bandit approach with an unsupervised learning mechanism such as clustering. Unlike standard contextual bandit methods, by leveraging clustering to estimate missing reward, we are able to learn from each incoming event, even those with missing rewards. Promising empirical results are obtained on several real-life datasets.
研究の動機と目的
- 臨床試験や広告推薦システムなどで一般的に見られる報酬の欠損という課題に対処すること。
- 報酬フィードバックが部分的または完全に欠落している場合でも、文脈データからの有効な学習を可能にすること。
- 文脈ベクトルに構造的パターンを組み込むことで、標準的な文脈的バンディット手法(例:LINUCB)を改善すること。
- 文脈空間にクラスタリングされた多様体構造が存在する場合、クラスタリングに基づく報酬補完が性能向上をもたらすことを検証すること。
- クラスタ数や探索率といったハイパーパrameterがアルゴリズム性能に与える影響を調査すること。
提案手法
- LINUCB文脈的バンディットアルゴリズムにオンラインクラスタリングを統合し、類似した過去の文脈を用いて欠損報酬を推定する。
- k-meansクラスタリングを用いて文脈ベクトルをグループ化し、各文脈をクラスタに割り当てる。
- 同じクラスタからの観測済み報酬の平均値を用いて欠損報酬を補完する。類似した文脈は類似した報酬を示すと仮定する。
- 各クラスタ内で線形モデルを適用して期待報酬を予測し、LINUCBフレームワークのレグレットバウンドを維持する。
- クラスタ数 $N$ をハイパーパrameterとして扱い、オンライン最適化や適応的選択の可能性を含む。
- 補完にクラスタ報酬の重み付き平均を用い、複数の近隣クラスタ($m > 1$)への拡張も可能である。
実験結果
リサーチクエスチョン
- RQ1報酬が欠損している状況下で、クラスタリングに基づく報酬補完は文脈的バンディットの性能を向上させるか?
- RQ2文脈ベクトルがクラスタリングされた多様体を形成するという仮定が、どのような条件下で性能向上をもたらすか?
- RQ3クラスタ数 $N$ が、標準的なLINUCBと比較して、提案手法の精度とレグレットに与える影響は何か?
- RQ4高い報酬欠損率に対しても、提案手法は低レグレットを維持できるか?
- RQ5オンライン学習中に最適なクラスタ数 $N$ を適応的に選択できるか?
主な発見
- Internet Advertisementsデータセットでは、25%の報酬が欠損している状況で、MLINUCBはLINUCBの86.6%から90.2%へと精度を向上させた。
- 50%の報酬が欠損している場合、同じデータセットで精度は82.4%から90.3%に上昇し、高い欠損率に対しても頑健であることが示された。
- 75%の報酬が欠損している場合、精度は78.6%から89.6%に上昇し、極端な欠損率下でも一貫した向上が確認された。
- Warfarinデータセットでは、2次元PCAで分散の98.2%を捉えており、MLINUCBは全テストクラスタ数でLINUCBを上回った。
- CNAE-9データセットでは、2次元投影で分散が13.9%と低くても、MLINUCBは様々な探索率 $\alpha$ において常にLINUCBを上回った。
- 2次元PCAで分散が29.7%にとどまるCovertypeデータセットでは、MLINUCBに改善が見られず、多様体仮定が破綻していることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。