Skip to main content
QUICK REVIEW

[論文レビュー] EE-Net: Exploitation-Exploration Neural Networks in Contextual Bandits

Yikun Ban, Yuchen Yan|arXiv (Cornell University)|Oct 7, 2021
Advanced Bandit Algorithms Research参考文献 35被引用数 10
ひとこと要約

この論文は、報酬推定(利用)のための1つのニューラルネットワークと、残差報酬増益を学習する(探索)ための別のニューラルネットワークを用いることで、利用と探索を分離する、新しいニューラルコンテキストバンドイットアルゴリズムEE-Netを提案する。報酬推定のバイアスに基づいて、上昇探索または下降探索を適応的に予測することで、EE-Netは $\mathcal{O}(\sqrt{T\log T})$ のレグレットバウンドを達成し、近似誤差を低減し、方向に依存する探索を可能にすることで、既存のニューラルバンドイット手法を上回る性能を発揮する。

ABSTRACT

In this paper, we propose a novel neural exploration strategy in contextual bandits, EE-Net, distinct from the standard UCB-based and TS-based approaches. Contextual multi-armed bandits have been studied for decades with various applications. To solve the exploitation-exploration tradeoff in bandits, there are three main techniques: epsilon-greedy, Thompson Sampling (TS), and Upper Confidence Bound (UCB). In recent literature, linear contextual bandits have adopted ridge regression to estimate the reward function and combine it with TS or UCB strategies for exploration. However, this line of works explicitly assumes the reward is based on a linear function of arm vectors, which may not be true in real-world datasets. To overcome this challenge, a series of neural bandit algorithms have been proposed, where a neural network is used to learn the underlying reward function and TS or UCB are adapted for exploration. Instead of calculating a large-deviation based statistical bound for exploration like previous methods, we propose "EE-Net", a novel neural-based exploration strategy. In addition to using a neural network (Exploitation network) to learn the reward function, EE-Net uses another neural network (Exploration network) to adaptively learn potential gains compared to the currently estimated reward for exploration. Then, a decision-maker is constructed to combine the outputs from the Exploitation and Exploration networks. We prove that EE-Net can achieve $\mathcal{O}(\sqrt{T\log T})$ regret and show that EE-Net outperforms existing linear and neural contextual bandit baselines on real-world datasets.

研究の動機と目的

  • 複雑で非線形な報酬構造を有する実世界の応用においてしばしば失敗する、コンテキストバンドイットにおける線形報酬仮定の限界を解消すること。
  • UCBおよびTSに基づくニューラルバンドイット手法が探索に統計的上界に依存するため生じる根本的な近似誤差を克服すること。
  • 報酬推定バイアスに基づいて、上昇または下降探索を適応的に決定するニューラルネットワークベースの探索戦略を開発すること。
  • 近似誤差の成分をニューラルネットワークの一般化誤差のみにまで削減することで、最先端のニューラルバンドイットアルゴリズムを上回るよりタイトなレグレットバウンドを達成すること。
  • 実世界のデータセットにおいて、線形およびニューラルバンドイットベースラインと比較して優れた経験的性能を示すこと。

提案手法

  • 履歴的なコンテキスト-報酬ペアを用いてリッジ回帰とニューラルネットワークフィッティングにより報酬関数を推定する利用ネットワーク $f_1$ を訓練する。
  • 報酬関数 $h(x)$ と $f_1(x)$ の差分 $h(x) - f_1(x)$ を学習する別個の探索ネットワーク $f_2$ を導入し、探索意思決定を支援する。
  • $f_2$ の出力を用いて探索方向を決定する:正の値は過小評価時における上昇探索を、負の値は過大評価時における下降探索を引き起こす。
  • $f_1$ と $f_2$ を線形または非線形なニューラルネットワークにより組み合わせる意思決定者 $f_3$ を構築し、推定値に加えて適応的探索ゲインに基づいてアームを選択する。
  • 標準的な過パラメータ化されたニューラルネットワークの仮定の下で、EE-Netが $\mathcal{O}(\sqrt{T\log T})$ のレグレットバウンドを達成することを証明し、先行手法と比較して $\sqrt{\log T}$ 要因の改善を達成する。
  • 探索ネットワークの学習目的を、真の報酬と $f_1$ の予測との差分である残差を教師データとして用いることで、探索可能性のエンドツーエンド学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1UCBおよびTSに基づくニューラルバンドイット手法と比較して、二重ネットワークのニューラルアーキテクチャがコンテキストバンドイットにおける探索精度とレグレットバウンドを向上させることができるか。
  • RQ2専用のニューラルネットワークを用いて報酬差分 $h(x) - f_1(x)$ を学習することで、固定またはランダムな探索戦略と比較して、より良い探索方向選択(上昇/下降)が達成できるか。
  • RQ3統計的信頼区間の上界に依存しない探索の分離によって、非線形報酬設定における近似誤差がどれほど低減され、レグレット性能が向上するか。
  • RQ4EE-Netのレグレットバウンドは、既存のニューラルバンドイットアルゴリズムと比較して、入力次元または有効次元に依存する程度はどのようになるか。
  • RQ5EE-Netは多様な実世界データセットに一般化可能であり、累積報酬性能において線形およびニューラルバンドイットベースラインを上回るか。

主な発見

  • EE-Netは $\mathcal{O}(\sqrt{T\log T})$ のレグレットバウンドを達成し、統計的上界に依存する既存のニューラルバンドイットアルゴリズムよりも $\sqrt{\log T}$ 要因の改善を達成する。
  • 探索ネットワーク $f_2$ は報酬推定バイアスの符号と大きさを学習することで、必要に応じて上昇および下降探索を可能にする適応的探索を実現する。
  • EE-Netは、リッジ回帰、NTK近似、カーネル距離成分の誤差が蓄積される既存手法とは異なり、近似誤差をニューラルネットワークの一般化誤差のみにまで削減する。
  • 4つの実世界データセットにおいて、EE-Netは累積報酬において線形およびニューラルバンドイットベースラインを上回り、優れた経験的性能を示す。
  • 過小評価および過大評価を検出できる能力により、UCB(常に上昇)やTS(ランダム方向)と比較して、より正確な探索が可能であることが、アブレーションおよび可視化研究で示された。
  • 理論的分析により、EE-Netのレグレットバウンドが入力次元および有効次元に依存しないことが確認され、高次元設定においてもロバストであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。