Skip to main content
QUICK REVIEW

[論文レビュー] Neural Contextual Bandits with Upper Confidence Bound-Based Exploration

Dongruo Zhou, Lihong Li|arXiv (Cornell University)|Nov 11, 2019
Advanced Bandit Algorithms Research被引用数 6
ひとこと要約

この論文では、表現学習に深層ニューラルネットワークを用い、探索のための上側信頼区間(UCB)を構築するニューラルネットワークベースの文脈的バンディットアルゴリズム、NeuralUCBを提案する。標準的な仮定の下で、$ ilde{O}( ext{sqrt}{T})$ のレグレットを達成し、パラメトリックな仮定が弱い状況でも近似的に最適なレグレット保証を持つ最初のニューラル文脈的バンディットアルゴリズムである。

ABSTRACT

We study the stochastic contextual bandit problem, where the reward is generated from an unknown function with additive noise. No assumption is made about the reward function other than boundedness. We propose a new algorithm, NeuralUCB, which leverages the representation power of deep neural networks and uses a neural network-based random feature mapping to construct an upper confidence bound (UCB) of reward for efficient exploration. We prove that, under standard assumptions, NeuralUCB achieves $ ilde O(\sqrt{T})$ regret, where $T$ is the number of rounds. To the best of our knowledge, it is the first neural network-based contextual bandit algorithm with a near-optimal regret guarantee. We also show the algorithm is empirically competitive against representative baselines in a number of benchmarks.

研究の動機と目的

  • ニューラルネットワークベースの文脈的バンディットアルゴリズムにおけるレグレット保証の欠如に対処すること。
  • 確率的文脈的バンディットにおける表現学習に深層ニューラルネットワークを活用する手法を開発すること。
  • 報酬関数に関する強い仮定を必要とせず、上側信頼区間(UCB)機構による効率的な探索を保証すること。
  • 報酬関数に関するパrametricな仮定がなくても、近似的に最適なレグレット性能を達成すること。
  • ベンチマーク環境において、既存の最先端のベースラインと比較して実験的に競争力のある性能を示すこと。

提案手法

  • 文脈から低次元の表現へのランダム特徴マッピングを学習するための深層ニューラルネットワークを用いる。
  • ニューラルネットワークの予測値と不確実性推定値を用いて、期待報酬の上側信頼区間(UCB)を構築する。
  • 確率的文脈的バンディット設定において、探索と活用のバランスをUCB原理を用いて実現する。
  • 報酬関数の有界性仮定のみで、報酬の加法的ノイズに対してもUCB構築が頑健であることを保証する。
  • 標準的な一般化および集中不等式を活用し、弱い仮定の下でレグレット保証を導出する。
  • ニューラルネットワークの出力を用いて期待報酬とその不確実性を推定し、根拠に基づいた探索を可能にする。

実験結果

リサーチクエスチョン

  • RQ1報酬関数に関する強いパラメトリックな仮定がなくても、ニューラルネットワークベースの文脈的バンディットアルゴリズムは近似的に最適なレグレットを達成できるか?
  • RQ2深層表現学習をバンディット設定における上側信頼区間探索と効果的に組み合わせることは可能か?
  • RQ3標準的な仮定の下で、ニューラルネットワークベースの文脈的バンディットアルゴリズムに確立可能な理論的レグレット境界は何か?
  • RQ4提案手法は、性能とサンプル効率の観点から、既存のベースラインと比較してどのように評価されるか?
  • RQ5深層ニューラルネットワークの表現力を利用しつつ、理論的保証を維持することは可能か?

主な発見

  • NeuralUCBは標準的な仮定の下で$\tilde{O}(\text{sqrt}{T})$ のレグレットを達成し、ニューラルネットワークベースの文脈的バンディットアルゴリズムにおいて、初めて近似的に最適なレグレット保証を確立した。
  • アルゴリズムは報酬関数の構造に関する事前知識が不要なまま、文脈表現の学習に深層ニューラルネットワークを活用している。
  • ニューラルネットワークの不確実性推定に基づく上側信頼区間の構築により、効率的な探索が保証されている。
  • 実験的評価では、NeuralUCBが複数のベンチマーク環境で最先端のベースラインと競争力のある性能を示している。
  • レグレット境界は報酬関数の有界性仮定のみで導出されており、パラメトリックまたは滑らかさの条件は必要としない。
  • 理論的分析により、アルゴリズムがラウンド数Tに対して良好にスケーリングされ、情報理論的下界に対して対数因子を除いて近づくことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。