Skip to main content
QUICK REVIEW

[論文レビュー] Online Learning in Contextual Bandits using Gated Linear Networks

Eren Sezener, Marcus Hütter|arXiv (Cornell University)|Feb 21, 2020
Advanced Bandit Algorithms Research参考文献 26被引用数 8
ひとこと要約

本稿では、Gated Linear Networks (GLNs) を活用して、文脈的バンディットにおける効率的で不確実性を考慮した探索を可能にするオンラインアルゴリズムである Gated Linear Contextual Bandits (GLCB) を提案する。GLNs の半空間ゲーティング構造を活用することで、SimHash を用いたシグネチャを用いて、アルゴリズム的オーバーヘッドをゼロに保ちつつスケーラブルでデータ依存の探索が可能な擬似カウントを計算する。この手法により、離散的および連続的バンディットベンチマークの両方で最先端の性能を達成するとともに、完全にオンラインなままである。

ABSTRACT

We introduce a new and completely online contextual bandit algorithm called Gated Linear Contextual Bandits (GLCB). This algorithm is based on Gated Linear Networks (GLNs), a recently introduced deep learning architecture with properties well-suited to the online setting. Leveraging data-dependent gating properties of the GLN we are able to estimate prediction uncertainty with effectively zero algorithmic overhead. We empirically evaluate GLCB compared to 9 state-of-the-art algorithms that leverage deep neural networks, on a standard benchmark suite of discrete and continuous contextual bandit problems. GLCB obtains median first-place despite being the only online method, and we further support these results with a theoretical study of its convergence properties.

研究の動機と目的

  • 効率的で不確実性に基づいた探索を可能にする完全なオンライン文脈的バンディットアルゴリズムの開発を目的とする。
  • 文脈的バンディットにおける非オンラインの深層特徴抽出や非オンラインのベイジアンニューラルネットワーク手法の限界を克服することを目的とする。
  • GLN ゲーティング構造から導出されるデータ依存の擬似カウントを用いて、高次元の文脈におけるスケーラブルな探索を可能とすることを目的とする。
  • GLN ゲーティングのインダクティブバイアスを活用することで、探索をモデルの不確実性と密接に結びつけること。
  • 標準ベンチマークで最先端の性能を達成するとともに、オンライン学習の効率性を維持すること。

提案手法

  • GLCB は、半空間ゲーティングを用いた Gated Linear Networks (GLNs) を用い、行動価値関数をモデル化することで、汎用関数近似と構造化されたインダクティブバイアスを実現する。
  • GLNs のゲーティング機構を再利用し、SimHash を用いたシグネチャを計算することで、探索用の擬似カウントを定義する。
  • 擬似カウントは各ゲーティングユニットごとに維持され、文脈シグネチャに基づいて段階的に更新され、高次元の状態間での一般化を可能にする。
  • 探索は、擬似カウントから計算されるUCBスタイルのボーナスによって駆動され、不確実性と行動選択が直接的に関連づけられる。
  • モデルパラメータは、行動回数に応じて減少する学習率を用いてオンラインで更新され、安定性と収束性が保証される。
  • 事後分布の近似やモンテカルロサンプリングを必要とせず、各行動に対して1つの、継続的に更新されるGLNを維持することで、再訓練にかかるコストを回避する。

実験結果

リサーチクエスチョン

  • RQ1深層学習ベースの文脈的バンディットアルゴリズムは、最先端の性能を達成しつつ、オンライン学習の能力を維持できるか?
  • RQ2GLN ゲーティング構造から導出される擬似カウントは、高次元の文脈において効果的に一般化できるか?
  • RQ3GLN ゲーティングと擬似カウントの結合は、標準的なベイジアンディープラーニング手法よりも優れた不確実性推定をもたらすか?
  • RQ4非オンラインのニューラルベイジアンバンディットアルゴリズムに比べ、多様なベンチマークで平均性能において優れるか?
  • RQ5GLN を用いた擬似カウントによる不確実性推定の計算オーバーヘッドは無視できるか?

主な発見

  • GLCB は、評価されたすべてのベンチマークで平均順位1位を達成し、9つの最先端の深層学習ベースの文脈的バンディットアルゴリズムを上回った。
  • 比較において唯一の完全なオンライン手法であるにもかかわらず、非オンラインのベイジアンニューラルネットワーク手法と同等またはそれ以上の性能を示した。
  • GLN ゲーティングに基づく擬似カウント機構は、最小限の計算オーバーヘッドで効果的でスケーラブルな探索を実現した。
  • UCBスタイルの探索戦略に関する理論的分析により、収束性の優れた性能が裏付けられた。
  • グリッドサーチによるハイパーパramータチューニングにより、ベルヌーイ分布および連続的バンディット問題を含む合成データおよび実世界のデータセットにおいて、安定した性能が得られた。
  • GLN ゲーティングの局所性に敏感なハッシュ特性を活用することで、高次元の文脈においても効果的な一般化が実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。