Skip to main content
QUICK REVIEW

[論文レビュー] Deep Contextual Multi-armed Bandits

Mark Collier, Héctor Llorens|arXiv (Cornell University)|Jul 25, 2018
Advanced Bandit Algorithms Research参考文献 22被引用数 10
ひとこと要約

本稿では、ベイジアンニューラルネットワークとコーンクリートドロップアウトを組み合わせることで、非線形な文脈的バンディット設定において原理的で適応的な探索を可能にする、ディープラーニングフレームワーク「ディープコンテキストマルチアームバンディット」を提案する。ドロップアウト率をエンドツーエンドで学習することにより、UCIマッシュルームおよびカジノパリティタスクの両方で、ε-greedyおよび固定ドロップアウトベースラインと比較して、顕著にレグレットを低減した。

ABSTRACT

Contextual multi-armed bandit problems arise frequently in important industrial applications. Existing solutions model the context either linearly, which enables uncertainty driven (principled) exploration, or non-linearly, by using epsilon-greedy exploration policies. Here we present a deep learning framework for contextual multi-armed bandits that is both non-linear and enables principled exploration at the same time. We tackle the exploration vs. exploitation trade-off through Thompson sampling by exploiting the connection between inference time dropout and sampling from the posterior over the weights of a Bayesian neural network. In order to adjust the level of exploration automatically as more data is made available to the model, the dropout rate is learned rather than considered a hyperparameter. We demonstrate that our approach substantially reduces regret on two tasks (the UCI Mushroom task and the Casino Parity task) when compared to 1) non-contextual bandits, 2) epsilon-greedy deep contextual bandits, and 3) fixed dropout rate deep contextual bandits. Our approach is currently being applied to marketing optimization problems at HubSpot.

研究の動機と目的

  • 従来の手法が同時に達成できない、非線形な文脈モデリングと原理的な探索の統合という課題に取り組むこと。
  • ディープコンテキストバンディットにおける線形モデルやε-greedy探索の限界を克服し、ベイジアンニューラルネットワークによる不確実性を考慮した探索を可能にすること。
  • ドロップアウト率の手動によるハイパーパrameterチューニングの必要性を排除し、トレーニング中にエンドツーエンドでそれらを学習可能にする。
  • 実世界のマーケティングおよび合成タスクにおいて、学習されたドロップアウトによる適応的探索が、レグレット最小化を改善することを実証的に検証すること。

提案手法

  • 推論時ドロップアウトとベイジアンニューラルネットワークにおける事後分布サンプリングの関係を活用し、探索にトムソンサンプリングを可能にする。
  • ベルヌーイドロップアウトの連続的リラクゼーションであるコーンクリートドロップアウトを適用し、微分可能で学習可能なドロップアウト率を用いて不確実性をモデル化し、勾配ベース最適化を可能にする。
  • 標準的なバックプロパゲーションを用いて、コーンクリートドロップアウトを伴う深層ニューラルネットワークをトレーニングし、勾配降下法により最適な探索レベルを学習可能にする。
  • 推論時においてトムソンサンプリングを適用:ドロップアウトを介して事後分布からのネットワーク重みのサンプリングを行い、サンプルされた重みの下で期待報酬が最大となる行動を選択する。
  • ネットワーク重みの事後分布を近似するための変分推論目的関数を採用し、完全なベイジアン推論を伴わずに不確実性の定量化を可能にする。
  • ドロップアウト率をトレーニング可能なパラメータとして扱い、より多くのデータが観測されるにつれて探索強度を自動で調整可能にする。

実験結果

リサーチクエスチョン

  • RQ1ディープニューラルネットワークは、文脈バンディットにおける複雑な非線形な文脈-行動関係をモデル化しつつ、原理的な探索を可能にすることができるか?
  • RQ2エンドツーエンドでドロップアウト率を学習することで、固定または手動でチューニングされたドロップアウト率と比較して、レグレット最小化が改善されるか?
  • RQ3非線形な文脈バンディットタスクにおいて、コーンクリートドロップアウトを用いたトムソンサンプリングは、ε-greedyおよび固定ドロップアウトベースラインと比較して、累積的レグレットの観点で優れているか?
  • RQ4学習されたドロップアウト率による適応的探索は、実世界の展開シナリオにおける手動によるハイパーパrameterチューニングの必要性を低減できるか?

主な発見

  • UCIマッシュルームタスクでは、提案手法が最終累積レグレット(FCR)252を達成し、ベルヌーイドロップアウト(FCR = 658)およびε-greedy(FCR = 1,718)と比較して顕著に低い水準に抑えた。
  • カジノパリティタスクでは、手法がFCR 1,258を達成し、ベルヌーイドロップアウト(FCR = 1,536)およびε-greedy(FCR = 2,718)を上回った。
  • 学習されたドロップアウト率を有するモデルは、固定レートドロップアウトと比較して最終レグレットを50%以上削減した。これは、収束が速く、探索の早期停止が達成されたことを示している。
  • 非文脈バンディット(マッシュルームタスクでFCR = 24,048、カジノパリティでFCR = 25,102)と比較して、本手法は顕著に優れており、文脈モデリングの価値を示している。
  • レグレット曲線の不連続性(指数的再トレーニングと併せて)から、モデルが時間経過とともに探索を減少させていることが裏付けられた。
  • 本手法は現在、実世界のマーケティング最適化タスクのため、HubSpotで展開中であり、実用的かつスケーラブルであることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。