Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Learning for Sequential Decision Making for Expensive Cost Functions with Stochastic Binary Feedbacks

Yingfei Wang, Chu Wang|arXiv (Cornell University)|Sep 13, 2017
Advanced Bandit Algorithms Research参考文献 3被引用数 4
ひとこと要約

本稿は、高価なバイナリフィードバックにおける逐次的意思決定のための知識勾配(KG)方策を提案する。オンラインベイジアンロジスティック回帰を用いてアクティブサンプリングをガイドする。KGは初期段階で最先端の手法を一貫して上回り、漸近的に最適であり、推定子の一致性および漸近正規性に関する理論的保証を持つ。

ABSTRACT

We consider the problem of sequentially making decisions that are rewarded by "successes" and "failures" which can be predicted through an unknown relationship that depends on a partially controllable vector of attributes for each instance. The learner takes an active role in selecting samples from the instance pool. The goal is to maximize the probability of success in either offline (training) or online (testing) phases. Our problem is motivated by real-world applications where observations are time-consuming and/or expensive. We develop a knowledge gradient policy using an online Bayesian linear classifier to guide the experiment by maximizing the expected value of information of labeling each alternative. We provide a finite-time analysis of the estimated error and show that the maximum likelihood estimator based produced by the KG policy is consistent and asymptotically normal. We also show that the knowledge gradient policy is asymptotically optimal in an offline setting. This work further extends the knowledge gradient to the setting of contextual bandits. We report the results of a series of experiments that demonstrate its efficiency.

研究の動機と目的

  • 医療試験、ナノチューブ生産、ローン承認など、現実世界の応用における高価で確率的バイナリフィードバックを伴う逐次的意思決定の課題に対処する。
  • 各高価な実験後に信念を効率的に更新できるスケーラブルでオンラインのベイジアン線形分類器を開発する。
  • サンプリング意思決定をガイドするため、情報の期待価値を最大化する知識勾配方策を設計する。
  • KG方策下での最尤推定子の推定誤差、一貫性、および漸近正規性に関する有限時間理論的保証を確立する。
  • 一部の属性が制御不能(例:医療意思決定における患者の特徴)であるコンテキストバンドイット設定にKGフレームワークを拡張する。

提案手法

  • 逐次的観測を用いて、モデルパラメータの後方分布を再帰的に更新するオンラインベイジアンロジスティック回帰を用いる。
  • 知識勾配を、各候補代替案を測定することで得られる成功確率の期待改善として定式化する。
  • ロジスティックモデルにおけるKG計算における扱いにくい期待値を処理するため、解析的近似(例:ラプラス近似)を適用する。
  • 探索と活用のバランスを取る逐次的意思決定フレームワークにKG方策を統合し、期待情報量の増加が最大の代替案を優先する。
  • 制御可能な行動と制御不能なコンテキストベクトルの両方を関数として含む意思決定方策として、方法をコンテキストバンドイットに拡張する。
  • 潜在関数におけるUCB、ランダムサンプリング、最も不確実なサンプリング、期待改善、トフリンサンプリングを含むベースラインと比較して実装する。

実験結果

リサーチクエスチョン

  • RQ1限られた高価な実験予算の中で、最良の代替案を特定する確率を最大化するサンプリング方策はどのように設計できるか?
  • RQ2知識勾配方策によって逐次的に選択されたサンプルに基づく最尤推定子の理論的性質は何か?
  • RQ3知識勾配方策は、既存のアクティブラーニングおよびベイジアン最適化手法と比較して、初期段階の性能および収束性においてどのように異なるか?
  • RQ4知識勾配は、一部の属性が制御不能なコンテキストバンドイット問題に効果的に拡張可能か?
  • RQ5オフライン設定において知識勾配方策は漸近的に最適であるか?また、推定されたモデルパラメータの有限時間誤差バウンドは何か?

主な発見

  • 知識勾配方策は、特に小さな実験予算下で、ランダムサンプリング、最も不確実なサンプリング、期待改善よりも顕著に優れている。
  • KG方策下で逐次的に選択された点に基づく最尤推定子は、有限時間解析により一貫性があり、漸近的に正規分布に従うことが証明された。
  • KG方策はオフライン設定において漸近的に最適であり、実験回数が増加するにつれて、高確率で最良の意思決定に収束する。
  • トフリンサンプリングと期待改善は良好な性能を示すが、KGに比べて初期段階の学習において劣り、KGの将来の結果の不確実性を明示的にモデル化している点がその理由である。
  • 潜在関数 $\bm{w}^T\bm{x}$ に基づくUCBベースの方策は、確率空間への非線形変換に伴う分散伝播の歪みにより、劣化している。
  • 提案手法は高次元設定に対しても効果的にスケーリングでき、このような状況下でのガウス過程ベースのベイジアン最適化の制限を克服した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。