Skip to main content
QUICK REVIEW

[論文レビュー] Online Learning with Abstention

Corinna Cortes, Giulia DeSalvo|arXiv (Cornell University)|Mar 9, 2017
Advanced Bandit Algorithms Research参考文献 19被引用数 9
ひとこと要約

本稿では、時間変動するフィードバックグラフと履歴データを活用することで、確率的設定において顕著に改善されたレグret保証を達成する、新しいオンライン学習アルゴリズム ucb-gt を提案する。ucb-n の標準的拡張を上回り、完全情報ベースラインに近い性能を示し、複数のデータセットおよび不正答コストにおいて強力な実験的効果を示している。

ABSTRACT

We present an extensive study of the key problem of online learning where algorithms are allowed to abstain from making predictions. In the adversarial setting, we show how existing online algorithms and guarantees can be adapted to this problem. In the stochastic setting, we first point out a bias problem that limits the straightforward extension of algorithms such as UCB-N to time-varying feedback graphs, as needed in this context. Next, we give a new algorithm, UCB-GT, that exploits historical data and is adapted to time-varying feedback graphs. We show that this algorithm benefits from more favorable regret guarantees than a possible, but limited, extension of UCB-N. We further report the results of a series of experiments demonstrating that UCB-GT largely outperforms that extension of UCB-N, as well as more standard baselines.

研究の動機と目的

  • 予測を放棄するコストを伴うオンライン学習における課題に対処すること。この場合、予測を放棄する際のフィードバックは部分的である。
  • ucb-n などの標準的確率的バンディットアルゴリズムを不正答設定に拡張する際のバイアス問題を克服すること。
  • 時間変動するフィードバックグラフと履歴データを活用して、レグret性能を向上させる新しいアルゴリズム ucb-gt を設計すること。
  • 不正答フレームワーク下での敵対的および確率的設定において、理論的レグret保証を提供すること。
  • 多様なデータセットおよび不正答コストにおいて、ucb-gt が ucb-n や他のベースラインを実験的に上回ることを検証すること。

提案手法

  • 履歴データと時間変動する専門家行動に基づいて動的にフィードバックグラフを構築する、確率的バンディットアルゴリズム ucb-gt を提案。
  • 不正答損失に特化したサロゲート損失関数を用い、部分観測性を保ちつつ効率的な学習を可能にする。
  • 各専門家が仮説と拒否閾値で定義される予測子と不正答関数のペアからの専門家アドバイスを統合。
  • 時間とともに変化するフィードバックグラフ構造を採用し、どの専門家がアクティブで、その損失がどのように観測されるかを反映する。
  • オンライン学習におけるフィードバックグラフフレームワークを、不正答意思決定の時間変動性に適応させる。
  • サロゲート損失と部分的フィードバックを用いて ContextualExp3 を不正答設定に拡張し、敵対的環境下でのレグretバウンドを達成。

実験結果

リサーチクエスチョン

  • RQ1既存のオンライン学習アルゴリズムは、部分的フィードバックを伴う不正答オプションをどのように扱うことができるか?
  • RQ2敵対的および確率的設定下でのオンライン学習における不正答の理論的レグret保証は何か?
  • RQ3ucb-n の直感的な拡張が確率的設定で失敗する理由は何か?そしてこのバイアスはどのように是正できるか?
  • RQ4時間変動するフィードバックグラフは、オンライン学習における不正答のパフォーマンス向上に活用可能か?
  • RQ5ucb-gt は、多様なデータセットおよび不正答コストにおいて、ucb-n や他のベースラインと比較してどのように異なるか?

主な発見

  • ucb-gt は、HIGGS、phishing、ijcnn、covtype、eye、skin、cod-rna、guide、CIFAR など、すべてのテストデータセットで ucb-nt やヴァーチャル ucb を顕著に上回っている。
  • ucb-gt のレグretは、常に完全情報ベースライン(fs)に近く、実用的にはほぼ最適な性能を示している。
  • ucb-gt のフィードバックグラフにおけるエッジ数は 100万 ~ 300万に達し、これは ucb-nt の約 20万エッジ よりも少なくとも 5 倍以上多い。この点が、より良い情報共有に寄与している。
  • 不正答コストが高くなるに従い、選択された専門家が不正答する割合は減少するが、これは期待通りであり、全データセットで一貫した傾向を示している。
  • ucb-gt は、信頼度ベースの専門家や極端な不正答コスト(例:c=0.001 および c=0.9)を含む、さまざまな専門家設定においても強固なパフォーマンスを維持している。
  • 専門家の数やデータセットの特性の変化に対しても、ucb-gt のパフォーマンスは頑健であり、追加の実験すべてにおいて ucb-nt を一貫して上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。