Skip to main content
QUICK REVIEW

[論文レビュー] Instance-Wise Minimax-Optimal Algorithms for Logistic Bandits

Marc Abeille, Louis Faury|arXiv (Cornell University)|Oct 23, 2020
Advanced Bandit Algorithms Research参考文献 18被引用数 5
ひとこと要約

この論文は、ロジスティックバンディットにおけるインスタンスワイズミニマックス最適なアルゴリズム OFULog を導入し、$\tilde{\mathcal{O}}(d\sqrt{T/\kappa})$ のレグレットバウンドを達成する。これは従来の $\tilde{\mathcal{O}}(d\sqrt{T} + \kappa)$ の保証と比べて顕著な改善である。解析により、恒久的(permanent)と一時的(transitory)の二つのレグレット領域が明らかになり、非線形性が有利な場合に探索を容易にすることが示された。また、新たな問題依存の下界を用いて、レグレットスケーリングのミニマックス最適性が証明された。

ABSTRACT

Logistic Bandits have recently attracted substantial attention, by providing an uncluttered yet challenging framework for understanding the impact of non-linearity in parametrized bandits. It was shown by Faury et al. (2020) that the learning-theoretic difficulties of Logistic Bandits can be embodied by a large (sometimes prohibitively) problem-dependent constant $κ$, characterizing the magnitude of the reward's non-linearity. In this paper we introduce a novel algorithm for which we provide a refined analysis. This allows for a better characterization of the effect of non-linearity and yields improved problem-dependent guarantees. In most favorable cases this leads to a regret upper-bound scaling as $ ilde{\mathcal{O}}(d\sqrt{T/κ})$, which dramatically improves over the $ ilde{\mathcal{O}}(d\sqrt{T}+κ)$ state-of-the-art guarantees. We prove that this rate is minimax-optimal by deriving a $Ω(d\sqrt{T/κ})$ problem-dependent lower-bound. Our analysis identifies two regimes (permanent and transitory) of the regret, which ultimately re-conciliates Faury et al. (2020) with the Bayesian approach of Dong et al. (2019). In contrast to previous works, we find that in the permanent regime non-linearity can dramatically ease the exploration-exploitation trade-off. While it also impacts the length of the transitory phase in a problem-dependent fashion, we show that this impact is mild in most reasonable configurations.

研究の動機と目的

  • 非線形性の問題依存的影響を解明すること。これは定数 $\kappa$ で表現される。
  • 従来の研究と比較して、よりタイトでインスタンスワイズ最適なレグレット保証を達成するアルゴリズムを開発すること。
  • 頻度的およびベイジアンの視点を統合するために、二つの明確なレグレット領域を同定すること。
  • 改善されたレグレットスケーリングがミニマックス最適であることを、新たな問題依存の下界を用いて証明すること。
  • 理論的保証を失うことなく、実装可能な凸緩和を設計すること。

提案手法

  • インスタントワイズのレグレット行動における長期的(恒久的)領域と一時的領域を区別する新しいアルゴリズム OFULog を提案する。
  • 洗練された解析により、恒久的領域ではレグレットが $\tilde{\mathcal{O}}(d\sqrt{T/\kappa})$ のスケーリングに従うことを示す。
  • 楕円型ポテンシャル補題において時変正則化を適用し、解析における正則化の増加を扱う。
  • レグレットスケーリングのミニマックス最適性を証明するため、$\Omega(d\sqrt{T/\kappa})$ の問題依存の下界を導出する。
  • 有限の腕集合に対して実装可能でありながら理論的保証を維持する OFULog の凸緩和を導入する。
  • ロジスティックリンク関数の構造と報酬関数の曲率を活用し、$\kappa$ が探索に与える影響を特徴づける。

実験結果

リサーチクエスチョン

  • RQ1有利なインスタンスにおいて、ロジスティックバンディットのレグレットを $\tilde{\mathcal{O}}(d\sqrt{T/\kappa})$ のスケーリングに改善できるか?
  • RQ2ロジスティックバンディットにおいて、$\tilde{\mathcal{O}}(d\sqrt{T/\kappa})$ のレグレットスケーリングはミニマックス最適か?
  • RQ3非線形性($\kappa$ で測定)は、恒久的領域における探索と活用のトレードオフにどのように影響するか?
  • RQ4$\kappa$ は、レグレットの進化における一時的フェーズの長さにどのような影響を与えるか?
  • RQ5非凸最適化に依存せずに問題の複雑さに適応できる、理論的に妥当かつ実装可能なアルゴリズムを設計できるか?

主な発見

  • 提案された OFULog アルゴリズムは、恒久的領域で $\tilde{\mathcal{O}}(d\sqrt{T/\kappa})$ のレグレットバウンドを達成し、従来の $\tilde{\mathcal{O}}(d\sqrt{T} + \kappa)$ のバウンドと比べて顕著な改善を示した。
  • 問題依存の下界 $\Omega(d\sqrt{T/\kappa})$ が確立され、$\tilde{\mathcal{O}}(d\sqrt{T/\kappa})$ のスケーリングがミニマックス最適であることが証明された。
  • 非線形性($\kappa$ で測定)は、恒久的領域において探索と活用のトレードオフを著しく緩和することが示され、非線形性が常に悪影響を及えるという従来の考えとは対照的であった。
  • 従来のバウンドに含まれる $\kappa$ 依存項に対応する一時的フェーズは、ほとんどの合理的な設定において $\kappa$ よりもはるかに短く、初期段階のパフォーマンスへの影響は軽微であることが示された。
  • 理論的保証を維持しながらも、有限の腕集合に対して実装可能な OFULog の凸緩和が提供された。
  • 数値実験により、OFULog は GLM-UCB や LogUCB1 を上回る性能を示し、$\kappa$ の値が大きい(非線形性が強い)ほど性能が向上することが確認され、理論的知見が妥当であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。