Skip to main content
QUICK REVIEW

[論文レビュー] Prediction with Corrupted Expert Advice

Idan Amir, Idan Attias|arXiv (Cornell University)|Feb 24, 2020
Advanced Bandit Algorithms Research参考文献 33被引用数 5
ひとこと要約

本稿では、時間に伴い減少するステップサイズを備えた適応的乗法的重みアルゴリズムを導入し、敵対的に入力された確率的損失の下で予測の専門家アドバイス問題において定数レジストを達成することを示している。この変種が $\Theta(\log N / \Delta + C)$ の最適なレジストスケーリングを達成することを証明しており、時間の長さ $T$ とは無関係である。また、この状況下でオンラインミラー降下(OMD)を上回ることを示しており、腐敗状況下におけるFTRLとOMDフレームワークの根本的な相違を示している。

ABSTRACT

We revisit the fundamental problem of prediction with expert advice, in a setting where the environment is benign and generates losses stochastically, but the feedback observed by the learner is subject to a moderate adversarial corruption. We prove that a variant of the classical Multiplicative Weights algorithm with decreasing step sizes achieves constant regret in this setting and performs optimally in a wide range of environments, regardless of the magnitude of the injected corruption. Our results reveal a surprising disparity between the often comparable Follow the Regularized Leader (FTRL) and Online Mirror Descent (OMD) frameworks: we show that for experts in the corrupted stochastic regime, the regret performance of OMD is in fact strictly inferior to that of FTRL.

研究の動機と目的

  • 損失が確率的に生成されるが、敵対的腐敗にさらされる状況下で最適なレジストを達成する挑戦に対処すること。
  • 腐敗状態下での完全情報専門家問題におけるレジスト性能の理解のギャップを埋めること。先行研究は主にバンディット設定に焦点を当てていた。
  • 完全情報フィードバックが、腐敗状態下で専門家の数 $N$ に対する依存関係を線形から対数的に低下させることを可能にするかを調査すること。
  • FTRLに基づくアルゴリズム(例:提案された適応的乗法的重み)が、腐敗状態下の確率的状況でOMDに基づくアルゴリズムを上回ることを示すこと。
  • 任意の腐敗レベル $C$ に対して成立するレジスト解析を提供すること。$C$ の事前知識を必要としない。

提案手法

  • 時間に伴い減少するステップサイズ $\eta_t = c / \sqrt{t}$($c = \sqrt{\log N}$)を備えた古典的乗法的重みアルゴリズムの変種を提案し、未知の腐敗レベルに適応すること。
  • FTRLフレームワークに基づく新しい解析技術を用い、期待レジストを最良の専門家に割り当てられる確率の逆数 $p_{t+1,i^\star}$ を通じて制御する。
  • ホーフィングの補題と集中不等式を用いて、専門家と最良の専門家との損失差のモーメント生成関数を制御する。
  • レジスト解析を2段階に分解する:初期段階では腐敗が収束を遅らせる可能性があり、後続段階ではアルゴリズムが最良の専門家に集中する。
  • $t \geq t_1$ の場合に、劣悪な専門家を選ぶ確率の指数的減少が支配的になるように、閾値 $t_1$ を確立する。
  • FTRLのレジスト分解により $\mathbb{E}[\log(1/x)]$ がレジストを上界で制御できることを活用し、最終的な境界を $\log N$、$\Delta$、$C$ の関数として導出する。

実験結果

リサーチクエスチョン

  • RQ1損失が確率的に生成されるが、敵対的腐敗にさらされる状況下で、予測の専門家アドバイス問題において定数レジストを達成できるか?
  • RQ2完全情報設定では、バンディット設定とは異なり、腐敗状態下で専門家の数 $N$ に対して対数的依存関係を達成できるか?
  • RQ3FTRLに基づくアルゴリズムとOMDに基づくアルゴリズムの腐敗状態下の確率的状況における性能は、どのように比較できるか?
  • RQ4腐敗レベル $C$ の事前知識がなくても、1つの適応的アルゴリズムが確率的・腐敗状態・完全に敵対的状態のすべての状況で最適なレジストを達成できるか?
  • RQ5敵対的腐敗状態下の確率的専門家問題における最適なレジストスケーリングは何か?そして、単純でパラメータフリーなアルゴリズムで達成可能か?

主な発見

  • 提案された適応的乗法的重みアルゴリズムは、$\mathbb{E}[\overline{\mathcal{R}}_T] \leq \frac{256\log N}{\Delta}\log^2\left(\frac{8\log N}{\Delta}\right) + \frac{8\log N}{\Delta}$ のレジスト境界を達成し、これは $\Theta(\log N / \Delta + C)$ に相当し、$T$ とは無関係である。
  • アルゴリズムは、完全に確率的、敵対的腐敗、完全に敵対的の3つの状況すべてにおいて最適に動作し、$C$ の知識を必要としない。
  • レジスト境界は $N$ に対して対数的であり、ギャップ $\Delta$ に対して逆数の依存関係を示しており、腐敗状態下で完全情報フィードバックが $N$ に対する対数的依存関係を可能にすることを確認している。
  • FTRLに基づくアルゴリズム(例:提案手法)は、腐敗状態下の確率的状況で、OMDに基づくアルゴリズムを厳密に上回るレジスト性能を達成する。
  • 解析により、わずかな敵対的腐敗であっても、$C$ 回の腐敗ラウンドを超えては収束が著しく遅れないことが明らかになった。これは適応的ステップサイズのおかげである。
  • 境界は対数的要因を除いてタイトであり、この設定下で $\Theta(\log N / \Delta + C)$ が最適なレジストスケーリングであると確立している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。