Skip to main content
QUICK REVIEW

[論文レビュー] Online Learning and Decision-Making under Generalized Linear Model with High-Dimensional Data

Xue Wang, Mike Mingcheng Wei|arXiv (Cornell University)|Dec 7, 2018
Advanced Bandit Algorithms Research参考文献 31被引用数 3
ひとこと要約

本稿では、高次元一般化線形モデルにおけるオンライン意思決定のためのミニマックス凸ペナルティ付きマルチアームバンディット手法、G-MCP-Banditアルゴリズムを提案する。時間的要因においては最適な $O(\log T)$ のリグレットを達成し、共変量次元においては $O(\log d)$ のスケーリングを示す。非i.i.d.かつスパースなデータ下でも正確な推定を可能にする2段階の重み付きLasso手順を用いることで、合成データおよびワルファリン投与量や検索広告といった実世界のデータセットにおいて、既存のベンチマークを上回る性能を発揮する。

ABSTRACT

We propose a minimax concave penalized multi-armed bandit algorithm under generalized linear model (G-MCP-Bandit) for a decision-maker facing high-dimensional data in an online learning and decision-making process. We demonstrate that the G-MCP-Bandit algorithm asymptotically achieves the optimal cumulative regret in the sample size dimension T , O(log T), and further attains a tight bound in the covariate dimension d, O(log d). In addition, we develop a linear approximation method, the 2-step weighted Lasso procedure, to identify the MCP estimator for the G-MCP-Bandit algorithm under non-iid samples. Under this procedure, the MCP estimator matches the oracle estimator with high probability and converges to the true parameters with the optimal convergence rate. Finally, through experiments based on synthetic data and two real datasets (warfarin dosing dataset and Tencent search advertising dataset), we show that the G-MCP-Bandit algorithm outperforms other benchmark algorithms, especially when there is a high level of data sparsity or the decision set is large.

研究の動機と目的

  • 個人向け医療や標的広告などの実世界の応用において、高次元的かつスパースなデータ下でのオンライン学習と意思決定の課題に対処すること。
  • 一般化線形モデル下で、時間 $T$ および共変量次元 $d$ の両方において最適なリグレットスケーリングを維持するバンディットアルゴリズムの開発。
  • 非i.i.d.なサンプルが限られている高次元設定において、新規の2段階重み付きLasso手順を用いて正確なパラメータ推定を可能にすること。
  • データスパarsityおよび大規模な意思決定集合に適応できるようにアルゴリズムを設計し、既存のベンチマークを上回ること。

提案手法

  • 高次元一般化線形モデルにおけるミニマックス凸ペナルティ(MCP)とマルチアームバンディットフレームワークを統合したG-MCP-Banditアルゴリズムを提案する。
  • 非i.i.d.サンプリング下でMCP推定量を推定するために2段階の重み付きLasso手順を採用し、高確率で一貫性を保証する。
  • 適切な正則化条件の下で、MCP推定量がオラクル推定量と一致することを理論的に示す。
  • 累積リグレットの漸近的最適性を確立し、時間的要因では $O(\log T)$、共変量次元では $O(\log d)$ のスケーリングを達成する。
  • 推定誤差および高次元パrameter空間における勾配条件を制御するために、濃度不等式および行列ノルムの境界を用いる。
  • イベントベースの解析と高確率境界を適用し、スパarsity下でオラクル推定量が高確率で回復されることを保証する。

実験結果

リサーチクエスチョン

  • RQ1一般化線形モデル下で高次元的オンライン学習において、バンディットアルゴリズムが最適な $O(\log T)$ のリグレットを達成できるか?
  • RQ2高次元的設定下で非i.i.d.かつスパースなサンプリング条件下で、正確なパラメータ推定をどのように達成できるか?
  • RQ3提案された2段階重み付きLasso手順により、オラクル推定量と高確率で一致するMCP推定量が得られるか?
  • RQ4G-MCP-Banditアルゴリズムは、データがスパースまたは意思決定集合が大規模な状況において、既存のベンチマークを上回る性能を示すか?
  • RQ5提案手順下での推定量の収束速度は何か? また、最適なレートに達しているか?

主な発見

  • G-MCP-Banditアルゴリズムは、時間枠 $T$ において漸近的に最適な累積リグレット $O(\log T)$ を達成する。
  • 共変量次元 $d$ において、タイトなリグレット境界 $O(\log d)$ を達成し、高次元特徴へのスケーラビリティを示す。
  • 2段階重み付きLasso手順により、非i.i.d.サンプリング下でMCP推定量が高確率でオラクル推定量と一致することが保証される。
  • 推定量は理論的誤差境界により、真のパラメータに対して最適レートで収束することが確認された。
  • 実験的結果では、G-MCP-Banditは特にデータがスパースでかつ意思決定集合が大規模な状況において、ベンチマークアルゴリズムを上回る性能を示した。
  • 理論的解析により、勾配条件 $\|\nabla_{\mathcal{S}^c}\mathcal{L}(\bm{\beta}^{oracle})\|_\infty \leq \left(1 - \frac{96ns}{|\mathcal{A}|\kappa a}\right)\lambda$ が高確率で成立することが確認され、モデル選択の一貫性が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。