Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Linear Bandits with Hidden Low Rank Structure

Sahin Lale, Kamyar Azizzadenesheli|arXiv (Cornell University)|Jan 28, 2019
Advanced Bandit Algorithms Research参考文献 23被引用数 14
ひとこと要約

本稿では、主成分分析(PCA)に基づく射影を用いて高次元の行動表現に隠された低ランク構造を特定する、Projected Stochastic Linear Bandit(PSLB)というアルゴリズムを提案する。この手法により、確率的線形バンディットにおける後悔が著しく低減される。教師ありでない行動ベクトルを活用して部分空間を回復することで、PSLBは埋め込み次元 $d$ ではなく、内在的部分空間次元 $Ω$ に依存する後悔バウンドを達成し、$d=1000$ のような高次元設定(MNIST や CIFAR-10)において OFUL を上回る性能を発揮する。

ABSTRACT

High-dimensional representations often have a lower dimensional underlying structure. This is particularly the case in many decision making settings. For example, when the representation of actions is generated from a deep neural network, it is reasonable to expect a low-rank structure whereas conventional structures like sparsity are not valid anymore. Subspace recovery methods, such as Principle Component Analysis (PCA) can find the underlying low-rank structures in the feature space and reduce the complexity of the learning tasks. In this work, we propose Projected Stochastic Linear Bandit (PSLB), an algorithm for high dimensional stochastic linear bandits (SLB) when the representation of actions has an underlying low-dimensional subspace structure. PSLB deploys PCA based projection to iteratively find the low rank structure in SLBs. We show that deploying projection methods assures dimensionality reduction and results in a tighter regret upper bound that is in terms of the dimensionality of the subspace and its properties, rather than the dimensionality of the ambient space. We modify the image classification task into the SLB setting and empirically show that, when a pre-trained DNN provides the high dimensional feature representations, deploying PSLB results in significant reduction of regret and faster convergence to an accurate model compared to state-of-art algorithm.

研究の動機と目的

  • 高次元特徴空間($d$ が大きいとき)における標準的確率的線形バンディット(SLB)の高い後悔を解決すること。
  • スパarsity仮定が成り立たない状況においても、深層学習特徴などに共通する行動表現における隠れた低ランク構造を活用すること。
  • 選択された(教師あり)および選択されなかった(教師なし)両方の行動を用いて、元の低次元部分空間を回復する手法を開発すること。
  • 埋め込み次元 $d$ に依存する後悔依存を減らし、代わりに内在的部分空間次元 $\Upsilon$ に基づいた性能にすることにより、後悔バウンドを改善すること。
  • 部分空間回復の難易度に応じて動的に適応しつつ、後悔保証を維持できるアルゴリズムを設計すること。

提案手法

  • 意思決定集合に含まれるすべての行動ベクトルに対して主成分分析(PCA)を適用し、潜在的な低次元部分空間を推定する。
  • 各ラウンドで、すべての行動ベクトルを推定された $m$ 次元部分空間に射影することで次元削減を行い、学習を単純化する。
  • 射影された部分空間における未知の報酬パラメータの信頼集合を維持し、OFU(Optimism in the Face of Uncertainty)の原則に基づいた楽観的探索を実行する。
  • 推定された部分空間が不正確な場合でもロバスト性を保証するため、信頼集合の共通部分集合を用いる。これにより、OFUL よりも悪い性能にはならない。
  • 選択されなかった行動ベクトルを含む、すべての観測済み行動ベクトルを用いて部分空間推定を繰り返し更新することで、時間経過とともに回復精度を向上させる。
  • 射影された信頼集合を OFUL 形式のアルゴリズムに統合し、低次元空間における探索と活用のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1高次元確率的線形バンディットにおける教師なし行動ベクトルを、潜在的な低ランク構造を回復するためにどのように活用できるか?
  • RQ2真の行動表現が低次元部分空間に近い場合に達成可能な後悔バウンドは何か? そして、標準的 SLB のバウンドと比べてどうなるか?
  • RQ3スパarsity仮定が成り立たない高次元 SLB 環境(例:深層ニューラルネットワーク特徴)において、PCA を用いた射影が後悔を低減できるか?
  • RQ4埋め込み次元 $d$ が大きい(例:$d=1000$)状況で、部分空間次元 $m$ が中程度のとき、PSLB と OFUL の性能はどのように比較されるか?
  • RQ5PSLB が OFUL を上回る条件は何か? また、信頼集合の共通部分集合により、性能が同等に保たれる条件は何か?

主な発見

  • PSLB は後悔上界として $\widetilde{\mathcal{O}}\left(\min\left\{\Upsilon\sqrt{T}, d\sqrt{T}\right\}\right)$ を達成し、$\Upsilon \ll d$ の場合に $\widetilde{\mathcal{O}}\left(d\sqrt{T}\right)$ より顕著に改善される。
  • MNIST および CIFAR-10 における $d=1000$ の実験では、PSLB は OFUL よりも著しく低い後悔を達成しており、特に $m \geq 8$ の部分空間回復において顕著である。
  • $m=1$ であっても、PSLB は効果的な部分空間射影のおかげで初期ラウンドでほぼゼロの後悔を達成し、初期学習効率が非常に高いことが示された。
  • 部分空間回復が困難な場合でも、信頼集合の共通部分集合機構のおかげで、PSLB は OFUL と同等の性能を維持する。
  • $d=100$ で 1000 個の行動を含む ImageNet ベースの SLB では、PSLB は OFUL よりも速く収束し、はるかに少ない誤りを累積する。これは、教師なし行動ベクトルの活用のおかげである。
  • 実験結果から、PSLB の後悔はすべてのテストされた $d$ 値において OFUL より常に低く、$d$ が大きくなるほど差が広がることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。