Skip to main content
QUICK REVIEW

[論文レビュー] Multi-task Representation Learning with Stochastic Linear Bandits

Leonardo Cella, Karim Lounici|arXiv (Cornell University)|Feb 21, 2022
Advanced Bandit Algorithms Research被引用数 4
ひとこと要約

本稿では、タスク間の低ランク共有表現を事前にランクや可逆なアーム共分散の知識なしに暗黙的に学習する、マルチタスク確率的線形コンテキストバンディットにおけるトレースノルム正則化付きグリーディーポリシーを提案する。この手法は、$ T\tilde{O}(\text{poly}(r)\text{poly}(d)\text{poly}(N)) $ のレグレットバウンドを達成し、対数要因を除いてミニマックス最適であり、$ T \geq d $ の場合に特に独立タスク学習や従来の手法(例:MLingreedy)を著しく上回る性能を発揮する。

ABSTRACT

We study the problem of transfer-learning in the setting of stochastic linear bandit tasks. We consider that a low dimensional linear representation is shared across the tasks, and study the benefit of learning this representation in the multi-task learning setting. Following recent results to design stochastic bandit policies, we propose an efficient greedy policy based on trace norm regularization. It implicitly learns a low dimensional representation by encouraging the matrix formed by the task regression vectors to be of low rank. Unlike previous work in the literature, our policy does not need to know the rank of the underlying matrix. We derive an upper bound on the multi-task regret of our policy, which is, up to logarithmic factors, of order $\sqrt{NdT(T+d)r}$, where $T$ is the number of tasks, $r$ the rank, $d$ the number of variables and $N$ the number of rounds per task. We show the benefit of our strategy compared to the baseline $Td\sqrt{N}$ obtained by solving each task independently. We also provide a lower bound to the multi-task regret. Finally, we corroborate our theoretical findings with preliminary experiments on synthetic data.

研究の動機と目的

  • タスク間で共通する低次元表現を持つ確率的線形コンテキストバンディットにおける転移学習の課題に取り組むこと。
  • 真の共有表現行列のランクを事前に知る必要のないポリシーを開発すること。
  • 非可逆なアーム共分散行列に対してもロバストで、短い時間枠でも有効な手法を設計すること。
  • 事前に真の表現を知っているオラクルポリシーと同等のレグレットバウンドを達成すること。
  • 特に高次元空間や短い時間枠の設定において、独立タスク学習やMLingreedyなどの既存ベースラインを上回ること。

提案手法

  • タスク固有の回帰ベクトル行列に低ランク構造を促進するトレースノルム正則化に基づくグリーディーポリシーを採用する。
  • 制限された強い凸性条件の下でオラクル不等式を導出するための新規なマルティングルの集中評価を用いる。
  • 核ノルムを用いて低ランク解を促進する正則化付き経験的リスク最小化により、共有表現を推定する。
  • 事前にランクを指定する必要なく、内在する表現を段階的に学習する。
  • 最小限の仮定の下で動作する:アームの有界性も、アーム共分散行列の可逆性も仮定しない。
  • 計算効率が良く、各ステップで複雑な行列分解問題を解く必要がない。

実験結果

リサーチクエスチョン

  • RQ1真の低次元表現を事前に知らない状況でも、真の表現を既知とするオラクルポリシーと同等のレグレットを達成できるマルチタスクバンディットポリシーは構築可能か?
  • RQ2共有表現を有するマルチタスク線形バンディットにおいて、トレースノルム正則化は学習効率をどのように向上させるか?
  • RQ3タスク数 $ T $、次元 $ d $、時間枠 $ N $ が、統合学習ポリシーのレグレットに与える影響は何か?
  • RQ4ランクが誤って指定されたり、アーム共分散行列が特異的であったりする状況で、提案手法はMLingreedyなど既存手法と比べてどのように差をつけるか?
  • RQ5可逆なアーム共分散行列や有界なアーム特徴量を仮定しない状況でも、ミニマックス最適なレグレットを達成可能か?

主な発見

  • 提案手法は、対数要因を除いて $ T\sqrt{rN} + \sqrt{rNTd} $ のレグレットバウンドを達成し、これはミニマックス最適である。
  • 独立タスク学習が $ T\sqrt{dN} $ のオーダーのレグレットを示すのに対し、本手法のレグレットバウンドは著しく優れている。
  • すべての設定においてMLingreedyを上回り、特に $ d $ が大きく、または $ N $ が小さい場合に顕著な優位性を示す。
  • 誤ったランク推定でさえも、MLingreedyは本手法より劣り、本手法はランクの誤指定に対してもロバストである。
  • トレースノルムバンディットはITLおよびMLingreedyを常に上回り、$ r \approx d $ の場合、継続的な正則化効果によりオラクルポリシーでさえも凌駆する。
  • 数値実験により、次元やタスク数の変動に対しても本手法はロバストであり、全テスト設定でベースラインに対して一貫した性能向上を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。