[論文レビュー] Low-rank Bandits with Latent Mixtures
本稿は、ユーザーの好みとアイテム報酬の両方が事前に未知である二面的不確実性を有するレコメンデーションシステムに対して、ユーザーをC個の代表的クラスの潜在的混合としてモデル化することで、新たなバンドイットアルゴリズムを提案する。OFULとロバストテンソルパワー法を組み合わせることで、部分的フィードバックと低ランク報酬構造の下で、T回の相互作用後、$ ilde{O}(Cackslashsqrt{BT})$のレグレットバウンドを達成する。ここでBはユーザー数を表す。
We study the task of maximizing rewards from recommending items (actions) to users sequentially interacting with a recommender system. Users are modeled as latent mixtures of C many representative user classes, where each class specifies a mean reward profile across actions. Both the user features (mixture distribution over classes) and the item features (mean reward vector per class) are unknown a priori. The user identity is the only contextual information available to the learner while interacting. This induces a low-rank structure on the matrix of expected rewards r a,b from recommending item a to user b. The problem reduces to the well-known linear bandit when either user or item-side features are perfectly known. In the setting where each user, with its stochastically sampled taste profile, interacts only for a small number of sessions, we develop a bandit algorithm for the two-sided uncertainty. It combines the Robust Tensor Power Method of Anandkumar et al. (2014b) with the OFUL linear bandit algorithm of Abbasi-Yadkori et al. (2011). We provide the first rigorous regret analysis of this combination, showing that its regret after T user interactions is $\ ilde O(C\\sqrt{BT})$, with B the number of users. An ingredient towards this result is a novel robustness property of OFUL, of independent interest.
研究の動機と目的
- 限られたユーザーの相互作用の下で、事前にユーザーとアイテムの特徴が未知であるオンラインレコメンデーションの課題に対処すること。
- ユーザーをC個の潜在的クラス上の確率的混合としてモデル化し、各クラスがアイテムごとに異なる報酬プロファイルを持つようにし、低ランク報酬行列を形成すること。
- 部分的でバンドイット形式のフィードバックから、ユーザークラスの混合とアイテム報酬プロファイルを同時に学習するバンドイットアルゴリズムを開発すること。
- 潜在的混合モデルを用いたこの二面的不確実性設定における、バンドイットアルゴリズムに対する最初の厳密なレグレット解析を提供すること。
- ノイズが伴う部分的観測から得られる推定共分散行列に対して、OFULのロバスト性を確立すること。
提案手法
- 低ランク構造と部分的フィードバックを扱うために、OFUL線形バンドイットアルゴリズムとロバストテンソルパワー(RTP)法の変種を統合する。
- バンドイット設定における単一行動からのフィードバックから、報酬の2次および3次モーメントを推定するためのインポートランスサンプリング方式を用いる。
- 1つのサブルーチン(アルゴリズム1)を用いて、ノイズが伴う部分的観測からアイテム側の特徴(各クラスごとの潜在的報酬ベクトル)を回復する。
- 正則化を施して共分散行列の逆行列存在を保証するように、OFULを用いてユーザーの好みベクトルの信頼性楕円体を維持する。
- モーメントテンソルの推定誤差が生じる状況でも、推定共分散行列が良好に条件付けられていることを示すことで、OFULのロバスト性を保証する。
- 高確率集中不等式と行列摂動理論を用いて、推定されたユーザーおよびアイテム特徴の誤差を制御する。
実験結果
リサーチクエスチョン
- RQ1ユーザーの好みとアイテム報酬プロファイルが両方とも潜在的かつ事前に未知であるレコメンデーションシステムにおいて、バンドイットアルゴリズムが低レグレットを達成できるか。
- RQ21回の相互作用ごとに1つの報酬しか得られない部分的フィードバックがある状況で、報酬行列の低ランク構造をどのように活用できるか。
- RQ3二面的不確実性下で、OFULとテンソルベース推定を統合したハイブリッドアルゴリズムのレグレット性能はいかほどか。
- RQ4共分散行列がノイズが伴うバンドイットレベルの観測から推定される場合でも、OFULアルゴリズムがレグレット保証を維持できるか。
- RQ5推定誤差が存在する状況でも、推定共分散行列の逆行列存在性と安定性を保証する条件は何か。
主な発見
- 提案されたアルゴリズムは、T回のユーザー相互作用後、$ackslashtilde{O}(Cackslashsqrt{BT})$のレグレットバウンドを達成する。ここでBはユーザー数、Cは潜在的ユーザークラス数を表す。
- 各ユーザーが少ない回数しか相互作用しないという仮定の下で、このレグレットバウンドは成り立つ。ユーザーおよびアイテムの特徴に関する事前知識は不要である。
- OFULの新たなロバスト性の性質が確立され、共分散行列の推定誤差が存在する場合でも、レグレット保証が維持されることを示した。
- 提案されたインポートランスサンプリング方式の下で、RTP法による潜在的報酬ベクトルの回復が一貫していることが示された。
- 初期相互作用数$n_0$が、$A$、$C$、$ackslashdelta$、および真の報酬行列の固有値特性を含む特定の下限を満たす限り、アルゴリズムの性能は高確率$1 - \delta$で保証される。
- 分析により、観測数が真の行列の条件数およびスペクトルギャップに結びつく閾値を超えると、推定共分散行列が高確率で逆行列をもつことが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。