Skip to main content
QUICK REVIEW

[論文レビュー] Online Clustering of Contextual Cascading Bandits

Shuai Li|arXiv (Cornell University)|Nov 23, 2017
Advanced Bandit Algorithms Research被引用数 10
ひとこと要約

本稿では、ユーザーの好みが未知のクラスタにグループ化され、ユーザーのクリック行動からのプレフィックスフィードバックを通じて学習される、文脈的カスケーディングバンディットのオンラインクラスタリングのためのアルゴリズムであるCLUB-cascadeを提案する。一般の場合に$ tilde{O}(ackslash sqrt{T})$のレグレットバウンドを達成し、特異な1クラスタ設定において先行研究を上回る性能を示し、MovieLens や Yelp などの実世界データセットおよび合成データセットでも優れた性能を発揮する。

ABSTRACT

We consider a new setting of online clustering of contextual cascading bandits, an online learning problem where the underlying cluster structure over users is unknown and needs to be learned from a random prefix feedback. More precisely, a learning agent recommends an ordered list of items to a user, who checks the list and stops at the first satisfactory item, if any. We propose an algorithm of CLUB-cascade for this setting and prove a $T$-step regret bound of order $ ilde{O}(\sqrt{T})$. Previous work corresponds to the degenerate case of only one cluster, and our general regret bound in this special case also significantly improves theirs. We conduct experiments on both synthetic and real data, and demonstrate the effectiveness of our algorithm and the advantage of incorporating online clustering method.

研究の動機と目的

  • ユーザーのクリック行動からのプレフィックスフィードバックを用いて、未知のユーザークラスタ構造を学習する文脈的カスケーディングバンディットにおける課題に対処すること。
  • 事前のクラスタ知識なしにユーザーの類似性を適応的に学習し、共同フィルタリングを活用するアルゴリズムを設計すること。
  • 単一クラスタまたは固定されたユーザーグループを仮定する既存の線形バンディット手法と比較して、累積レグレット性能を向上させること。
  • スパースで動的なユーザー・アイテム相互作用を示す実世界のレコメンデーションシステムにおけるオンラインクラスタリングの有効性を検証すること。

提案手法

  • ユーザー間の類似関係を表す動的グラフを用い、類似しないユーザー間のエッジはフィードバックに基づいて段階的に削除される。
  • 探索と活用のバランスを図るため、UCBに類似した楽観的原則を適用し、期待報酬の上位信頼区間に基づいてアイテムリストを選択する。
  • ユーザー・アイテム相互作用行列に対するSVDを用いて、ユーザー特徴ベクトルを次第に更新し、次元数は$d$で制御される。
  • レグレットバウンドは、$O(d\sqrt{mKT}\ln(T))$の式を用いて導出され、ここで$m$はクラスタ数、$K$はリスト長、$T$は時間枠を表す。
  • リスト内の最初のクリックからのフィードバックを統合し、クリックより前のすべてのアイテムを不満足なものとみなして、クリック後のフィードバックは無視する。
  • ユーザー類似度グラフの連結成分を動的に維持することで、クラスタ構造をオンラインで学習可能とする。

実験結果

リサーチクエスチョン

  • RQ1プレフィックスフィードバックを伴う文脈的カスケーディングバンディットにおいて、ユーザーのオンラインクラスタリングは、レグレット性能の向上に寄与するか?
  • RQ2未知のユーザークラスタを学習するバンディットアルゴリズムは、単一のグローバルクラスタを仮定するものと比較して、どのように性能が異なるか?
  • RQ3スパースで実世界のレコメンデーションシステムにおけるユーザー類似度構造は、累積報酬にどのような影響を及ぼすか?
  • RQ4初期段階におけるクラスタ探索のコストは、共同フィルタリングによる長期的利点によって相殺されるか?

主な発見

  • CLUB-cascadeアルゴリズムは、$O(d\sqrt{mKT}\ln(T))$の累積レグレットバウンドを達成し、$m=1$の退化ケースにおいても先行研究を一般化・改善する。
  • 合成データでは、CLUB-cascadeはC3-UCBやCascadeLinUCBを常に上回り、クラスタ数が増加するにつれてその優位性が顕著になる。
  • MovieLensデータセットでは、クラスタ探索に起因する初期の性能劣位を除き、約1,000ステップ目以降にベースライン手法を上回る。
  • Yelpデータセットでは、ユーザー数が多い場合に顕著な利点を示し、スパースな状況下での共同フィルタリングの恩恵が明確に確認される。
  • アルゴリズムの性能は、クラスタ構造がより正確になるにつれて時間経過とともに向上し、オンラインクラスタリングの長期的価値を裏付ける。
  • ユーザー数が多い場合には、個々のユーザーを個別クラスタとして扱うMultipleLinUCBはCLUB-cascadeに劣り、類似ユーザー間での共有学習の利点が顕著に現れる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。