Skip to main content
QUICK REVIEW

[論文レビュー] Diversity-Promoting Deep Reinforcement Learning for Interactive Recommendation

Yong Liu, Yinan Zhang|arXiv (Cornell University)|Mar 19, 2019
Tensor decomposition and applications被引用数 14
ひとこと要約

本稿では、個別化されたデターミナント・ポイント・プロセス(DPP)をアクター・クリティック強化学習アーキテクチャと統合することで、インタラクティブ推薦における多様性を促進する深層強化学習フレームワークD²RLを提案する。深層RLを用いて動的にアイテムの関連性を学習し、固定されたアイテム類似度行列と組み合わせることで、D²RLは多様で関連性の高い推薦を生成し、Movielensデータセットにおけるオフラインおよびシミュレートされたオンライン実験において、精度と多様性の両面で最先端の手法を上回る性能を発揮する。

ABSTRACT

Interactive recommendation that models the explicit interactions between users and the recommender system has attracted a lot of research attentions in recent years. Most previous interactive recommendation systems only focus on optimizing recommendation accuracy while overlooking other important aspects of recommendation quality, such as the diversity of recommendation results. In this paper, we propose a novel recommendation model, named \underline{D}iversity-promoting \underline{D}eep \underline{R}einforcement \underline{L}earning (D$^2$RL), which encourages the diversity of recommendation results in interaction recommendations. More specifically, we adopt a Determinantal Point Process (DPP) model to generate diverse, while relevant item recommendations. A personalized DPP kernel matrix is maintained for each user, which is constructed from two parts: a fixed similarity matrix capturing item-item similarity, and the relevance of items dynamically learnt through an actor-critic reinforcement learning framework. We performed extensive offline experiments as well as simulated online experiments with real world datasets to demonstrate the effectiveness of the proposed model.

研究の動機と目的

  • 既存のインタラクティブ推薦システムが主に精度に注力している中で、多様性の欠如という課題に取り組むこと。
  • 動的なユーザー好みモデリングを通じて、多様性と関連性の両立を促進する強化学習ベースのフレームワークを開発すること。
  • 関連性と多様性の両方の好みを組み合わせたリアルなユーザーフィードバックをシミュレートし、オンライン評価を実施すること。
  • 提案モデルがオフラインおよびオンラインのインタラクティブ推薦設定の両方で有効であることを示すこと。

提案手法

  • D²RLフレームワークは、各ユーザーに対して多様で関連性の高いアイテム推薦を生成するために、パーソナライズドDPPカーネル行列を用いる。
  • DPPカーネルは、固定されたアイテム同士の類似度行列と、深層強化学習により動的に学習された関連性行列から構成される。
  • アクター・クリティック型の深層強化学習フレームワークを採用:アクターは行動ベクトル(DPPカーネルパラメータ)を生成し、クリティックは即時の報酬と将来の報酬の両方を用いてポリシーの質を評価する。
  • DPPモデルは、決定論的ポイントプロセスによってモデル化された高多様性かつ高関連性のアイテム集合を好むことで、集合レベルの多様性を確保する。
  • ユーザーの好みと多様性の両方を考慮した、MMRにインspiredされた確率モデルを用いて、ユーザーのフィードバックを模倣する新しいオンラインシミュレータを導入する。
  • モデルはエンドツーエンドで深層RLを用いて訓練され、クリティックネットワークが推薦ポリシーの長期的価値を推定する。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習フレームワークは、高い精度を維持しつつ、インタラクティブ推薦における多様性を効果的に促進できるか?
  • RQ2パーソナライズドカーネルを用いたDPPモデルの統合は、標準的なRLベースの手法と比較して、推薦の多様性をどのように向上させるか?
  • RQ3提案されたD²RLモデルは、オンラインフィードバックシミュレーションを通じて、動的なユーザー好みにどの程度適応できるか?
  • RQ4オフラインおよびオンラインの両設定において、D²RLは最先端のコンテキストバンディットおよび深層RLベースのインタラクティブ推薦手法と比較して、どのように性能を発揮するか?

主な発見

  • Movielens-1Mデータセットにおいて、D²RLはオフライン評価の全推奨エポックにおいて、すべてのベースラインを精度と多様性の両面で上回った。
  • Movielens-100Kにおけるシミュレートされたオンライン実験では、D²RLはC²UCBと比較して、全エポックを通じて精度が52.13%高く、多様性が92.79%も高かった。
  • Movielens-1Mでは、オンラインシミュレーションにおいてD²RLはC²UCBと比較して、精度が76.04%高く、多様性が156.58%も高かった。これは、性能の安定性と優位性が顕著に示された。
  • オンライン設定では、モデルは安定的かつ優れた性能を示し、多様性が初期のフラクチュエーションを経て急速に向上し、高い水準を維持した。
  • Movielens-100Kでは、D²RLの多様性はベースラインと同等の性能を示したが、精度においてはたびたび劣化を示し、クリティックネットワークの推定に不安定さが見られた可能性を示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。