Skip to main content
QUICK REVIEW

[論文レビュー] Reward Constrained Interactive Recommendation with Natural Language Feedback

Ruiyi Zhang, Tong Yu|arXiv (Cornell University)|May 4, 2020
Recommender Systems and Techniques参考文献 50被引用数 5
ひとこと要約

本論文は、過去の自然言語フィードバックにおける違反を検出する敵対的に訓練された識別器を用いて、ユーザーの好みを動的に制約する報酬制約付き強化学習フレームワークを提案する。この手法は、推薦品質と収束速度を向上させ、推薦およびテキスト生成の両タスクにおいて、標準的なRLおよび単純な制約ベースラインに対して一貫した向上を達成する。

ABSTRACT

Text-based interactive recommendation provides richer user feedback and has demonstrated advantages over traditional interactive recommender systems. However, recommendations can easily violate preferences of users from their past natural-language feedback, since the recommender needs to explore new items for further improvement. To alleviate this issue, we propose a novel constraint-augmented reinforcement learning (RL) framework to efficiently incorporate user preferences over time. Specifically, we leverage a discriminator to detect recommendations violating user historical preference, which is incorporated into the standard RL objective of maximizing expected cumulative future rewards. Our proposed framework is general and is further extended to the task of constrained text generation. Empirical results show that the proposed method yields consistent improvement relative to standard RL methods.

研究の動機と目的

  • 探索中に自然言語フィードバックで表現されたユーザーの好みを推薦システムが違反するという課題に対処すること。
  • 明示的でハードコードされた制約に依存せずに、ユーザーのフィードバックを動的に統合できる汎用的で制約拡張型の強化学習フレームワークを開発すること。
  • 敵対的訓練により学習される汎用的な制約を用いることで、インタラクティブな推薦およびテキスト生成における収束性とパフォーマンスを向上させること。
  • フレームワークを推薦およびテキスト生成の両タスクに適用し、耐障害性と一般化能力を実証すること。

提案手法

  • 制約が過去の自然言語フィードバックからのユーザーの好みを表す、制約付きマルコフ決定過程(CMDP)としてテキストベースのインタラクティブな推薦を定式化する。
  • 敵対的に訓練された識別器ネットワークを用い、以前に表明されたユーザーの好みに違反する推薦を検出する。この識別器が動的制約クリティックとして機能する。
  • 識別器の出力をラグランジュ緩和法を用いたエンドツーエンド学習可能なペナルティ項としてRLの目的関数に統合する。
  • 二重最適化プロセスを用いる:報酬の累積最大化を目的としたポリシー学習と、制約違反の特定を目的とした識別器の訓練。
  • 感情やコンテンツ属性に関する制約を定義することで、フレームワークを制約付きテキスト生成に拡張し、事前学習済み分類器を制約関数として使用する。
  • 実世界のデータセット(例:テキスト生成のためのYelp、視覚的推薦データセット)を用い、ポリシー勾配法による学習とハイパーパrameterチューニングを実施する。

実験結果

リサーチクエスチョン

  • RQ1敵対的に訓練された識別器は、自然言語で表現されたユーザーの好みに違反する推薦を効果的に検出できるか?
  • RQ2動的に学習された制約を組み込むことで、標準的なRLや単純なハード制約と比較して、インタラクティブな推薦におけるパフォーマンスと収束性が向上するか?
  • RQ3提案されたフレームワークは、感情制御付きの制約付きテキスト生成などの他の系列生成タスクに一般化可能か?
  • RQ4学習過程で学習されたラグランジュ乗数λはどのように変化するか?また、これは制約違反のダイナミクスをどのように示しているか?

主な発見

  • RCRフレームワークは、ヒットレートや平均逆順位(MRR)を含む複数の推薦指標において、標準的なRLおよび単純な制約ベースラインと比較して一貫したパフォーマンス向上を達成する。
  • 最初の40,000回の学習イテレーションにおいて、図4の学習曲線から示されるように、RCRは標準的なRLよりも著しく高速に収束する。
  • 学習されたラグランジュ乗数λは初期のスパイクの後、λ = 0.04に安定し、制約違反頻度に応じた効果的な動的調整が行われていることを示している。
  • Yelpテキスト生成タスクでは、RCRにより違反率が標準的なRLの40.36%から10.49%に低下し、テストBLEUスコアも向上(例:BLEU-2が0.807から0.840に)。
  • 表3の生成テキスト例から、RCRはより一貫性があり、肯定的センチメントを持つレビューを生成する一方で、否定的センチメントを回避しており、効果的な制約の強制が確認できる。
  • ハードコードされた属性マッチングと比較して、識別器ベースの制約はより優れた一般化性能を示しており、RCRと単純な制約ベースラインとの間でより大きなパフォーマンスギャップが観察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。