Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Counterfactual Learning and Evaluation for Recommender System

Da Xu, Chuanwei Ruan|arXiv (Cornell University)|Nov 7, 2020
Recommender Systems and Techniques参考文献 47被引用数 14
ひとこと要約

本稿では、観測されない露出メカニズムによって歪められるフィードバックデータを考慮する、露出バイアスを是正するための新しいミニマックス敵対的反事後学習フレームワークを提案する。露出メカニズムを二モデルゲームにおける敵対的要因として定式化することで、ロバストなオフライン学習と評価が可能となり、シミュレーションおよび実世界のオンラインA/Bテストの両方で、標準的なベースラインと比較して優れた性能を発揮する。特に、オフライン評価とオンライン評価結果の乖離を是正する点で顕著である。

ABSTRACT

The feedback data of recommender systems are often subject to what was exposed to the users; however, most learning and evaluation methods do not account for the underlying exposure mechanism. We first show in theory that applying supervised learning to detect user preferences may end up with inconsistent results in the absence of exposure information. The counterfactual propensity-weighting approach from causal inference can account for the exposure mechanism; nevertheless, the partial-observation nature of the feedback data can cause identifiability issues. We propose a principled solution by introducing a minimax empirical risk formulation. We show that the relaxation of the dual problem can be converted to an adversarial game between two recommendation models, where the opponent of the candidate model characterizes the underlying exposure mechanism. We provide learning bounds and conduct extensive simulation studies to illustrate and justify the proposed approach over a broad range of recommendation settings, which shed insights on the various benefits of the proposed approach.

研究の動機と目的

  • オフライン推薦システムの評価における露出バイアスの根本的問題に取り組む。ここでフィードバックデータは、観測されない露出メカニズムに条件付けられている。
  • 実世界のフィードバックデータにおける露出状態の部分的観測による反事後学習の同定可能性問題を克服する。
  • 未知の露出メカニズムを敵対的要因として扱う、原理的でミニマックスに基づく学習フレームワークを開発する。
  • オフライン評価とオンラインA/Bテストのギャップを埋める。深層学習モデルは実世界では優れた性能を発揮するが、オフライン指標では性能を発揮しないという現象を是正する。
  • 一般化限界を提示し、合成データおよび実世界のデータセット(オンラインA/B実験を含む)を用いた実証的検証を実施する。

提案手法

  • 反事後学習問題をミニマックス最適化として定式化し、候補モデルが最悪の露出メカニズムのもとで良好に動作するように学習する。
  • 双対性と緩和を用いて、ミニマックス問題を解ける二モデル敵対ゲームに変換する。一つのモデル(f_θ)はユーザーのフィードバックを予測し、もう一つのモデル(g_ψ)は露出メカニズムをモデル化する。
  • フィードバック予測と露出モデリングの目的関数の最適化をバランスさせるために、正則化項αを導入する。
  • 反事後設定においてプロパティ・ウェートを適用するが、露出の不確実性を敵対的要因として扱うことで、同定可能性制約を緩和する。
  • g_ψがf_θの最悪の露出敵対者として機能するように、二つのモデルを交互に学習させ、分布シフト下での一般化を向上させる。
  • 実世界のデータセット(Movielens-1M、Last-FM、Goodreads)および合成シミュレーションを用い、さまざまな露出メカニズムとモデルアーキテクチャの下で手法を評価する。

実験結果

リサーチクエスチョン

  • RQ1露出メカニズムが未知で無視された場合、フィードバックデータに対する教師あり学習は、ユーザーの好みの検出に一貫性の欠如をもたらすか?
  • RQ2露出バイアスは、特に歴史的露出パターンに依存する場合、オフライン評価指標をどの程度歪めるか?
  • RQ3ミニマックス定式化は、露出メカニズムの不確実性を効果的にモデル化し、オフラインモデル評価のロバスト性を向上させられるか?
  • RQ4提案された敵対的反事後フレームワークは、標準的なプロパティベースの手法と比較して、一般化性能およびオンラインA/Bテスト結果との整合性において優れているか?
  • RQ5隠れ要因次元や正則化強度αといったハイパーパrameterの変化に対して、この手法はどの程度感度を示すか?

主な発見

  • 理論的に、観測されない露出メカニズムが存在する場合、フィードバックデータに対する標準的な教師あり学習は、一貫性の欠如した好みの検出をもたらす可能性があることを示した。
  • 提案された敵対的反事後手法は、実世界のデータセットで最先端の性能を達成し、ACL-Attentionモデルを用いた場合、Movielens-1MとLast-FMの両方でHit@10スコアが83.64を記録した。
  • オンラインA/Bテストにおいて、敵対的反事後モデルはベースラインモデルを上回るクリックスルーレートを達成し、実世界の展開結果と整合していることを確認した。
  • 感度分析の結果、正則化パラメータαが極端に小さすぎず、大きすぎない範囲で最適な性能が得られ、極端な値では性能が低下することがわかった。
  • より大きな隠れ要因次元は一貫してモデル性能を向上させ、この手法が下位の推薦モデルの一般化特性を継承していることを示した。
  • この手法は、オフライン評価とオンラインA/Bテストの乖離を効果的に低減し、深層学習モデルが実世界では優れた成果を上げるがオフライン指標では性能を発揮しないというパラドックスを解消した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。