Skip to main content
QUICK REVIEW

[論文レビュー] Learning from Delayed Outcomes via Proxies with Applications to Recommender Systems

Timothy Mann, Sven Gowal|arXiv (Cornell University)|Jul 24, 2018
Recommender Systems and Techniques被引用数 5
ひとこと要約

本論文は、オンライン推薦システムにおける遅延するフィードバックの学習を改善するために、より遅延が少ない代理指標(例:電子書籍の部分的閲覧)を活用するニューラルネットワークフレームワーク、Residual Factored Forecaster (RFF) を提案する。予測を代理指標段階と結果段階に因子分解することにより、RFFはレジームスケーリングを D×N から D+N に削減し、直接予測器や標準的な因子化モデルを上回る性能を示す。特に代理指標が情報が薄い状況でも顕著である。

ABSTRACT

Predicting delayed outcomes is an important problem in recommender systems (e.g., if customers will finish reading an ebook). We formalize the problem as an adversarial, delayed online learning problem and consider how a proxy for the delayed outcome (e.g., if customers read a third of the book in 24 hours) can help minimize regret, even though the proxy is not available when making a prediction. Motivated by our regret analysis, we propose two neural network architectures: Factored Forecaster (FF) which is ideal if the proxy is informative of the outcome in hindsight, and Residual Factored Forecaster (RFF) that is robust to a non-informative proxy. Experiments on two real-world datasets for predicting human behavior show that RFF outperforms both FF and a direct forecaster that does not make use of the proxy. Our results suggest that exploiting proxies by factorization is a promising way to mitigate the impact of long delays in human-behavior prediction tasks.

研究の動機と目的

  • オンライン推薦システムにおける遅延する結果からの学習という課題に対処すること。ここでのフィードバックは数週間から数か月かかることがある。
  • 問題を中間の代理信号を伴う敵対的で遅延するオンライン学習設定として形式化すること。
  • 最終結果を待たずに、代理指標を活用してレジームを低減し、学習を加速するニューラルネットワークアーキテクチャを設計すること。
  • 代理指標が弱く情報が薄い状況でも、直接予測と比較して性能が向上するかを評価すること。

提案手法

  • 遅延する結果と、より遅延が少ない代理指標を伴う完全情報のオンライン学習として問題を形式化し、代理指標が結果と確率的に関連すると仮定する。
  • 入力特徴から代理指標を予測し、その後にその代理指標から結果を予測する二段階の因子化予測器(FF)を提案する。
  • 誤った代理指標-結果仮定からの誤差を軽減するため、残差補正項を追加したResidual Factored Forecaster(RFF)を導入する。
  • 両方のFFおよびRFFをニューラルネットワークで実装し、代理指標ヘッドは初期の代理信号で、結果ヘッドは遅延する結果で学習する。
  • 因子分解仮定の下で、代理指標ベースの因子分解が、レジームスケーリングを D×N から D+N に削減することを示すレジームバウンズを分析する。
  • 代理指標と結果の予測に非遅延データを用い、早期停止と学習率スケジューリングを用いてモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1より遅延が少ない代理指標を活用することで、遅延する結果を伴うオンライン学習におけるレジームを顕著に低減できるか?
  • RQ2代理指標が情報を持っている場合、代理指標ベースの学習は直接予測と比較してどの程度優れているか?
  • RQ3代理指標が最終結果をうまく予測できない場合、残差補正機構はそのロバストネスを向上させられるか?
  • RQ4代理指標ベースの学習のレジームは、遅延(D)とインスタンス数(N)に対して良好にスケーリングするか?

主な発見

  • RFFは、GitHubのコミット予測とマーケットプレイスのエンゲージメント予測という2つの実世界データセットにおいて、直接予測器(DF)と標準的な因子化予測器(FF)を上回る性能を示した。
  • ステガードスケジュール(インスタンスの分布が急激に変化する状況)では、RFFとFFがDFを上回り、代理指標ベースの一般化の利点が顕著に現れた。
  • ユニフォームスケジュール(因子分解仮定が破られる状況)では、RFFはDFと同等の性能を示し、情報の薄い代理指標に対してもロバストであることを示した。
  • 因子化アプローチのレジームは D+N にスケーリングする一方で、直接法は D×N にスケーリングするため、因子分解仮定の下で理論的優位性が裏付けられた。
  • RFFの残差タワーは、誤った代理指標-結果関係からの誤差を効果的に軽減し、代理指標が弱い場合でも滑らかに性能低下を抑えることができた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。