Skip to main content
QUICK REVIEW

[論文レビュー] Zap: Making Predictions Based on Online User Behavior

Yuri Chervonyi, Dragos Harabor|arXiv (Cornell University)|Jul 16, 2018
Data Visualization and Analytics参考文献 8被引用数 3
ひとこと要約

Zapは、シーケンシャルなWebインタラクションデータを用いてオンラインユーザー行動を予測するスケーラブルでエントープライズ対応の機械学習パイプラインです。例生成子を活用することで、ウェブサイト固有のコードを最小限に抑えつつ、ウェブサイトおよびタスク固有のモデリングを可能にし、Google CloudおよびTensorFlowを介してリアルタイムおよびアーカイブデータストリーム上でディープラーニングを実行することで、高い予測性能を達成します。具体的には、80%の希望行動を引き起こす20%のユーザーを特定することがよくあります。

ABSTRACT

This paper introduces Zap, a generic machine learning pipeline for making predictions based on online user behavior. Zap combines well known techniques for processing sequential data with more obscure techniques such as Bloom filters, bucketing, and model calibration into an end-to-end solution. The pipeline creates website- and task-specific models without knowing anything about the structure of the website. It is designed to minimize the amount of website-specific code, which is realized by factoring all website-specific logic into example generators. New example generators can typically be written up in a few lines of code.

研究の動機と目的

  • 実世界のWebインタラクションデータを用いてオンラインユーザー行動を予測する汎用的で生産環境対応のシステムが不足しているという問題に対処すること。
  • ウェブサイト固有の論理を機械学習パイプラインから抽象化し、単純な例生成子に統合することで、それを最小限に抑えること。
  • エントープライズレベルのデータワークロードを処理でき、既存のアナリティクススタックとシームレスに統合できる、スケーラブルでリアルタイムの予測システムを構築すること。
  • キャリブレーション曲線や特徴量の影響分析を通じて、ビジネス用途におけるディープラーニングモデルの解釈性と信頼性を向上させること。
  • 機械学習の専門知識がほとんどないチームでも、高インパクトでパーソナライズドなユーザー予測モデルをデプロイできるようにすること。

提案手法

  • JavaScriptライブラリまたはMobile SDKを介してリアルタイムのユーザーインタラクションイベント(例:クリック、スクロール、購入)を収集し、サーバーにストリーミングする。
  • データを2つのストリームに分割:1つは長期間のアーカイブおよびモデルトレーニング用にBigQueryに保存し、もう1つは低遅延データベース(例:MongoDBまたはRedis)に保存してリアルタイム推論に使用する。
  • 匿名IDとタイムスタンプに基づいてイベントをユーザーセッションにグループ化し、ボット、スクレイパー、異常な長さのセッション(例:1000件以上のイベント)を除外する。
  • ウェブサイト固有の例生成子(通常は数行のコード)を用いてトレーニング例を生成し、ユーザーセッションから特徴量とラベルを定義する。
  • Cloud Machine Learning Engine上でTensorFlowを用いてディープラーニングモデルをトレーニングし、順序モデル技術に加え、Bloomフィルターやバケッティングなどの技術を活用して効率性を向上させる。
  • 低遅延データベースを介してリアルタイムの予測を提供し、モデル推論をAPIとして公開して本番環境での利用を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ウェブサイト固有の論理を深く必要としない汎用的な機械学習パイプラインをどのように設計すれば、実世界のWebインタラクションデータに基づいて正確なユーザー行動予測が可能になるか?
  • RQ2生産環境対応のユーザー行動予測システムを構築するために必要なウェブサイト固有のコードの最小限の量はどの程度か?
  • RQ3標準的なクラウドインfraストラクチャ上に構築されたパイプラインは、シーケンシャルなユーザーインタラクションデータに対して、低遅延のリアルタイム推論を実現しながらも、高い精度を維持できるか?
  • RQ4リターゲティングやリードスコアリングなどのビジネス意思決定に使用されるディープラーニングシステムにおいて、モデルの解釈性をどのように向上させられるか?
  • RQ5このようなシステムは、実世界の応用において、80%のコンバERSIONを引き起こす20%のユーザー(例:高可能性ユーザー)をどの程度の精度で特定できるか?

主な発見

  • Zapは、例生成子にわずか数行のウェブサイト固有のコードを記述するだけで、ウェブサイトおよびタスク固有の予測モデルを構築でき、開発の負荷を顕著に低減します。
  • パイプラインは生産環境のユースケースで20/80パフォーマンスパターンを達成しており、希望行動(例:購入や登録)の80%を引き起こす20%のユーザーが特定されています。
  • キャリブレーション曲線から、10回以上のクリックと1分以上の滞在時間を持つユーザーに対して、モデルの信頼度が顕著に向上していることが示され、重要な行動シグナルが正しく捉えられていることが裏付けられました。
  • 高エンゲージメントユーザーでは、上位10%の予測における正の予測率が0.6に達する一方で、全ユーザー平均では0.4にとどまるため、モデルがエンゲージメントシグナルに敏感であることが確認されました。
  • Apache BeamおよびGoogle Cloud技術を活用して、データ収集、前処理、モデルサービングを明確に分離したため、スケーラブルで信頼性の高いリアルタイム推論が実現できました。
  • キャリブレーション分析による解釈性のサポートにより、完全なモデル再トレーニングを必要とせずに、ステークホルダーがビジネス上の直感と照らし合わせてモデルの挙動を検証できるようになっています。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。