Skip to main content
QUICK REVIEW

[논문 리뷰] Zap: Making Predictions Based on Online User Behavior

Yuri Chervonyi, Dragos Harabor|arXiv (Cornell University)|2018. 07. 16.
Data Visualization and Analytics참고 문헌 8인용 수 3
한 줄 요약

Zap은 실시간 및 기록된 데이터 스트림을 통해 Google Cloud와 TensorFlow를 활용해 순차적 웹 상호작용 데이터를 기반으로 온라인 사용자 행동을 예측하는 확장 가능하고 기업용으로 구축된 머신러닝 파이프라인입니다. 예시 생성기들을 통해 웹사이트 및 작업에 특화된 모델링을 최소한의 웹사이트 전용 코드로 가능하게 하며, 실시간 및 기록된 데이터 스트림을 기반으로 딥러닝을 통해 높은 예측 성능을 달성합니다. 일반적으로 80%의 원하는 행동을 일으키는 20%의 사용자를 식별함으로써, 기업의 마케팅, 재타겟팅, 참여도 향상에 기여합니다.

ABSTRACT

This paper introduces Zap, a generic machine learning pipeline for making predictions based on online user behavior. Zap combines well known techniques for processing sequential data with more obscure techniques such as Bloom filters, bucketing, and model calibration into an end-to-end solution. The pipeline creates website- and task-specific models without knowing anything about the structure of the website. It is designed to minimize the amount of website-specific code, which is realized by factoring all website-specific logic into example generators. New example generators can typically be written up in a few lines of code.

연구 동기 및 목표

  • 실제 웹 상호작용 데이터를 기반으로 한 일반적인, 기업용으로 사용 가능한 온라인 사용자 행동 예측 시스템의 부족을 해결하기 위해.
  • 웹사이트 전용 로직을 최소화하기 위해 이를 단순한 예시 생성기로 추상화함으로써 머신러닝 파이프라인 내에서의 웹사이트 전용 코드를 줄이기 위해.
  • 기업 수준의 데이터 워크로드를 지원하고 기존 분석 스택과 원활하게 통합되는 확장 가능하고 실시간 예측 시스템을 구축하기 위해.
  • 보정 곡선과 특징 영향 분석을 통해 비즈니스 응용 분야에서 딥러닝 모델의 해석 가능성과 신뢰도를 향상시키기 위해.
  • 딥러닝 전문 지식 없이도 비즈니스 팀이 고성능 개인화 사용자 예측 모델을 배포할 수 있도록 하기 위해.

제안 방법

  • JavaScript 라이브러리 또는 모바일 SDK를 통해 실시간 사용자 상호작용 이벤트(예: 클릭, 스크롤, 구매)를 수신하고 서버로 스트리밍합니다.
  • 데이터를 두 개의 스트림으로 분할: 하나는 장기 보관 및 모델 훈련을 위한 BigQuery에 저장되고, 다른 하나는 실시간 추론을 위한 저지연성 데이터베이스(MongoDB 또는 Redis 등)에 저장됩니다.
  • 익명 사용자 ID와 타임스탬프를 기반으로 이벤트를 사용자 세션으로 그룹화하고, 봇, 스크래퍼, 비정상적으로 긴 세션(예: 1000개 이상의 이벤트)을 필터링합니다.
  • 웹사이트 전용 예시 생성기(일반적으로 몇 줄의 코드)를 통해 사용자 세션에서 특징과 레이블을 정의함으로써 훈련 예시를 생성합니다.
  • Cloud Machine Learning Engine에서 텐서플로우를 사용해 딥러닝 모델을 훈련하며, 순차적 모델링 기법과 블룸 필터 및 버킷화 기법을 활용해 효율성을 높입니다.
  • 저지연성 데이터베이스를 통해 실시간 예측을 제공하고, 모델 추론을 API로 노출하여 프로덕션 환경에서 사용할 수 있도록 합니다.

실험 결과

연구 질문

  • RQ1실제 웹 상호작용 데이터를 기반으로 한 일반적인 머신러닝 파이프라인을 설계하여, 깊이 있는 웹사이트 전용 로직 없이도 정확한 온라인 사용자 행동 예측을 수행할 수 있는가?
  • RQ2생산 수준의 사용자 행동 예측 시스템을 구축하기 위해 필요한 최소한의 웹사이트 전용 코드는 얼마인가?
  • RQ3표준 클라우드 인프라 기반 파이프라인으로 실시간 추론에 저지연성을 확보하면서도 순차적 사용자 상호작용 데이터에 대해 높은 정확도를 유지할 수 있는가?
  • RQ4리타겟팅나 리드 스코링과 같은 비즈니스 의사결정에 사용되는 딥러닝 시스템에서 모델의 해석 가능성은 어떻게 향상시킬 수 있는가?
  • RQ5실제 응용에서 이러한 시스템이 높은 확률을 가진 사용자 세그먼트(예: 전환의 80%를 담당하는 20%의 사용자)를 얼마나 정확하게 식별할 수 있는가?

주요 결과

  • Zap은 예시 생성기 내 몇 줄의 웹사이트 전용 코드만으로도 웹사이트 및 작업에 특화된 예측 모델을 구축할 수 있어 엔지니어링 오버헤드를 크게 줄였습니다.
  • 생산 환경에서 20/80 성능 패턴을 달성하여, 원하는 행동(예: 구매, 가입 등)의 80%를 담당하는 사용자의 20%가 식별되었습니다.
  • 보정 곡선은 10번 이상의 클릭과 1분 이상의 웹사이트 내 체류 시간을 가진 사용자에 대해 모델의 신뢰도가 뚜렷이 증가하는 것을 보여주며, 핵심 행동 신호가 잘 포착되었음을 검증합니다.
  • 고참여 사용자에 대해 상위 10% 예측에서 양성 예측 비율이 0.6에 도달하는 반면, 전체 사용자 평균은 0.4이므로, 모델이 참여도 신호에 민감하게 반응하고 있음을 확인합니다.
  • Apache Beam과 Google 클라우드 기술을 활용해 데이터 수집, 전처리 및 모델 서빙를 성공적으로 분리함으로써 확장 가능하고 신뢰할 수 있는 실시간 추론을 가능하게 했습니다.
  • 보정 분석을 통해 모델의 행동을 비즈니스 직관과 비교 검증할 수 있도록 해, 전체 모델 재학습 없이도 이해관계자들이 모델의 타당성을 검증할 수 있도록 지원합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.