Skip to main content
QUICK REVIEW

[논문 리뷰] Search-based User Interest Modeling with Lifelong Sequential Behavior Data for Click-Through Rate Prediction

Qi Pi, Xiaoqiang Zhu|arXiv (Cornell University)|2020. 06. 10.
Recommender Systems and Techniques참고 문헌 20인용 수 5
한 줄 요약

이 논문은 장기적인 순차적 사용자 행동(최대 54,000개의 상호작용까지)에서 관련 서브시퀀스를 추출하기 위해 일반 검색 유닛을 사용하는 두 단계 프레임워크인 검색 기반 관심 모델링(SIM)을 제안한다. 이어 정확한 사용자-아이템 관심을 모델링하기 위해 정확한 검색 유닛을 적용한다. SIM은 알리바바의 실세계 디스play 광고 시스템에서 CTR 7.1% 향상과 RPM 4.4% 향상을 달성했으며, 장기적 관심 모델링에서 이전 방법들을 크게 능가하면서도 낮은 지연 시간을 유지한다.

ABSTRACT

Rich user behavior data has been proven to be of great value for click-through rate prediction tasks, especially in industrial applications such as recommender systems and online advertising. Both industry and academy have paid much attention to this topic and propose different approaches to modeling with long sequential user behavior data. Among them, memory network based model MIMN proposed by Alibaba, achieves SOTA with the co-design of both learning algorithm and serving system. MIMN is the first industrial solution that can model sequential user behavior data with length scaling up to 1000. However, MIMN fails to precisely capture user interests given a specific candidate item when the length of user behavior sequence increases further, say, by 10 times or more. This challenge exists widely in previously proposed approaches. In this paper, we tackle this problem by designing a new modeling paradigm, which we name as Search-based Interest Model (SIM). SIM extracts user interests with two cascaded search units: (i) General Search Unit acts as a general search from the raw and arbitrary long sequential behavior data, with query information from candidate item, and gets a Sub user Behavior Sequence which is relevant to candidate item; (ii) Exact Search Unit models the precise relationship between candidate item and SBS. This cascaded search paradigm enables SIM with a better ability to model lifelong sequential behavior data in both scalability and accuracy. Apart from the learning algorithm, we also introduce our hands-on experience on how to implement SIM in large scale industrial systems. Since 2019, SIM has been deployed in the display advertising system in Alibaba, bringing 7.1\% CTR and 4.4\% RPM lift, which is significant to the business. Serving the main traffic in our real system now, SIM models user behavior data with maximum length reaching up to 54000, pushing SOTA to 54x.

연구 동기 및 목표

  • 산업용 CTR 예측 시스템에서 1,000개 이상의 상호작용을 초과하는 매우 긴 순차적 사용자 행동 데이터를 모델링하는 데 도전하는 것.
  • 추론 지연 시간이나 시스템 확장성에 손상 없이 장기적 관심 모델링 정확도를 향상시키는 것.
  • 거대한 사용자 행동 시퀀스를 가진 실시간 서빙 시스템에서 효율적이고 확장 가능하며 정확한 사용자 관심 모델링을 가능하게 하는 것.
  • 긴 시퀀스에서 의미 없는 장기적 사용자 선호도를 유지하면서 관련성이 없는 행동으로부터 노이즈를 줄이는 것.

제안 방법

  • 일반 검색 유닛(GSU)은 후보 아이템 특징을 기반으로 원시의 임의의 길이의 사용자 행동 시퀀스를 가볍게, 쿼리에 민감하게 검색하여 약 200개의 관련 행동으로 구성된 서브시퀀스(SBS)로 필터링한다.
  • 정확한 검색 유닛(ESU)은 DIN 또는 DIEN과 유사한 어텐션 메커니즘을 사용하여 후보 아이템과 필터링된 SBS 간의 정밀한 상호작용을 모델링한다.
  • 연속된 검색 설계는 긴 시퀀스 필터링과 세밀한 관심 모델링을 분리하여 확장성과 정확도의 상호 보완적 조정을 가능하게 한다.
  • 사용자 ID와 상호작용 카테고리별로 사용자 행동 데이터를 정리하는 두 단계의 오프라인 색인 시스템은 온라인 요청 트래픽을 줄이고 효율적인 검색을 가능하게 한다.
  • ESU의 멀티헤드 어텐션은 깊은 커널 융합을 통해 최적화되어 추론 지연 시간을 낮춘다.
  • 모델은 알리바바의 실시간 CTR 예측 시스템에 구현되어 최대 54,000단계의 시퀀스를 처리하며, 잘라낸 기준 모델 대비 단지 5ms의 추가 지연 시간만을 유발한다.

실험 결과

연구 질문

  • RQ1실시간 산업 시스템에서 최대 54,000단계의 사용자 행동 시퀀스를 처리할 수 있는 확장성 있고 정확한 방법을 설계할 수 있는가?
  • RQ2긴 순차적 행동 데이터에서 관련 없는 노이즈를 효과적으로 필터링하면서도 장기적 사용자 선호도를 유지할 수 있는가?
  • RQ3고정 크기의 메모리 네트워크보다 연결된 검색 메커니즘이 다양한, 맥락 기반의 사용자 관심을 더 잘 포착할 수 있는가?
  • RQ4기존의 최고 성능(SOTA) 방법들인 MIMN 및 DIEN과 비교해 모델이 장기적 관심 모델링을 어느 정도 향상시키는가?

주요 결과

  • 2020년 1월 7일부터 2월 7일까지의 온라인 A/B 테스트에서 SIM은 MIMN 대비 CTR 7.1% 향상과 RPM 4.4% 향상을 달성했다.
  • 사용자가 동일 카테고리의 마지막 행동 이후 경과한 일수 평균이 DIEN의 11.2에서 SIM의 13.3으로 증가하여 장기적 사용자 관심 모델링 능력 향상을 시사한다.
  • 사용자가 대상 아이템 카테고리에서 이전 행동을 가졌을 확률이 DIEN의 0.91에서 SIM의 0.94로 상승하여 장기적 선호도 포착 능력 향상을 확인한다.
  • SIM은 MIMN의 1,000단계 제한 대비 54배 긴 최대 54,000단계의 사용자 행동 시퀀스까지 성공적으로 확장했으며, 지연 시간의 급격한 증가 없이도 가능했다.
  • 시스템은 낮은 추론 지연 시간을 유지했으며, MIMN의 잘라낸 1,000단계 시퀀스 대비 10,000단계 이상의 시퀀스를 서빙할 때 단지 5ms의 오버헤드만을 유발했다.
  • 두 단계 색인 시스템은 온라인 요청 트래픽을 줄였고 효율적인 검색을 가능하게 하여 1초당 100만 명 이상의 사용자를 고속으로 서빙할 수 있도록 지원했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.