[논문 리뷰] User Clustering in Online Advertising via Topic Models
이 논문은 사용자 이벤트 기록을 기반으로 한 토픽 모델 기반 사용자 클러스터링 방법을 제안하여, 유사한 이벤트 기록을 가진 사용자를 클러스터로 묶음으로써 행동 예측 정확도를 향상시킨다. pLSA를 수정하여 사용자 ID와 클러스터 ID가 이벤트 기록을 조건으로 하여 조건부로 독립이 되도록 가정함으로써, 재학습 없이도 새로운 사용자에 대해 효율적이고 실시간으로 클러스터 할당이 가능해지며, A/B 테스트에서 기준 방법에 비해 더 낮은 eCPA와 eCPC를 달성한다.
In the domain of online advertising, our aim is to serve the best ad to a user who visits a certain webpage, to maximize the chance of a desired action to be performed by this user after seeing the ad. While it is possible to generate a different prediction model for each user to tell if he/she will act on a given ad, the prediction result typically will be quite unreliable with huge variance, since the desired actions are extremely sparse, and the set of users is huge (hundreds of millions) and extremely volatile, i.e., a lot of new users are introduced everyday, or are no longer valid. In this paper we aim to improve the accuracy in finding users who will perform the desired action, by assigning each user to a cluster, where the number of clusters is much smaller than the number of users (in the order of hundreds). Each user will fall into the same cluster with another user if their event history are similar. For this purpose, we modify the probabilistic latent semantic analysis (pLSA) model by assuming the independence of the user and the cluster id, given the history of events. This assumption helps us to identify a cluster of a new user without re-clustering all the users. We present the details of the algorithm we employed as well as the distributed implementation on Hadoop, and some initial results on the clusters that were generated by the algorithm.
연구 동기 및 목표
- 희귀 행동 예측 정확도 향상을 위해 온라인 광고에서 희박하고 변동성이 큰 사용자 행동 데이터 문제를 해결하는 것.
- 재학습 오버헤드를 최소화하면서 실시간 광고 입찰을 지원할 수 있는 효율적이고 확장 가능한 사용자 클러스터링을 가능하게 하는 것.
- 모델 전체를 다시 계산하지 않고도 새로운 사용자를 클러스터에 할당할 수 있는 클러스터링 방법을 개발하는 것.
- 실시간 입찰 시스템에서 클러스터 수준의 행동 확률을 특징으로 사용하여 입찰 정확도를 향상시키는 것.
- 실세계 광고 환경에서 eCPA 및 eCPC와 같은 핵심 성능 지표에 미치는 영향을 평가하는 것.
제안 방법
- 사용자 ID와 클러스터 ID가 사용자의 이벤트 기록을 조건으로 하여 조건부로 독립이 되도록 가정함으로써, 확률적 잠재의미분석(pLSA)을 수정하여 효율적인 추론을 가능하게 한다.
- 사용자 행동의 주요 신호로 베이컨 이벤트(트래킹 픽셀)를 사용하며, 각 베이컨을 사용자 행동 '문서'의 '단어'로 간주한다.
- 기대치 최대화(EM) 프레임워크를 적용하여 클러스터 할당과 확률을 학습하며, EM 계산 비용을 감소시키는 핵심 최적화 기법을 사용한다.
- 대규모 분산 데이터 처리를 위해 수억 명의 사용자를 대상으로 하이브리드 클러스터에서 Apache Pig를 사용해 시스템을 구현한다.
- 클러스터 소속은 새로운 사용자의 베이컨 기록을 분석함으로써 런타임에 결정되며, 모든 사용자에 대한 클러스터 할당을 저장할 필요가 없다.
- 클러스터 ID는 캠프aign 및 퍼블리셔 특성과 함께 조합되어 입찰를 위한 행동 확률 추정치를 계산하는 데 사용된다.
실험 결과
연구 질문
- RQ1희박하고 변동성이 큰 사용자 데이터를 고려할 때, 이벤트 기록을 기반으로 한 사용자 클러스터링이 온라인 광고에서 행동 예측 정확도 향상에 기여할 수 있는가?
- RQ2모델 전체를 재학습하지 않고도 새로운 사용자를 클러스터에 할당할 수 있도록 확장 가능한 클러스터링 방법을 어떻게 설계할 수 있는가?
- RQ3토픽 모델 기반 클러스터링은 전통적인 유사도 기반 방법에 비해 실시간 입찰 시스템에서 더 나은 성능을 내는가?
- RQ4클러스터 기반 행동 확률 추정치는 실세계 광고 캠프aign에서 eCPA와 eCPC를 어느 정도 감소시키는가?
- RQ5이벤트 기록을 조건으로 하여 사용자와 클러스터 간의 조건부 독립 가정이 모델 효율성과 추론 속도 향상에 어떤 영향을 미치는가?
주요 결과
- 제안된 토픽 모델 기반 클러스터링 방법은 10일간의 A/B 테스트 기간 동안 기준 코사인 유사도 방법에 비해 유의미하게 낮은 효과적 행동당 비용(eCPA)을 기록했다.
- 또한 효과적 클릭당 비용(eCPC) 역시 낮아져 입찰 효율성 향상과 실제 사용자 행동과의 보다 잘 맞는 결과를 보였다.
- 성능 향상은 테스트 기간 전반에 걸쳐 일관되었으며, 새로운 방법은 eCPA와 eCPC 지표 양쪽에서 기준 방법을 능가했다.
- 결과는 데이터 희박성로 인한 분산 감소로 인해 클러스터 수준의 행동 확률 추정치가 개인별 추정치보다 더 정확하다는 것을 시사한다.
- 모델 설계 덕분에 재학습 없이도 새로운 사용자에 대해 실시간 클러스터 할당이 가능하여, 동적인 광고 환경에서 확장 가능한 구현이 가능하다.
- 테스트 기간 말에 eCPA가 증가하는 경향이 관찰된 것은 모델 실패 때문이 아니라 행동 추적의 할당 지연 때문으로 분석되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.