[논문 리뷰] PBODL : Parallel Bayesian Online Deep Learning for Click-Through Rate Prediction in Tencent Advertising System
PBODL는 텐센트 광고 시스템에서 클릭률(CTR) 예측을 위한 병렬 베이지안 온라인 딥러닝 프레임워크를 제안한다. 가우시안 필터링을 가정한 확률적 역전파를 사용하여 빠르고 정확한 모델 업데이트를 가능하게 한다. FFM-MLP(온라인) 모델을 통해 최신 기술 성능을 달성하였으며, 온라인 A/B 테스트에서 기준 DNN(배치) 모델 대비 5.6% CTR 향상과 신규 광고에서 25.6% CTR 향상을 기록하여 배치 모델(DNN, FM)을 능가한다.
We describe a parallel bayesian online deep learning framework (PBODL) for click-through rate (CTR) prediction within today's Tencent advertising system, which provides quick and accurate learning of user preferences. We first explain the framework with a deep probit regression model, which is trained with probabilistic back-propagation in the mode of assumed Gaussian density filtering. Then we extend the model family to a variety of bayesian online models with increasing feature embedding capabilities, such as Sparse-MLP, FM-MLP and FFM-MLP. Finally, we implement a parallel training system based on a stream computing infrastructure and parameter servers. Experiments with public available datasets and Tencent industrial datasets show that models within our framework perform better than several common online models, such as AdPredictor, FTRL-Proximal and MatchBox. Online A/B test within Tencent advertising system further proves that our framework could achieve CTR and CPM lift by learning more quickly and accurately.
연구 동기 및 목표
- 대규모 온라인 광고 시스템에서 끊임없이 변화하는 광고 및 사용자 행동에 대응해 CTR 모델을 신속히 업데이트하는 도전에 대비한다.
- 종합적인 딥러닝과 확률적 모델링을 활용해 시간이 오래 소요되는 특징 공학에 의존도를 낮춘다.
- 효율적인 온라인 학습과 병렬 학습을 통해 수십억 건의 일일 학습 샘플에 스케일링하면서도 추론 지연 시간을 10ms 이내로 유지한다.
- 온라인 학습을 통한 빈번하고 점진적인 업데이트를 통해 신규 또는 드문 광고의 모델 성능을 향상시킨다.
- 파라미터 서버와 스트림 컴퓨팅 인프라를 활용해 안정적이고 확장 가능한 학습을 구현한다.
제안 방법
- 가능성 기반 역전파를 사용한 베이지안 온라인 학습을 위해 가우시안 밀도 필터링을 가정한 깊이 있는 프로빗 회귀 모델을 훈련한다.
- 특징 임bedding 능력을 향상시켜 스파arsity-MLP, FM-MLP, FFM-MLP 등 다수의 베이지안 온라인 모델로 프레임워크를 확장한다.
- 스트림 컴퓨팅과 파라미터 서버를 활용한 병렬 학습 시스템을 구현하여 산업 규모의 데이터(일일 수십억 건의 샘플)를 처리할 수 있도록 한다.
- 양성 및 음성 예측을 균형 잡기 위해 음성 샘플링을 적용하고 재조정: q = p / (p + (1−p)/w)를 사용하여 약 0.1의 양성 비율을 목표로 한다.
- 안정성을 확보하기 위해 최근 데이터(15~30일 치)를 단일 스레드로 훈련하는 버닝 인 단계를 거친 후 다중 스레드 온라인 업데이트로 전환한다.
- 분산 복귀를 통한 가중치 감소: v′ = (v·v_prior) / ((1−ε)·v_prior + ε·v)를 적용하여 수렴이 0으로 향하는 것을 방지하고 학습 능력을 유지한다.
실험 결과
연구 질문
- RQ1산업 규모의 광고 시스템에서 배치 학습 대비 베이지안 온라인 딥러닝이 더 신속하고 정확한 CTR 예측을 가능하게 할 수 있는가?
- RQ2확률적 역전파를 사용한 온라인 학습은 배치 모델 대비 신규 또는 드문 광고에서 성능을 어떻게 향상시키는가?
- RQ3파라미터 서버를 활용한 병렬 학습이 수십억 건의 일일 샘플을 처리하면서도 저지연 시간을 유지할 수 있는가?
- RQ4재조정된 음성 샘플링은 학습 데이터 크기를 줄여도 성능 저하 없이 모델 정확도를 유지할 수 있는가?
- RQ5가중치 감소와 사전 분산 설정 값은 온라인 환경에서 장기적인 모델 안정성과 학습 능력에 어떤 영향을 미치는가?
주요 결과
- FFM-MLP(온라인) 모델은 기준 DNN(배치) 모델 대비 온라인 A/B 테스트에서 5.6% CTR 향상을 달성했다.
- 신규 광고에서 FFM-MLP(온라인)은 25.6% CTR 향상을 기록했으며, 이는 DNN(배치)의 11.86% 신규 광고 커버리지 대비 뚜렷한 우월성을 보였다.
- FM-MLP(온라인)은 4.1% CTR 향상을 달성하여 배치 학습된 FM 및 DNN 모델보다 뛰어난 성능을 보였다.
- 온라인 모델은 15분마다 업데이트되어 배치 모델이 몇 시간마다 업데이트되는 것과 달리 신규 광고 및 캠프agn 변화에 더 신속히 대응할 수 있었다.
- 다중 데이터 스트림과 미니배치당 다중 ADF/EP 반복은 성능 향상에 기여했지만 운영 리스크가 증가했다.
- 프레임워크는 안정적이고 확장 가능한 학습을 달성했으며, 추론 지연 시간이 10ms 이내로 실시간 모바일 광고에 적합했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.