[논문 리뷰] DADNN: Multi-Scene CTR Prediction via Domain-Aware Deep Neural Network
이 논문은 공통 표현 학습을 위한 공유 밑바닥 블록과 도메인별 헤드를 사용하여 시나리오별 특성을 포착하는 다중 시나리오 CTR 예측을 위한 도메인 인식 딥 뉴럴 네트워크인 DADNN을 제안한다. 공유/차별적 특징 학습을 위해 지식 전이와 MMoE를 통합함으로써 DADNN은 온라인 A/B 테스트에서 잘 튜닝된 DCN 모델 대비 최대 6.7% 높은 CTR와 3.0% 높은 CPM을 달성하면서도, 여러 시나리오에 대한 단일 모델 아키텍처를 통해 훈련 및 서비스 비용을 절감한다.
Click through rate(CTR) prediction is a core task in advertising systems. The booming e-commerce business in our company, results in a growing number of scenes. Most of them are so-called long-tail scenes, which means that the traffic of a single scene is limited, but the overall traffic is considerable. Typical studies mainly focus on serving a single scene with a well designed model. However, this method brings excessive resource consumption both on offline training and online serving. Besides, simply training a single model with data from multiple scenes ignores the characteristics of their own. To address these challenges, we propose a novel but practical model named Domain-Aware Deep Neural Network(DADNN) by serving multiple scenes with only one model. Specifically, shared bottom block among all scenes is applied to learn a common representation, while domain-specific heads maintain the characteristics of every scene. Besides, knowledge transfer is introduced to enhance the opportunity of knowledge sharing among different scenes. In this paper, we study two instances of DADNN where its shared bottom block is multilayer perceptron(MLP) and Multi-gate Mixture-of-Experts(MMoE) respectively, for which we denote as DADNN-MLP and DADNN-MMoE.Comprehensive offline experiments on a real production dataset from our company show that DADNN outperforms several state-of-the-art methods for multi-scene CTR prediction. Extensive online A/B tests reveal that DADNN-MLP contributes up to 6.7% CTR and 3.0% CPM(Cost Per Mille) promotion compared with a well-engineered DCN model. Furthermore, DADNN-MMoE outperforms DADNN-MLP with a relative improvement of 2.2% and 2.7% on CTR and CPM respectively. More importantly, DADNN utilizes a single model for multiple scenes which saves a lot of offline training and online serving resources.
연구 동기 및 목표
- 높은 자원 비용과 데이터 부족으로 인해 수백 개의 저트래픽, 장수익성 이커머스 광고 시나리오에 대해 별도의 모델을 훈련하는 데 발생하는 도전 과제를 해결하기 위해.
- 통합 모델 아키텍처 내에서 공통 표현과 시나리오별 표현을 학습하여 다중 시나리오 CTR 예측에서 도메인 간 이동을 줄이기 위해.
- 외부 교사 네트워크 없이도 시나리오 간 지식 전이를 통해 데이터가 적은 시나리오에서의 모델 일반화 및 성능 향상을 위해.
- 새로운 시나리오의 지속적인 추가를 지원하면서도 자원 효율적인 단일 모델을 다수의 시나리오에 확장 가능한 방식으로 구현하기 위해.
- MMoE가 CTR 예측에서 시나리오 간 공통점과 차이점을 명시적으로 모델링하는 데 효과적인지 탐색하기 위해.
제안 방법
- 모든 시나리오에 걸쳐 공유 밑바닥 블록을 사용하여 다수의 시나리오에서 수집된 데이터를 종합하여 일반적이고 이식 가능한 표현을 학습한다.
- 각 시나리오는 도메인별 헤드를 통해 특성에 따라 구분되는 특성을 학습함으로써 도메인 간 이동을 감소시키고 시나리오 인식 예측을 가능하게 한다.
- 지식 전이는 시나리오 간 지식 공유를 장려하는 손실 함수를 통해 구현되며, 특히 데이터가 적은 시나리오에 유리하게 작용한다.
- 모델은 두 가지 변형을 지원한다: 다층 퍼셉트론 공유 블록을 사용하는 DADNN-MLP와 표현 학습을 향상시키기 위해 다중 게이트 혼합 전문가 모듈(MMoE)을 사용하는 DADNN-MMoE.
- MMoE는 전문가에 대한 게이트 가중치를 동적으로 할당하여, 최소한의 파rameter 증가로 공통 및 시나리오별 특징을 모두 학습할 수 있도록 한다.
- 큰 시나리오에서 사전 학습된 임bedding 레이어를 사용하여 모델 파라미터를 초기화함으로써 수렴 속도와 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1각기 별도의 모델 훈련 없이도 단일 딥 러닝 모델이 저트래픽, 장수익성 광고 시나리오 수백 개를 효과적으로 지원할 수 있는가?
- RQ2CTR 예측에서 시나리오 간 도메인 간 이동을 줄이면서도 시나리오별 특성을 유지할 수 있는가?
- RQ3특히 데이터가 적은 상황에서 시나리오 간 지식 전이가 성능 향상에 얼마나 기여하는가?
- RQ4MMoE 모듈이 시나리오 간 공통 표현과 고유 표현을 명시적으로 모델링함으로써 성능 향상을 이끌어내는가?
- RQ5통합 모델 아키텍처가 최소한의 재훈련 또는 재구성으로 새로운 시나리오를 효율적으로 확장할 수 있는가?
주요 결과
- DADNN-MLP는 온라인 A/B 테스트에서 잘 튜닝된 DCN 모델 대비 최대 6.7% 높은 CTR와 3.0% 높은 CPM을 달성했다.
- DADNN-MMoE는 DADNN-MLP 대비 CTR 2.2% 향상, CPM 2.7% 향상으로, 공통 및 시나리오별 특징을 명시적으로 모델링함으로써 유의미한 성능 향상을 입증했다.
- 지식 전이는 시나리오 간 지식 공유를 강화함으로써 성능 향상을 이끌었으며, 특히 데이터가 적은 시나리오에서 두드러진 효과를 보였다.
- 제거 실험을 통해 지식 전이와 MMoE 모듈을 결합할 경우 기준 모델 대비 절대 GAUC 0.635% 향상된 최고의 성능을 확보했다.
- MMoE 모듈은 전문가 수가 두 개를 초과하면 수익 감소 현상이 나타나, 복잡성과 성능 사이의 최적의 균형을 보였다.
- 단일 모델을 모든 시나리오에 적용함으로써 뚜렷한 성능 향상을 달성했으며, 오프라인 훈련 및 온라인 서비스 비용을 크게 절감했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.