Skip to main content
QUICK REVIEW

[논문 리뷰] Deeply Supervised Semantic Model for Click-Through Rate Prediction in Sponsored Search

Jelena Gligorijević, Djordje Gligorijevic|arXiv (Cornell University)|2018. 03. 28.
Web Data Mining and Analysis참고 문헌 33인용 수 3
한 줄 요약

이 논문은 쌍방향 RNN와 주의 메커니즘을 활용해 쿼리 및 광고 임베딩과 클릭-through 비율(CTR) 예측을 동시에 학습하는 깊이 있는 감독 세분화 모델(DSM)을 제안한다. 이중 손실 최적화를 통해, 새로운 코hort 음성 샘플링 기법과 상업용 웹 검색 엔진에서의 10억 개의 쿼리-광고 쌍에 대한 엔드 투 엔드 학습을 통합함으로써, 최신 기준 모델 대비 AUC를 2% 향상시키고 쿼리-광고 매칭에서 NDCG를 0.5% 향상시켜 특징 공학 없이도 우수한 일반화 능력과 의미적 유사성 학습 능력을 입증한다.

ABSTRACT

In sponsored search it is critical to match ads that are relevant to a query and to accurately predict their likelihood of being clicked. Commercial search engines typically use machine learning models for both query-ad relevance matching and click-through-rate (CTR) prediction. However, matching models are based on the similarity between a query and an ad, ignoring the fact that a retrieved ad may not attract clicks, while click models rely on click history, being of limited use for new queries and ads. We propose a deeply supervised architecture that jointly learns the semantic embeddings of a query and an ad as well as their corresponding CTR.We also propose a novel cohort negative sampling technique for learning implicit negative signals. We trained the proposed architecture using one billion query-ad pairs from a major commercial web search engine. This architecture improves the best-performing baseline deep neural architectures by 2\% of AUC for CTR prediction and by statistically significant 0.5\% of NDCG for query-ad matching.

연구 동기 및 목표

  • 클릭 이력에 크게 의존하여 신규 쿼리나 광고로의 일반화에 실패하는 기존 CTR 예측 모델의 한계를 해결한다.
  • 쿼리와 광고 간의 의미적 유사성을 향상시키기 위해 분산 임베딩과 CTR 예측을 공동으로 학습한다.
  • 의미적 유사성 또는 클릭 행동을 명시적으로 최적화하지 않는 엔드 투 엔드 모델의 단점을 보완한다.
  • 클릭 데이터로부터의 암묵적 음성 신호를 활용해 모델의 일반화 능력과 성능을 향상시키는 방법을 개발한다.
  • 깊이 있는 감독을 통한 CTR 예측과 쿼리-광고 매칭의 공동 학습이 더 강력하고 정확한 모델을 얻을 수 있음을 입증한다.

제안 방법

  • 원시 텍스트에서 문맥적 분산 임베딩을 얻기 위해 쌍방향 RNN과 주의 메커니즘을 활용한다.
  • 쿼리 및 광고 임베딩을 조합하기 위해 컨volutional 신경망(CNN)을 사용하고, 최종 레이어에 로지스틱 활성화 함수를 적용해 CTR를 예측한다.
  • 다중 작업 학습 프레임워크 내에서 두 가지 다른 로지스틱 손실을 최적화한다: 하나는 CTR 예측을 위한 것이고, 다른 하나는 쿼리와 광고 임베딩 간의 의미적 매칭을 위한 것이다.
  • 클릭--through 데이터에서 암묵적 음성 쌍을 식별하는 새로운 코hort 음성 샘플링 전략을 도입하여, 명시적 레이블 없이도 표현 학습을 향상시킨다.
  • CTR 예측 헤드와 의미적 매칭 헤드에서 모두 기울기 역전파를 통해 모든 하위 레이어에 깊이 있는 감독을 적용한다.
  • 상업용 웹 검색 엔진에서의 10억 개의 쿼리-광고 쌍을 대상으로 전체 아키텍처를 엔드 투 엔드로 학습함으로써 희귀하거나 새로운 쿼리에 대한 강력한 일반화 능력을 확보한다.

실험 결과

연구 질문

  • RQ1클릭-through 데이터에만 기반해 학습된 모델과 비교해, CTR 예측과 의미적 임베딩의 공동 학습이 모델 성능 향상에 기여하는가?
  • RQ2CTR와 의미적 매칭을 동시에 최적화하는 이중 손실 아키텍처 도입이 AUC 및 NDCG 지표에 어떤 영향을 미치는가?
  • RQ3명시적 음성 레이블이 없는 상황에서 코hort 음성 샘플링이 모델의 일반화 능력과 표현 품질 향상에 얼마나 기여하는가?
  • RQ4주요 목적이 아니더라도 학습된 쿼리 및 광고 임베딩이 쿼리-광고 매칭 작업을 효과적으로 지원할 수 있는가?
  • RQ5다양한 데이터 조건 하에서 제안된 모델이 최신 딥러닝 및 전통적 모델보다 CTR 예측과 의미적 매칭 모두에서 뛰어난 성능을 보이는가?

주요 결과

  • DSM 모델은 최고 성능을 보인 베이스라인 모델의 CTR 예측 AUC를 2% 향상시켰으며, 윌코크슨 부호 순위 검정에서 유의미한 p-값 8.63e-5를 확보했다.
  • 쿼리-광고 매칭 작업에서 최고의 베이스라인 대비 NDCG@7에서 통계적으로 유의미한 0.5% 향상이 이루어졌으며, p-값은 2.69e-5였다.
  • 제거 실험 결과, 의미적 매칭 손실을 제거할 경우 AUC가 0.7671로 감소하여 이 손실 항목이 CTR 예측 품질 향상에 기여한다는 것을 입증했다.
  • Precision@K 및 NDCG@K를 포함한 모든 평가 지표에서 기존의 전통적 모델(GBDT, BM25)과 딥러닝 베이스라인 모두를 압도하는 성능을 기록했다.
  • 다양한 데이터 스케일, 쿼리 빈도, 광고 위치, 임베딩 선택 조건에서도 일관된 성능 유지를 보여 강력한 내구성을 입증했다.
  • 이론적 분석을 통해 제안된 코hort 음성 샘플링 기법의 수렴성을 확인하였으며, 이는 클릭 데이터에서 암묵적 음성 신호를 효과적으로 포착함을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.