[논문 리뷰] COLD: Towards the Next Generation of Pre-Ranking System
COLD는 계산 비용과 모델 성능을 동시에 최적화하는 공동 설계, 온라인, 경량 딥 전랭킹 시스템을 제안한다. 이는 제어 가능한 지연 시간 내에서 교차 특징을 가진 임의의 딥 네트워크를 가능하게 하며, 알리바바에서 실전 배포 시 기존의 SOTA 벡터 곱셈 DNN 모델 대비 CTR 6.1–10.8% 향상과 RPM 6.1–10.8% 향상을 달성한다.
Multi-stage cascade architecture exists widely in many industrial systems such as recommender systems and online advertising, which often consists of sequential modules including matching, pre-ranking, ranking, etc. For a long time, it is believed pre-ranking is just a simplified version of the ranking module, considering the larger size of the candidate set to be ranked. Thus, efforts are made mostly on simplifying ranking model to handle the explosion of computing power for online inference. In this paper, we rethink the challenge of the pre-ranking system from an algorithm-system co-design view. Instead of saving computing power with restriction of model architecture which causes loss of model performance, here we design a new pre-ranking system by joint optimization of both the pre-ranking model and the computing power it costs. We name it COLD (Computing power cost-aware Online and Lightweight Deep pre-ranking system). COLD beats SOTA in three folds: (i) an arbitrary deep model with cross features can be applied in COLD under a constraint of controllable computing power cost. (ii) computing power cost is explicitly reduced by applying optimization tricks for inference acceleration. This further brings space for COLD to apply more complex deep models to reach better performance. (iii) COLD model works in an online learning and severing manner, bringing it excellent ability to handle the challenge of the data distribution shift. Meanwhile, the fully online pre-ranking system of COLD provides us with a flexible infrastructure that supports efficient new model developing and online A/B testing.Since 2019, COLD has been deployed in almost all products involving the pre-ranking module in the display advertising system in Alibaba, bringing significant improvements.
연구 동기 및 목표
- 온라인 추론를 위한 엄격하고 경량화된 모델 아키텍처에 제약을 받는 기존 전랭킹 시스템의 성능이 최적화되지 않는 문제를 해결하기 위해.
- 지연 시간이나 확장성에 손상 없이 사용자-광고 교차 특징을 가진 복잡한 딥 러닝 모델을 전랭킹에 활용할 수 있도록 하기 위해.
- 계산 능력 비용과 모델 정확도를 동시에 최적화하기 위해 모델 설계와 시스템 수준 최적화를 공동으로 고려하기 위해.
- 빠른 모델 반복과 A/B 테스트를 가능하게 하는 완전히 온라인, 온라인 학습이 가능한 인fra를 구축하기 위해.
- 산업 규모의 전랭킹 시스템에서 모델 성능과 추론 비용 사이의 탄력적인 트레이드오프를 달성하기 위해.
제안 방법
- COLD는 계산 능력 비용을 모델 정확도와 동일한 우선순위의 변수로 다루는 공동 최적화 프레임워크를 사용한다.
- 기존의 벡터 곱셈 모델과 달리, 전체 사용자-광고 교차 특징을 지원하는 경량이고 엔드 투 엔드로 훈련 가능한 딥 네트워크 아키텍처를 사용한다.
- 시스템 수준 최적화로는 혼합 정밀도 추론(FP16 + CUDA MPS)과 모델 양자화를 통해 GPU에서의 추론 속도를 향상시킨다.
- 온라인 학습과 온라인 서빙을 지원하여 데이터 분포 변화에 실시간으로 적응할 수 있도록 한다.
- 성능-비용 트레이드오프를 위해 교차 특징의 선택적 사용을 안내하기 위해 Squeeze-and-Excitation(SE) 블록을 활용해 특징 중요도를 모델링한다.
- 모델는 완전히 온라인 파이프라인에서 훈련되고 서빙되며, 빠른 A/B 테스트 및 배포를 지원한다.
실험 결과
연구 질문
- RQ1제어 불가능한 추론 비용을 유발하지 않으면서도, 벡터 곱셈 DNN 모델보다 높은 성능을 내는 전랭킹 시스템을 구현할 수 있는가?
- RQ2생산 환경의 전랭킹 시스템에서 모델 복잡도와 계산 비용을 어떻게 공동으로 최적화할 수 있는가?
- RQ3온라인 학습과 온라인 서빙은 전랭킹에서 데이터 분포 변화에 대한 적응성을 얼마나 향상시킬 수 있는가?
- RQ4GPU에서 딥 전랭킹 추론 속도를 가속화하는 데 가장 효과적인 시스템 수준 최적화는 무엇인가?
- RQ5탄력적이고 특징 선택 기반의 딥 모델 아키텍처는 정확도와 지연 시간 사이의 제어 가능한 트레이드오프를 유지하면서도 높은 성능을 유지를 할 수 있는가?
주요 결과
- COLD는 평소 날짜에 CTR 6.1% 향상, RPM 6.5% 향상 달성하였고, 더블 11 쇼핑 페스티벌 기간에는 CTR 9.1% 향상, RPM 10.8% 향상으로 강력한 성능 향상을 입증하였다.
- 단일 GPU에서 6700 QPS, 9.3ms RT를 달성하여, 모델 복잡도를 고려할 때 기존의 벡터 곱셈 DNN 모델(CPU에서 60000+ QPS)보다 시스템 효율성이 뛰어나게 되었다.
- FP16와 CUDA MPS를 사용함으로써 FP32 대비 사용 가능한 QPS가 2배로 증가하여, 지연 시간 제약을 초과하지 않으면서도 GPU 전체 활용이 가능해졌다.
- 균형 잡힌 COLD 모델(COLD*)은 6700 QPS, 9.3ms RT에서 GAUC 0.6391을 달성하였고, 교차 특징이 없는 버전(0.6281 GAUC)보다 성능이 뛰어나면서도 수용 가능한 지연 시간을 유지하였다.
- 완전히 온라인 인프라는 데이터 분포 변화에 대한 신속한 적응을 가능하게 하였으며, 더블 11 행사 기간 동안 동적 데이터 분포 변화에 기인한 CTR 9.1% 향상으로 이를 입증하였다.
- 제거 실험을 통해 교차 특징을 추가하면 GAUC가 0.6281에서 0.6467로 향상되지만 지연 시간이 증가함을 확인하였으며, 성능과 비용 사이의 제어 가능한 트레이드오프를 검증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.