Skip to main content
QUICK REVIEW

[論文レビュー] COLD: Towards the Next Generation of Pre-Ranking System

Zhe Wang, Liqin Zhao|arXiv (Cornell University)|Jul 31, 2020
Recommender Systems and Techniques参考文献 16被引用数 10
ひとこと要約

COLDは、モデル性能と計算コストを共同最適化する共同設計型で、オンラインかつ軽量なディーププレランクシステムを提案する。これにより、制御可能な遅延のもとでクロス特徴を備えた任意のディープネットワークを実装可能となる。Alibabaでの実世界の展開において、SOTAのベクタープロダクトDNNモデルを上回り、CTRで6.1–10.8%、RPMで6.5%以上の向上を達成した。

ABSTRACT

Multi-stage cascade architecture exists widely in many industrial systems such as recommender systems and online advertising, which often consists of sequential modules including matching, pre-ranking, ranking, etc. For a long time, it is believed pre-ranking is just a simplified version of the ranking module, considering the larger size of the candidate set to be ranked. Thus, efforts are made mostly on simplifying ranking model to handle the explosion of computing power for online inference. In this paper, we rethink the challenge of the pre-ranking system from an algorithm-system co-design view. Instead of saving computing power with restriction of model architecture which causes loss of model performance, here we design a new pre-ranking system by joint optimization of both the pre-ranking model and the computing power it costs. We name it COLD (Computing power cost-aware Online and Lightweight Deep pre-ranking system). COLD beats SOTA in three folds: (i) an arbitrary deep model with cross features can be applied in COLD under a constraint of controllable computing power cost. (ii) computing power cost is explicitly reduced by applying optimization tricks for inference acceleration. This further brings space for COLD to apply more complex deep models to reach better performance. (iii) COLD model works in an online learning and severing manner, bringing it excellent ability to handle the challenge of the data distribution shift. Meanwhile, the fully online pre-ranking system of COLD provides us with a flexible infrastructure that supports efficient new model developing and online A/B testing.Since 2019, COLD has been deployed in almost all products involving the pre-ranking module in the display advertising system in Alibaba, bringing significant improvements.

研究の動機と目的

  • オンライン推論に制限を受ける、硬直的で軽量なモデルアーキテクチャに起因する従来のプレランクシステムの性能劣化を是正すること。
  • レイテンシやスケーラビリティを損なわずに、ユーザー広告クロス特徴を備えた複雑なディープラーニングモデルをプレランクで使用可能にすること。
  • 計算パワーのコストとモデルの精度の両方を最適化する、モデル設計とシステムレベルの最適化を共同で行うこと。
  • 迅速なモデル反復とA/Bテストを可能にする、完全にオンラインで学習可能なインfraを構築すること。
  • 産業スケールのプレランクシステムにおいて、モデルパフォーマンスと推論コストの間で柔軟なトレードオフを実現すること。

提案手法

  • COLDは、計算パワーのコストをモデル精度と同等の第一の変数として扱う共同最適化フレームワークを採用する。
  • 従来のベクタープロダクトモデルとは異なり、完全なユーザー広告クロス特徴をサポートする、軽量でエンドツーエンドでトレーニング可能なディープニューラルネットワークアーキテクチャを採用する。
  • システムレベルの最適化には、混合精度推論(FP16 + CUDA MPS)とモデル量子化を用い、GPU上での推論を高速化する。
  • オンライン学習とオンラインサービングをサポートし、データ分布の変化にリアルタイムで適応可能である。
  • 特徴の重要度はSqueeze-and-Excitation(SE)ブロックを用いてモデル化し、パフォーマンスとコストのトレードオフを実現するためのクロス特徴の選択的使用を促進する。
  • モデルは完全にオンラインのパイプラインでトレーニングおよびサービングされ、迅速なA/Bテストとデプロイメントを可能にする。

実験結果

リサーチクエスチョン

  • RQ1推論コストが著しく高騰するのを避けながら、ベクタープロダクトDNNモデルを上回るパフォーマンスを実現できるプレランクシステムは構築可能か?
  • RQ2本番環境のプレランクシステムにおいて、モデルの複雑さと計算コストをどのように共同最適化できるか?
  • RQ3オンライン学習とオンラインサービングは、プレランクにおけるデータ分布の変化への適応性をどの程度向上できるか?
  • RQ4GPU上でディーププレランク推論を加速するために、最も効果的なシステムレベルの最適化は何か?
  • RQ5柔軟で特徴選択可能なディープモデルアーキテクチャは、精度とレイテンシの間で制御可能なトレードオフを維持しながら高いパフォーマンスを発揮できるか?

主な発見

  • COLDは通常日においてCTRが6.1%向上、RPMが6.5%以上向上し、ダブル11セール期間中はCTRが9.1%、RPMが10.8%向上するなど、顕著なパフォーマンス向上を達成した。
  • 1枚のGPUで6700 QPS、9.3ms RTを達成し、モデルの複雑さを考慮した上で、CPU上で60000+ QPSを記録するベクタープロダクトDNNモデルを上回るシステム効率を実現した。
  • FP16とCUDA MPSを用いることで、FP32に比べて利用可能なQPSが2倍に増加し、レイテンシ制約を超えることなくGPUのフル利用が可能になった。
  • バランスの取れたCOLDモデル(COLD*)はGAUC 0.6391、6700 QPS、9.3ms RTを達成し、クロス特徴なしバージョン(GAUC 0.6281)を上回る性能を発揮しながらも、許容可能なレイテンシを維持した。
  • 完全にオンラインのインfraにより、データの分布シフトへの迅速な適応が可能であり、ダブル11イベント中に動的データ分布を反映した9.1%のCTR向上が確認された。
  • アブレーションスタディにより、クロス特徴の追加がGAUCを0.6281から0.6467に向上させることが確認されたが、レイテンシも増加することが示され、パフォーマンスとコストの制御可能なトレードオフが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。