Skip to main content
QUICK REVIEW

[论文解读] Correct Normalization Matters: Understanding the Effect of Normalization On Deep Neural Network Models For Click-Through Rate Prediction

Zhiqiang Wang, Qingyun She|arXiv (Cornell University)|Jun 23, 2020
Image and Video Quality Assessment参考文献 20被引用 5
一句话总结

本文提出 NormDNN,一种通过系统评估特征嵌入和 MLP 层上的归一化技术,以增强归一化的深度神经网络,用于点击率预测。它引入了仅方差的层归一化(VO-LN),表明适当的归一化——尤其是方差稳定化——能显著提升性能,NormDNN 在三个真实世界数据集上优于复杂模型如 xDeepFM。

ABSTRACT

Normalization has become one of the most fundamental components in many deep neural networks for machine learning tasks while deep neural network has also been widely used in CTR estimation field. Among most of the proposed deep neural network models, few model utilize normalization approaches. Though some works such as Deep & Cross Network (DCN) and Neural Factorization Machine (NFM) use Batch Normalization in MLP part of the structure, there isn't work to thoroughly explore the effect of the normalization on the DNN ranking systems. In this paper, we conduct a systematic study on the effect of widely used normalization schemas by applying the various normalization approaches to both feature embedding and MLP part in DNN model. Extensive experiments are conduct on three real-world datasets and the experiment results demonstrate that the correct normalization significantly enhances model's performance. We also propose a new and effective normalization approaches based on LayerNorm named variance only LayerNorm(VO-LN) in this work. A normalization enhanced DNN model named NormDNN is also proposed based on the above-mentioned observation. As for the reason why normalization works for DNN models in CTR estimation, we find that the variance of normalization plays the main role and give an explanation in this work.

研究动机与目标

  • 研究不同归一化方法对点击率(CTR)预测中深度神经网络模型的影响。
  • 确定在通常被忽视的特征嵌入层中应用归一化是否能提升模型性能。
  • 识别在 DNN 基点击率模型的不同组件(数值特征与类别特征、MLP)中,最有效的归一化策略。
  • 解释归一化为何能提升 CTR 模型的性能,特别是方差稳定化的作用。
  • 通过结合最优归一化策略,开发一种实用且高效模型——NormDNN,以实现工业部署。

提出的方法

  • 提出仅方差的层归一化(VO-LN),即层归一化的简化变体,仅保留方差归一化部分。
  • 分别对特征嵌入(数值与类别)和 MLP 层应用多种归一化技术(批量归一化、层归一化、VO-LN)。
  • 在 NormDNN 中采用统一的归一化策略:数值特征使用 VO-LN 或层归一化,类别特征使用批量归一化,MLP 层使用 VO-LN。
  • 在三个真实世界数据集(Criteo、Avazu、Malware)上进行广泛的消融研究,评估不同模型组件中归一化的影响。
  • 分析归一化统计量(均值、方差)对模型性能的贡献,将方差识别为决定性主导因素。
  • 通过在 DNN、DeepFM 和 xDeepFM 等模型的相应组件中应用归一化,验证其有效性。

实验结果

研究问题

  • RQ1归一化方法的选择如何影响 DNN 模型在点击率预测中的性能?
  • RQ2在特征嵌入层中应用归一化——此前研究较少——是否能显著提升模型性能?
  • RQ3对于数值特征与类别特征以及 MLP 层,哪种归一化策略(批量归一化、层归一化、VO-LN)表现最佳?
  • RQ4为何归一化能提升 DNN 在 CTR 模型中的性能?其根本原因是什么?
  • RQ5能否设计一种统一的归一化策略,以在多种最先进模型(如 DeepFM 和 xDeepFM)中提升性能?

主要发现

  • 在特征嵌入中应用归一化能显著提升模型性能,这是在 CTR 模型中首次对这一效应进行实证验证。
  • VO-LN 达到了与层归一化相当的性能,但计算复杂度更低,因此更高效。
  • 对于数值特征,基于层归一化的方法(包括 VO-LN)优于批量归一化,而批量归一化在类别特征上表现最佳。
  • 最优归一化策略——数值特征使用 VO-LN,类别特征使用批量归一化,MLP 层使用 VO-LN——在所有数据集中实现了最高的 AUC。
  • NormDNN 采用此统一策略,在 Criteo 上 AUC 达到 0.8107,在 Avazu 上为 0.7869,在 Malware 上为 0.7402,分别优于 xDeepFM 0.0044、0.0021 和 0.0080 的 AUC。
  • 归一化在多种模型中均能提升性能:当应用于 DeepFM 和 xDeepFM 时,采用归一化的最优配置优于原始无归一化模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。