Skip to main content
QUICK REVIEW

[论文解读] Visualizing and Understanding Deep Neural Networks in CTR Prediction

Guo Lin, Hui Ye|arXiv (Cornell University)|Jun 22, 2018
Advanced Graph Neural Networks参考文献 21被引用 5
一句话总结

本文提出了一种针对点击率(CTR)预测中深度神经网络的全面可视化与分析框架,利用激活统计量、基于梯度的显著性图以及基于探测的逐层性能评估,在真实世界、每日变化的生产数据上进行分析。主要贡献在于证明了通过神经元级别的分析,可以诊断和监控模型行为(包括过拟合、特征敏感性及分布漂移),从而提升工业广告系统中的模型优化与系统可靠性。

ABSTRACT

Although deep learning techniques have been successfully applied to many tasks, interpreting deep neural network models is still a big challenge to us. Recently, many works have been done on visualizing and analyzing the mechanism of deep neural networks in the areas of image processing and natural language processing. In this paper, we present our approaches to visualize and understand deep neural networks for a very important commercial task--CTR (Click-through rate) prediction. We conduct experiments on the productive data from our online advertising system with daily varying distribution. To understand the mechanism and the performance of the model, we inspect the model's inner status at neuron level. Also, a probe approach is implemented to measure the layer-wise performance of the model. Moreover, to measure the influence from the input features, we calculate saliency scores based on the back-propagated gradients. Practical applications are also discussed, for example, in understanding, monitoring, diagnosing and refining models and algorithms.

研究动机与目标

  • 为解决工业CTR预测中深度学习模型的可解释性挑战,其中模型可靠性与性能监控至关重要。
  • 理解深度神经网络如何处理现实广告系统中每日变化的数据分布下的稀疏高维特征。
  • 开发实用的可视化与分析技术,诊断模型行为,检测过拟合,并评估特征重要性,而不完全依赖标准评估指标。
  • 即使在缺乏反馈标签的情况下,也通过内部神经元统计量与梯度信号实现模型监控与健康检查。
  • 通过揭示结构低效性与特征组敏感性(如对用户ID的过拟合),指导模型设计与特征工程。

提出的方法

  • 分析隐藏层中神经元激活分布,以检测过拟合与共适应现象,尤其关注深层网络。
  • 应用t-SNE可视化技术,分析模型学习到的高层表示,评估潜在空间中特征的聚类情况。
  • 采用探测方法,通过在每一层的激活上训练线性分类器来评估逐层性能,以衡量表征质量。
  • 通过从输出层反向传播梯度计算显著性分数,量化每组特征对最终预测的影响。
  • 监控测试天数中神经元输出统计量(如均值、标准差),以检测分布漂移与数据管道问题。
  • 通过从嵌入层中移除用户ID并替换为可学习偏置项,对模型架构进行修改,以减少过拟合并提升泛化能力。

实验结果

研究问题

  • RQ1在CTR预测的DNN中,神经元内部状态如何随训练过程演变,并在数据分布随时间变化时发生改变?
  • RQ2哪些特征组对模型预测影响最大,其影响程度如何进行定量测量?
  • RQ3过拟合与共适应在深层网络中表现程度如何,能否通过内部模型统计量进行诊断?
  • RQ4逐层性能探测能否揭示模型的结构低效性或表征退化?
  • RQ5内部神经元统计量与梯度信号能否作为在线广告系统中模型健康与数据质量的可靠、无标签指标?

主要发现

  • 模型在深层(尤其是第4层)表现出过拟合,神经元相关性高且对输入敏感,表明存在共适应现象并降低了泛化能力。
  • 第4层对性能贡献极小,移除后AUC未下降,表明当前架构存在冗余。
  • 当模型出现过拟合时,对用户ID特征高度敏感,导致在分布外数据上泛化能力差。
  • 将用户ID嵌入替换为可学习偏置项后,AUC提升约0.1%,证明基于分析的架构优化具有实际效益。
  • 第3层神经元输出统计量(如标准差)在每日数据分布变化时发生显著偏移,提供了无标签的数据漂移检测信号。
  • 基于梯度的显著性图显示,用户ID与查询特征最具影响力,而性别与年龄等其他特征组对预测影响微乎其微。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。