Skip to main content
QUICK REVIEW

[论文解读] DHEN: A Deep and Hierarchical Ensemble Network for Large-Scale Click-Through Rate Prediction

Buyun Zhang, Liang Luo|arXiv (Cornell University)|Mar 11, 2022
Sentiment Analysis and Opinion Mining被引用 8
一句话总结

本文提出DHEN,一种深度且分层的集成网络,通过组合异构交互模块来捕捉跨多个阶次的非重叠特征交互,从而提升点击率(CTR)预测性能。通过采用协同设计的训练系统,DHEN在大规模CTR数据集上的归一化熵(Normalized Entropy)比当前最先进基线模型提升0.27%,训练吞吐量提高1.2倍。

ABSTRACT

Learning feature interactions is important to the model performance of online advertising services. As a result, extensive efforts have been devoted to designing effective architectures to learn feature interactions. However, we observe that the practical performance of those designs can vary from dataset to dataset, even when the order of interactions claimed to be captured is the same. That indicates different designs may have different advantages and the interactions captured by them have non-overlapping information. Motivated by this observation, we propose DHEN - a deep and hierarchical ensemble architecture that can leverage strengths of heterogeneous interaction modules and learn a hierarchy of the interactions under different orders. To overcome the challenge brought by DHEN's deeper and multi-layer structure in training, we propose a novel co-designed training system that can further improve the training efficiency of DHEN. Experiments of DHEN on large-scale dataset from CTR prediction tasks attained 0.27\% improvement on the Normalized Entropy (NE) of prediction and 1.2x better training throughput than state-of-the-art baseline, demonstrating their effectiveness in practice.

研究动机与目标

  • 为解决现有CTR模型在不同数据集上性能不一致的问题,尽管其声称的交互阶次相似。
  • 克服同质化交互模块的局限性,这些模块无法捕捉特征交互中互补的、非重叠的信息。
  • 设计一种分层集成架构,以在保持训练效率的同时学习多阶次的交互关系。
  • 开发一种协同设计的训练系统,以实现对深度、多层分层模型的高效训练。
  • 在CTR预测中实现最先进性能,同时提升准确率与训练吞吐量。

提出的方法

  • DHEN采用分层架构,每一层包含多个异构交互模块(例如基于注意力、分解式和前馈式模块),以捕捉多样的交互模式。
  • 每一层集成一个集成组件,用于学习异构模块输出之间的相关性,从而实现对其贡献的动态加权。
  • 模型使用残差连接和多头注意力机制,以增强深层堆叠中的梯度流动与模型表达能力。
  • 提出一种协同设计的训练系统,以优化深度、多层结构的训练效率,降低计算开销。
  • 该架构支持端到端训练,无需第二阶段微调,与GIN或AutoFIS等模型不同。
  • 模型通过标准反向传播进行端到端训练,联合优化所有参数,包括集成与交互组件中的参数。

实验结果

研究问题

  • RQ1与同质化模型相比,异构交互模块的分层集成是否能提升在多样化数据集上的CTR预测性能?
  • RQ2为何声称捕捉相同阶次特征交互的模型在不同数据集上表现差异显著?
  • RQ3深度、多层的集成架构是否能有效学习特征交互的层次结构,同时不降低训练效率?
  • RQ4将来自不同交互模块的非重叠信息进行组合,是否能提升模型的泛化能力与鲁棒性?
  • RQ5协同设计的训练系统是否能显著提升大规模CTR场景下深度分层模型的训练吞吐量?

主要发现

  • 与最先进基线相比,DHEN在大规模CTR预测数据集上实现了0.27%的归一化熵(NE)改进。
  • 该模型的训练吞吐量比最强基线高出1.2倍,表明其训练效率更优。
  • 性能提升在多个数据集上保持一致,证实了模型的鲁棒性与泛化能力。
  • 分层集成设计成功捕捉了来自不同交互模块的互补性、非重叠信息,提升了模型表达能力。
  • 协同设计的训练系统有效缓解了深度多层架构的训练挑战,实现了无需第二阶段微调的端到端训练。
  • 消融实验确认,异构模块对性能有独特贡献,其集成效果优于任一单一模块。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。