Skip to main content
QUICK REVIEW

[论文解读] Field-aware Factorization Machines in a Real-world Online Advertising System

Yu-Chin Juan, Damien Lefortier|arXiv (Cornell University)|Jan 15, 2017
Stochastic Gradient Optimization Techniques参考文献 21被引用 9
一句话总结

本文展示了在真实在线广告系统中,领域感知因子分解机(FFM)显著提升了点击率和转化率预测性能,优于逻辑回归。作者提出一种预过早暖启动初始化策略与分布式训练方法,将FFM训练时间缩短至原来的1/20,实现了高效生产部署,同时保持了高模型精度。

ABSTRACT

Predicting user response is one of the core machine learning tasks in computational advertising. Field-aware Factorization Machines (FFM) have recently been established as a state-of-the-art method for that problem and in particular won two Kaggle challenges. This paper presents some results from implementing this method in a production system that predicts click-through and conversion rates for display advertising and shows that this method it is not only effective to win challenges but is also valuable in a real-world prediction system. We also discuss some specific challenges and solutions to reduce the training time, namely the use of an innovative seeding algorithm and a distributed learning mechanism.

研究动机与目标

  • 评估领域感知因子分解机(FFM)在大规模生产广告系统中用于点击率与转化率预测的有效性。
  • 通过在不牺牲模型性能的前提下减少训练时间,解决在生产环境中训练FFM模型的高计算成本问题。
  • 开发并验证一种分布式学习机制与创新的初始化策略,以实现更快收敛与更低资源消耗。
  • 在离线与在线A/B测试环境中,将FFM与标准逻辑回归模型进行对比。
  • 探究FFM更强的泛化能力是否能转化为可衡量的业务提升,特别是对小型广告主而言。

提出的方法

  • 作者在实时竞价系统中实现了FFM,用于展示广告,采用基于特征交互上下文的领域感知嵌入。
  • 提出一种“预过早暖启动”技术:在完整训练前,从先前模型初始化模型权重,从而减少所需训练轮次。
  • 采用分布式学习框架,将训练扩展到多台机器,提升吞吐量,但增加了计算开销。
  • 暖启动方法采用截断训练过程:模型训练的轮次少于所需数量,然后用作下一轮训练的初始化。
  • 系统采用基于验证损失的早停机制,从每个训练步骤中选择最佳模型。
  • 通过离线与在线A/B测试,对比FFM与逻辑回归基线模型在多个指标上的表现,包括对数损失和业务关键绩效指标。

实验结果

研究问题

  • RQ1在真实世界的展示广告点击率与转化率预测中,领域感知因子分解机(FFM)是否能显著优于逻辑回归?
  • RQ2在生产系统中大规模训练FFM模型的主要计算瓶颈是什么?
  • RQ3预过早暖启动初始化策略在减少FFM训练时间与提升收敛性方面有多有效?
  • RQ4能否将分布式训练与暖启动有效结合,进一步加速FFM训练,同时保持模型质量?
  • RQ5FFM相较于逻辑回归具备更强泛化能力,这种能力是否能转化为可衡量的业务指标提升,特别是对小型广告主而言?

主要发现

  • FFM在离线对数损失与在线A/B测试中均显著优于逻辑回归,在测试集上对数损失相对改善5.5%。
  • 预过早暖启动方法将训练轮次从基线的315轮减少至103轮,总训练时间从20.6小时缩短至6.8小时。
  • 仅使用4个数据块并配合预过早暖启动,性能优于基线使用44个数据块的设置,训练时间缩短至0.9小时(提速20倍)。
  • 即使每步仅使用一个数据块,‘在线’暖启动变体也优于基线,但作者更倾向于使用预过早方法,因其具备更好的稳定性与对数据质量的低敏感性。
  • 暖启动方法通过减少训练轮次,降低了总计算量,因此比仅使用分布式学习更高效。
  • FFM展现出强大的泛化能力,模型在后续训练步骤中仍能保留先前训练的知识,表明其具备对历史模式的内在记忆能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。