Skip to main content
QUICK REVIEW

[论文解读] Combination of Diverse Ranking Models for Personalized Expedia Hotel Searches

Xudong Liu, Bing Xu|arXiv (Cornell University)|Nov 29, 2013
Consumer Market Behavior and Pricing参考文献 18被引用 3
一句话总结

本文提出了一种混合集成方法,结合了多种排名模型——逻辑回归、梯度提升、随机森林和深度神经网络——用于 ICDM 2013 竞赛中的个性化酒店搜索排名。通过应用 z 分数标准化和基于 LambdaMART 的列表级集成,该方法在私有排行榜上取得了 0.53102 的 NDCG@38 得分,表明模型组合显著提升了单个模型的排名性能。

ABSTRACT

The ICDM Challenge 2013 is to apply machine learning to the problem of hotel ranking, aiming to maximize purchases according to given hotel characteristics, location attractiveness of hotels, user's aggregated purchase history and competitive online travel agency information for each potential hotel choice. This paper describes the solution of team "binghsu & MLRush & BrickMover". We conduct simple feature engineering work and train different models by each individual team member. Afterwards, we use listwise ensemble method to combine each model's output. Besides describing effective model and features, we will discuss about the lessons we learned while using deep learning in this competition.

研究动机与目标

  • 通过组合多种机器学习模型,提升 ICDM 2013 竞赛中个性化酒店排名的性能。
  • 解决在标注数据有限的大规模酒店排名任务中数据不平衡与可扩展性问题。
  • 评估深度学习与集成技术在个性化搜索学习排序任务中的有效性。
  • 通过使用 10% 的内部验证集开发稳健的验证策略,以指导模型选择与组合。
  • 探究深度神经网络是否能在该排名任务中超越传统模型或增强集成性能。

提出的方法

  • 采用三阶段流程:使用 pandas 进行数据预处理,训练多种独立模型,以及对模型输出进行集成。
  • 使用列表级特征(如 price_usd、prop_starrating 和 prop_location_score2)以捕捉每个搜索列表内的排名上下文。
  • 应用特征工程技术,包括复合特征(如 srch_room_count * max(srch_booking_window) + srch_booking_window)和浮点特征的分桶处理。
  • 通过按国家特定的第一四分位数插补处理缺失值,特别是针对 prop_location_score2。
  • 对树基模型和深度神经网络采用 1:1 正样本与负样本的平衡采样,以提升收敛性和泛化能力。
  • 按 prop_country_id 划分数据,为每个国家独立训练模型,以减少树基模型的训练时间。
  • 在查询级别应用 z 分数标准化,以在集成前对齐不同模型的得分范围,并通过手动调参避免过拟合。
  • 通过使用 z 分数标准化后的模型输出进行列表级集成(LambdaMART),以优化 NDCG,最终获得模型。

实验结果

研究问题

  • RQ1与单个模型相比,组合多种排名模型是否能显著提升个性化酒店搜索中的 NDCG 性能?
  • RQ2在列表级排名设置中,z 分数标准化在对齐异质模型输出以实现集成学习方面有多有效?
  • RQ3当作为集成的一部分时,深度学习模型(如深度神经网络、Dropout 逻辑回归)在多大程度上能提升排名性能?
  • RQ4为每个国家(prop_country_id)单独训练模型是否能提升大规模酒店排名中的性能或可扩展性?
  • RQ5在低数据环境下,深度学习的实际限制是什么?如何改进归一化和微调策略以实现更好的表征学习?

主要发现

  • 最终的集成模型通过 z 分数标准化和列表级 LambdaMART 方法,在私有排行榜上取得了 0.53102 的 NDCG@38 得分,排名第五。
  • 在查询级别进行的 z 分数标准化显著优于原始得分平均和全局 z 分数标准化,且通过手动调参避免了过拟合。
  • 使用模型输出作为特征的 GBM 集成在本地测试集上达到 0.53573 的 NDCG@38,但在公开测试集上下降至 0.53053,表明存在过拟合风险。
  • 深度学习模型(包括 ReLU 和 Maxout 网络)在私有排行榜上取得了约 0.526 的 NDCG@38,而 Dropout 逻辑回归达到 0.52729,均低于最终的列表级集成模型。
  • 平衡采样提升了训练稳定性,将错误率从 50% 降低至接近 10%,但对本地 NDCG 的提升有限(约 0.49),表明对最终排名质量的影响较小。
  • 研究发现,自编码器中的重构误差可能无法反映最优的表征学习,且特征分桶处理可能并非深度网络的最佳选择,提示需要更优的归一化技术。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。