[论文解读] Empowering News Recommendation with Pre-trained Language Models
本文提出将预训练语言模型(PLMs)集成到新闻推荐系统中,以提升新闻表征学习与推荐性能。通过使用 BERT 和 UniLM 等 PLM 替代传统的浅层 NLP 模型进行新闻编码,该方法实现了显著提升——在英语市场中点击率提高 8.53%,页面浏览量提高 2.63%;在 43 个全球市场中,点击率与页面浏览量分别提升 10.68% 和 6.04%,首次展示了 PLM 在工业级新闻推荐中的大规模部署。
Personalized news recommendation is an essential technique for online news services. News articles usually contain rich textual content, and accurate news modeling is important for personalized news recommendation. Existing news recommendation methods mainly model news texts based on traditional text modeling methods, which is not optimal for mining the deep semantic information in news texts. Pre-trained language models (PLMs) are powerful for natural language understanding, which has the potential for better news modeling. However, there is no public report that show PLMs have been applied to news recommendation. In this paper, we report our work on exploiting pre-trained language models to empower news recommendation. Offline experimental results on both monolingual and multilingual news recommendation datasets show that leveraging PLMs for news modeling can effectively improve the performance of news recommendation. Our PLM-empowered news recommendation models have been deployed to the Microsoft News platform, and achieved significant gains in terms of both click and pageview in both English-speaking and global markets.
研究动机与目标
- 解决传统浅层 NLP 模型在捕捉新闻文本深层语义信息方面用于个性化推荐的局限性。
- 探究预训练语言模型(PLMs)是否能够提升新闻推荐系统中的新闻表征学习能力。
- 评估 PLMs 在单语与多语言新闻推荐数据集中的有效性。
- 在真实工业级新闻平台(特别是 Microsoft News)中部署并验证增强 PLM 的模型。
- 展示基于 PLM 的模型在多样化语言与文化市场中的可扩展性与泛化能力。
提出的方法
- 用预训练语言模型(PLMs)如 BERT 和 UniLM 替代传统的新闻编码模型(如 CNN、自注意力机制),从完整新闻内容中学习上下文相关的新闻表征。
- 在新闻推荐数据上微调 PLMs,采用标准推荐框架,包括新闻编码器、用户编码器(如 GRU 或注意力机制)和点击率预测模块。
- 采用基于注意力的池化机制,将 PLM 的隐藏状态聚合为固定大小的新闻嵌入,优于 CLS 和平均池化方法。
- 将基于 PLM 的新闻编码器集成到两个现有推荐模型中:NAML(新闻感知多头注意力)与 NRMS(基于自注意力的神经新闻推荐模型)。
- 利用多语言 PLM(如 InfoXLM)实现全球市场中的跨语言新闻表征学习。
- 应用 t-SNE 可视化方法,对比浅层模型与基于 PLM 的模型所学习到的新闻嵌入的判别能力。
实验结果
研究问题
- RQ1与传统浅层 NLP 模型相比,预训练语言模型是否能显著提升新闻表征学习能力?
- RQ2预训练语言模型的规模如何影响其在单语与多语言数据集上的推荐性能?
- RQ3哪种池化策略(CLS、平均池化或基于注意力的池化)能从 PLM 隐藏状态中生成最有效的新闻嵌入?
- RQ4基于 PLM 的模型是否能生成更具判别性与语义意义的新闻嵌入,如可视化结果所示?
- RQ5在真实部署中,基于 PLM 增强的推荐模型是否能在点击率与页面浏览量等在线指标上实现可测量的性能提升?
主要发现
- 在英语市场中,基于 PLM 的新闻推荐模型相比无 PLM 的基线模型,点击率提升 8.53%,页面浏览量提升 2.63%。
- 在 43 个非英语全球市场中,模型实现点击率提升 10.68%,页面浏览量提升 6.04%,展现出强大的多语言泛化能力。
- 更大的 PLM(如 BERT-Base)始终优于较小的变体(如 BERT-Tiny),表明模型容量与更优的语义理解能力正相关。
- 基于注意力的池化方法优于 CLS 和平均池化,因其能更好地捕捉序列中信息丰富的隐藏状态。
- t-SNE 可视化结果证实,基于 PLM 的模型学习到了更具判别性且分离更清晰的新闻嵌入,聚类效果明显优于浅层模型。
- 在 Microsoft News 平台上线部署 NAML-UniLM 与 NAML-InfoXLM,验证了 PLM 集成在大规模生产系统中的可扩展性与实际有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。