[论文解读] A Multi-task Learning Approach for Improving Product Title Compression with User Search Log Data
本文提出了一种多任务学习框架,通过共享语义嵌入和注意力分布对齐,联合优化产品标题压缩与用户查询生成。利用用户搜索日志和人工压缩的标题,该方法在压缩质量与线上转化率方面均取得提升,在A/B测试中相较基线ILP方法实现2.58%的CTR提升与1.32%的CVR提升。
It is a challenging and practical research problem to obtain effective compression of lengthy product titles for E-commerce. This is particularly important as more and more users browse mobile E-commerce apps and more merchants make the original product titles redundant and lengthy for Search Engine Optimization. Traditional text summarization approaches often require a large amount of preprocessing costs and do not capture the important issue of conversion rate in E-commerce. This paper proposes a novel multi-task learning approach for improving product title compression with user search log data. In particular, a pointer network-based sequence-to-sequence approach is utilized for title compression with an attentive mechanism as an extractive method and an attentive encoder-decoder approach is utilized for generating user search queries. The encoding parameters (i.e., semantic embedding of original titles) are shared among the two tasks and the attention distributions are jointly optimized. An extensive set of experiments with both human annotated data and online deployment demonstrate the advantage of the proposed research for both compression qualities and online business values.
研究动机与目标
- 为解决在不影响用户体验或转化率的前提下,对移动端电商中冗长且经SEO优化的产品标题进行压缩的挑战。
- 减少传统抽取式摘要方法中对昂贵预处理和人工特征工程的依赖。
- 通过联合学习人工编辑的简短标题与用户搜索查询(结合交易数据),提升压缩质量。
- 通过优先选择与用户搜索行为一致并能促成购买的关键词,优化业务结果。
- 开发一种数据驱动的端到端框架,在实际部署中优于基于规则和单任务方法。
提出的方法
- 设计了一个包含两个并行序列到序列模型的多任务学习框架:一个用于抽取式标题压缩,另一个用于用户查询生成。
- 两个模型共享同一编码器,以生成原始产品标题的统一语义嵌入。
- 使用带有注意力机制的指针网络生成压缩后的标题与搜索查询,确保所有输出词汇均来自原始标题。
- 联合优化原始标题词元上的注意力分布,使其在压缩与用户搜索意图相关的关键词上对齐。
- 引入一致性损失(agreement loss),以促进两个任务在注意力焦点上的一致性,增强显著关键词的识别能力。
- 该框架在某大型中国电商平台的真实数据上进行训练,包含人工压缩的标题与交易型搜索日志。
实验结果
研究问题
- RQ1多任务学习框架是否能够通过共享语义表示,同时提升产品标题压缩与用户查询生成的效果?
- RQ2压缩与查询生成之间的注意力分布对齐,如何改善标题压缩中显著关键词的选择?
- RQ3所提方法在压缩质量与业务指标方面,相较于传统基于规则(如ILP)与单任务深度学习方法,优势程度如何?
- RQ4结合用户搜索日志与交易信号,是否能更准确对齐用户意图并提升转化率?
- RQ5端到端的数据驱动模型能否减少电商标题压缩中对人工预处理与特征工程的依赖?
主要发现
- 所提出的Agree-MTL模型在在线A/B测试中相较基线ILP方法实现了2.58%的点击率(CTR)相对提升。
- 该模型在基线基础上将点击转化率(CVR)提升了1.32%,表明其在点击后转化表现更优。
- 注意力一致性机制成功突出了用户搜索日志中偏好的关键词,如英文品牌名(例如D’ZZIT),而非不常见的变体。
- 该框架在抽取式压缩质量与业务价值方面,均优于普通多任务学习与标准指针网络。
- 人工评估确认,生成的简短标题语言流畅、语法正确,并保留了关键产品属性。
- 在线部署结果表明,该模型不仅通过简洁标题提升用户体验,还直接提高了交易转化率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。