[论文解读] Modeling Product Search Relevance in e-Commerce
本文提出一种基于机器学习的方法,利用自然语言处理与信息检索技术预测电子商务平台中的产品搜索相关性。该研究对比了传统模型(如BM25和Indri)与深度学习方法(如word2vec、sentence2vec和paragraph2vec),发现word2vec在Home Depot数据集上表现最佳,其均方根误差(RMSE)为0.2482,皮尔逊相关系数为0.2687。
With the rapid growth of e-Commerce, online product search has emerged as a popular and effective paradigm for customers to find desired products and engage in online shopping. However, there is still a big gap between the products that customers really desire to purchase and relevance of products that are suggested in response to a query from the customer. In this paper, we propose a robust way of predicting relevance scores given a search query and a product, using techniques involving machine learning, natural language processing and information retrieval. We compare conventional information retrieval models such as BM25 and Indri with deep learning models such as word2vec, sentence2vec and paragraph2vec. We share some of our insights and findings from our experiments.
研究动机与目标
- 通过利用机器学习与自然语言处理技术,提升电子商务平台中的产品搜索相关性预测性能。
- 评估深度学习嵌入方法(包括word2vec、sentence2vec和paragraph2vec)相较于传统信息检索模型(如BM25和Indri)的有效性。
- 确定融合多种模型是否能提升相关性预测的准确性。
- 分析训练数据规模对搜索相关性任务模型性能的影响。
- 理解为何某些深度学习模型尽管在上下文理解方面具有理论优势,但仍表现欠佳。
提出的方法
- 作者使用Kaggle提供的数据集,其中包含74,067个训练样本,包含产品ID、搜索查询及相关性评分(1.0–3.0)。
- 对产品标题、描述和属性中的文本特征进行预处理,包括转为小写、去除停用词、词干化处理以及n-gram分词。
- 采用基于Levenshtein距离的拼写校正算法,以处理未登录词问题。
- 训练word2vec、sentence2vec和paragraph2vec模型,生成查询与产品对应的稠密向量表示。
- 将基线模型(BM25、Indri)及其得分与word2vec相似度得分作为特征,输入支持向量机(SVM)分类器进行融合。
- 通过预测值与真实相关性评分之间的均方根误差(RMSE)和皮尔逊相关系数评估模型性能。
实验结果
研究问题
- RQ1与传统信息检索模型相比,基于深度学习的word2vec等词嵌入方法是否能提升产品搜索相关性预测性能?
- RQ2尽管具备上下文建模能力,为何sentence2vec和paragraph2vec模型在电子商务产品描述上表现欠佳?
- RQ3将多种模型(如BM25/Indri与word2vec)结合是否能带来统计上显著的性能提升?
- RQ4标注训练数据的规模如何影响相关性预测模型的性能?
- RQ5稀疏且非结构化的商品描述(如项目符号列表)在多大程度上限制了句子级别嵌入的有效性?
主要发现
- word2vec在所有模型中表现最佳,其均方根误差(RMSE)为0.2482,皮尔逊相关系数为0.2687。
- sentence2vec和paragraph2vec模型表现较差,其RMSE分别为0.2748和0.2706,可能由于商品描述不具备句子结构特征。
- 在SVM中将BM25/Indri得分与word2vec相似度得分结合,并未带来统计上显著的性能提升,可能由于特征之间存在虚假相关性。
- 基线模型(OR/AND策略结合BM25/Indri)的RMSE为0.2509,相关系数为0.2537,表现弱于word2vec。
- 随着训练数据量增加,模型性能持续提升,表明更多标注样本可显著改善结果。
- word2vec模型能有效捕捉模糊查询的相关性,展现出在产品搜索语境中处理语义相似性的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。