[论文解读] Shopping Queries Dataset: A Large-Scale ESCI Benchmark for Improving Product Search
本文介绍了购物查询数据集(Shopping Queries Dataset),这是一个大规模多语言基准数据集,包含130K条查询和260万条人工标注的(查询,商品)相关性判断,覆盖英语、西班牙语和日语。该研究提出了三个任务——排序、多类别相关性分类(精确/替代/补充/无关)以及替代商品识别,采用如微调交叉编码器和基于BERT的MLP分类器等神经网络模型,其在公开测试集上的nDCG得分最高达0.857,F1得分超过0.73,为未来商品搜索研究建立了强有力的基线。
Improving the quality of search results can significantly enhance users experience and engagement with search engines. In spite of several recent advancements in the fields of machine learning and data mining, correctly classifying items for a particular user search query has been a long-standing challenge, which still has a large room for improvement. This paper introduces the "Shopping Queries Dataset", a large dataset of difficult Amazon search queries and results, publicly released with the aim of fostering research in improving the quality of search results. The dataset contains around 130 thousand unique queries and 2.6 million manually labeled (query,product) relevance judgements. The dataset is multilingual with queries in English, Japanese, and Spanish. The Shopping Queries Dataset is being used in one of the KDDCup'22 challenges. In this paper, we describe the dataset and present three evaluation tasks along with baseline results: (i) ranking the results list, (ii) classifying product results into relevance categories, and (iii) identifying substitute products for a given query. We anticipate that this data will become the gold standard for future research in the topic of product search.
研究动机与目标
- 为解决在电商场景中准确匹配用户搜索查询与相关商品的长期挑战,其中二元相关性无法充分捕捉用户意图的细微差别。
- 通过使模型能够理解功能上的替代品、互补品和精确匹配,提升移动端和语音搜索的用户体验,超越简单的相关性判断。
- 为多语言环境下商品搜索中的语义匹配评估与推进提供标准化、大规模的基准。
- 通过发布一个公开可用的数据集,包含丰富的标注和多语言覆盖,支持检索、分类和推荐领域的研究。
提出的方法
- 该数据集包含130,652条英语、西班牙语和日语的唯一查询,每条查询与最多40个商品配对,并标注了ESCI相关性(精确、替代、补充、无关)。
- 对于任务1(排序),使用多语言MPNet微调的交叉编码器模型与BM25基线进行评估,采用nDCG作为指标。
- 对于任务2(分类),在拼接的查询与商品标题嵌入上训练基于BERT的MLP分类器,并对BERT表示应用最大池化操作。
- 对于任务3(替代品识别),采用相同的BERT-MLP架构,但使用二元头来识别替代商品。
- 超参数包括1–4个训练周期,使用Adam优化器,初始学习率为5e-5,权重衰减为0.01,每种语言使用10–200个开发查询。
- 该数据集已公开发布,并用于KDDCup’22挑战赛,每种语言均设有训练集、公开测试集和私有测试集。
实验结果
研究问题
- RQ1神经网络模型在多语言环境下对真实购物查询的商品结果排序能力如何?
- RQ2多类别相关性分类(精确、替代、补充、无关)是否能优于二元相关性,更好地捕捉用户意图?
- RQ3模型在多大程度上能够识别给定查询的功能替代品?其性能在不同语言间有何差异?
- RQ4在真实电商搜索场景中,强基线模型与人工标注的相关性判断之间存在多大的性能差距?
主要发现
- 微调的交叉编码器模型在英语测试集上取得了0.852的nDCG得分,显著优于BM25基线(0.563),表明神经语义匹配带来了显著提升。
- 基于BERT的MLP分类器在西班牙语测试集上的相关性分类任务中取得了0.685的微平均F1得分,表现中等,仍有较大改进空间。
- 在替代品识别任务中,BERT-MLP模型在西班牙语测试集上取得了0.795的微平均F1得分,显示出该任务的强大潜力。
- 性能在不同语言间存在显著差异,英语模型在分类任务中明显优于西班牙语和日语模型。
- ESCI标签分布显示,65.2%的判断为精确,21.9%为替代,2.9%为补充,10.0%为无关,反映出真实场景相关性的复杂性。
- 尽管基线表现强劲,但模型与人工标注判断之间仍存在显著性能差距,表明商品搜索中的语义匹配仍有巨大改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。