[论文解读] Product Classification in E-Commerce using Distributional Semantics
本文提出了一种基于分布语义学的文档向量表示方法,结合分级词向量组合与两级集成分类器,通过整合路径预测、节点预测和深度预测,提升电子商务中的产品分类性能。该方法在真实世界电子商务数据集上实现了最先进(SOTA)的性能表现,书籍数据集上的路径精确率为45.64%,标签召回率为88.86%,显著优于tf-idf和基线模型。
Product classification is the task of automatically predicting a taxonomy path for a product in a predefined taxonomy hierarchy given a textual product description or title. For efficient product classification we require a suitable representation for a document (the textual description of a product) feature vector and efficient and fast algorithms for prediction. To address the above challenges, we propose a new distributional semantics representation for document vector formation. We also develop a new two-level ensemble approach utilizing (with respect to the taxonomy tree) a path-wise, node-wise and depth-wise classifiers for error reduction in the final product classification. Our experiments show the effectiveness of the distributional representation and the ensemble approach on data sets from a leading e-commerce platform and achieve better results on various evaluation metrics compared to earlier approaches.
研究动机与目标
- 解决电子商务目录中稀疏、长尾且层级化的分类挑战。
- 开发一种更具语义丰富度的文档表示方法,超越传统词袋或tf-idf模型,捕捉词语的语义、重要性与独特性。
- 通过新颖的两级集成分类器(路径级、节点级与深度级分类器)减少层级分类树预测中的错误。
- 实现适用于生产环境电子商务系统的实时、低延迟分类。
- 提升在复杂、模糊或标注质量差的产品数据上的性能表现,尤其针对长尾类别。
提出的方法
- 提出一种新的组合式文档向量构建方法,利用基于聚类频率的分级加权词嵌入,以反映词语在文档中的重要性与独特性。
- 引入一个与词嵌入空间分离的、更高维的文档向量空间,以捕捉文档的多义性与多主题特性。
- 采用两级集成策略:(1) 路径级分类器用于完整分类路径预测,(2) 节点级分类器用于单个标签预测,(3) 深度级分类器用于分类树每一层的预测,并为缺失节点引入“无”标签。
- 通过ANOVA F值(互信息)进行特征选择,以降低维度并提升效率。
- 基于提出的gwBoWV(分级加权词袋向量)表示训练多个分类器,并通过集成平均法融合最终预测结果。
- 对词向量进行k-means聚类,以分组语义相似的词语,并利用聚类频率实现文档向量的加权组合。
实验结果
研究问题
- RQ1基于分布语义学的文档向量表示是否能在电子商务产品分类任务中超越传统的tf-idf与词袋模型?
- RQ2基于聚类频率的分级词权重是否能提升文档表示在层级分类任务中的性能?
- RQ3路径级、节点级与深度级分类器的集成是否能降低层级产品分类树预测中的错误?
- RQ4该方法在具有长尾、稀疏与模糊标签的真实世界电子商务数据上的有效性如何?
- RQ5该方法在生产级电子商务系统中实时推理需求下的可扩展性如何?
主要发现
- 基于聚类频率加权的gwBoWV表示在100个聚类与100维词向量下,非书籍数据集上实现了83.18%的路径精确率与98.42%的标签召回率。
- 在书籍数据集上,集成方法(comb-2)实现了45.64%的路径精确率、77.26%的覆盖精确率、88.86%的标签召回率与24.57%的标签覆盖,显著优于tf-idf与基线模型。
- 仅使用路径-1与节点分类器时性能较低(如路径精确率为39.86%),表明融合多种分类器类型具有显著价值。
- 引入“无”标签处理机制的深度级分类器提升了在不完整或浅层分类路径上的鲁棒性,尤其在模糊或稀疏的书籍类别中表现突出。
- 通过ANOVA F值进行特征选择,将原始21,706个特征减少至8,000个,提升了效率且未损失性能。
- 该方法在书籍与非书籍数据集上,所有四项评估指标(PP、CP、LR、LC)均实现一致提升,展现出良好的鲁棒性与可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。