[论文解读] Don't Classify, Translate: Multi-Level E-Commerce Product Categorization Via Machine Translation
本文提出了一种基于机器翻译(MT)的新型多层级电子商务产品分类方法,将分类问题建模为将产品描述翻译成根到叶的分类树路径。该方法在性能上优于最先进分类模型,并能生成新颖且有意义的分类路径,将分类体系转化为有向无环图(DAG),更贴合人类对产品的概念化理解。
E-commerce platforms categorize their products into a multi-level taxonomy tree with thousands of leaf categories. Conventional methods for product categorization are typically based on machine learning classification algorithms. These algorithms take product information as input (e.g., titles and descriptions) to classify a product into a leaf category. In this paper, we propose a new paradigm based on machine translation. In our approach, we translate a product's natural language description into a sequence of tokens representing a root-to-leaf path in a product taxonomy. In our experiments on two large real-world datasets, we show that our approach achieves better predictive accuracy than a state-of-the-art classification system for product categorization. In addition, we demonstrate that our machine translation models can propose meaningful new paths between previously unconnected nodes in a taxonomy tree, thereby transforming the taxonomy into a directed acyclic graph (DAG). We discuss how the resultant taxonomy DAG promotes user-friendly navigation, and how it is more adaptable to new products.
研究动机与目标
- 解决传统基于分类的产品分类方法在大规模电子商务平台中的局限性。
- 利用最先进的神经机器翻译(NMT)模型,提升产品分类的预测准确率和鲁棒性。
- 实现新生成的、有意义的根到叶分类路径,使分类体系超越原始树状结构。
- 通过将分类体系转化为有向无环图(DAG),提升用户导航体验和系统适应能力。
- 利用全球电子商务平台现有的机器翻译基础设施,降低技术债务和维护成本。
提出的方法
- 该方法将产品文本描述(如标题和描述)映射为表示分类树中根到叶路径的一系列分类标记序列。
- 采用神经机器翻译(NMT)模型,具体为基于Transformer的编码器-解码器Seq2Seq架构,学习从产品文本到分类序列的映射关系。
- 模型在真实世界电子商务数据集上进行端到端训练,学习生成有效且连贯的分类路径。
- 系统设计具备泛化能力,可超越已有路径,实现新根到叶路径的生成,这些路径在原始分类树中并不存在。
- 该方法利用现代NMT模型对语言变体和产品描述中噪声的强鲁棒性。
- 通过与真实标签对比并分析其语义一致性和结构新颖性,对生成的路径进行验证。
实验结果
研究问题
- RQ1机器翻译框架是否能在多层级电子商务产品分类任务中超越传统分类模型?
- RQ2NMT模型在多大程度上能生成原始分类树中不存在的新颖且有意义的根到叶分类路径?
- RQ3与分类模型相比,所提出的基于MT的方法在处理产品描述中的语言变体和噪声时表现如何?
- RQ4新路径的生成对产品分类体系的结构和可用性有何影响?
- RQ5在低数据环境下,基于NMT的方法相比传统分类系统具有多强的鲁棒性?
主要发现
- 所提出的Seq2Seq+Transformer集成模型在所有数据划分配置下(包括80-10-10和60-10-30划分)均优于最先进DBN+KNN分类模型。
- 即使仅使用20%的训练数据,NMT模型仍保持较高的F1分数,展现出对数据稀缺的更强鲁棒性。
- 模型生成的新路径具有语义上的合理性,例如将“打印机”归类于“办公用品”而非“电子产品”,更符合直观分类逻辑。
- 系统成功剔除错误类别,例如在歌曲集描述中不包含“乐器”类别,从而实现更准确的路径预测。
- NMT模型学习到从顶层类别开始、以叶节点结束的路径生成模式,反映出训练数据中强健的结构先验。
- 在RDC数据集中,系统生成了124个全新的完整分类路径;在Ichiba数据集中生成了48,455个全新路径,成功将分类体系从树结构转变为有向无环图(DAG)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。