Skip to main content
QUICK REVIEW

[论文解读] Multi-Label Product Categorization Using Multi-Modal Fusion Models

Pasawee Wirojwatanakul, Artit Wangperawong|arXiv (Cornell University)|Jun 30, 2019
Text and Document Classification Technologies参考文献 15被引用 11
一句话总结

本文提出了一种晚期融合的多模态深度学习模型,通过结合图像、标题和描述特征,提升了亚马逊平台上的多标签产品分类性能。通过使用三层神经网络策略融合各模态的独立分类器,该方法实现了88.2%的F₁分数,显著优于单模态模型和双模态融合模型,证明了互补模态能够提升分类性能。

ABSTRACT

In this study, we investigated multi-modal approaches using images, descriptions, and titles to categorize e-commerce products on Amazon. Specifically, we examined late fusion models, where the modalities are fused at the decision level. Products were each assigned multiple labels, and the hierarchy in the labels were flattened and filtered. For our individual baseline models, we modified a CNN architecture to classify the description and title, and then modified Keras' ResNet-50 to classify the images, achieving $F_1$ scores of 77.0%, 82.7%, and 61.0%, respectively. In comparison, our tri-modal late fusion model can classify products more effectively than single modal models can, improving the $F_1$ score to 88.2%. Each modality complemented the shortcomings of the other modalities, demonstrating that increasing the number of modalities can be an effective method for improving the performance of multi-label classification problems.

研究动机与目标

  • 通过利用多种数据模态,提升电子商务环境下的多标签产品分类性能。
  • 解决单模态方法在处理模糊或不完整产品信息时的局限性。
  • 评估晚期融合在结合图像、标题和描述分类器预测结果方面的有效性。
  • 识别在不同产品类别中,哪些模态对降低误分类的贡献最大。
  • 探索多模态融合在大规模电子商务系统中实现可扩展、高精度和自动化产品打标方面的潜力。

提出的方法

  • 为每种模态分别训练了深度学习模型:图像使用基于CNN的模型(ResNet-50),标题和描述则使用改进的CNN模型。
  • 通过策略网络将三个独立分类器的输出概率进行融合,实现晚期融合。
  • 该策略网络采用三层全连接层,激活函数分别为Sigmoid和双曲正切函数,用于融合图像、标题和描述分类器的预测结果。
  • 融合策略包括两两组合(图像-描述、图像-标题、标题-描述)以及完整的三模态融合。
  • 通过超参数调优优化了融合网络的结构和激活函数。
  • 使用展平并过滤后的标签层次结构处理多标签分配,每个产品可能属于多个类别。

实验结果

研究问题

  • RQ1通过晚期融合结合图像、标题和描述模态,是否能显著提升多标签产品分类性能,相较于单模态模型?
  • RQ2图像、标题和描述等模态在分类准确率上的贡献有何差异,它们是否具有互补性?
  • RQ3三模态融合在F₁分数和误分类减少方面是否优于双模态融合?
  • RQ4即使在多模态融合后,哪些产品类别仍然具有挑战性,原因是什么?
  • RQ5学习得到的融合策略是否能优于启发式融合规则,在多模态产品分类中表现更优?

主要发现

  • 三模态晚期融合模型实现了88.2%的F₁分数,显著优于最佳单模态分类器(标题分类器为82.7%)以及所有双模态融合模型。
  • 仅图像分类器的F₁分数最低(61.0%),表明仅依赖视觉特征不足以完成复杂的产品分类任务。
  • 标题分类器的表现优于描述分类器(82.7% vs. 77.0%),表明标题中包含更具区分性的信息用于分类。
  • 标题-描述双模态融合实现了最高的双模态F₁分数(87.0%),表明文本模态之间具有强烈的协同效应。
  • 与最佳单模态模型相比,三模态模型将误分类产品数量减少了5.5%;与最佳双模态融合相比,减少了1.2%。
  • Chew Toys、Accessories和Horses等类别仍存在较高的误分类率,表明在细粒度或模糊的产品类别中仍存在持续挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。