Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Label Product Categorization Using Multi-Modal Fusion Models

Pasawee Wirojwatanakul, Artit Wangperawong|arXiv (Cornell University)|Jun 30, 2019
Text and Document Classification Technologies参考文献 15被引用数 11
ひとこと要約

本稿では、アマゾンの商品分類において、画像、見出し、説明の特徴を統合することで、マルチラベル商品分類の性能を向上させる、ラテン融合型マルチモーダルディープラーニングモデルを提案する。各モダリティの分類器を3層のニューラルネットワークポリシーを用いて統合することで、F₁スコア88.2%を達成し、単一モダリティモデルや二モダリティ統合モデルを著しく上回り、補完的モダリティが分類性能を向上させることを示している。

ABSTRACT

In this study, we investigated multi-modal approaches using images, descriptions, and titles to categorize e-commerce products on Amazon. Specifically, we examined late fusion models, where the modalities are fused at the decision level. Products were each assigned multiple labels, and the hierarchy in the labels were flattened and filtered. For our individual baseline models, we modified a CNN architecture to classify the description and title, and then modified Keras' ResNet-50 to classify the images, achieving $F_1$ scores of 77.0%, 82.7%, and 61.0%, respectively. In comparison, our tri-modal late fusion model can classify products more effectively than single modal models can, improving the $F_1$ score to 88.2%. Each modality complemented the shortcomings of the other modalities, demonstrating that increasing the number of modalities can be an effective method for improving the performance of multi-label classification problems.

研究の動機と目的

  • eコマースにおけるマルチラベル商品分類の性能を、複数のデータモダリティを活用することで向上させること。
  • 情報が曖昧または不完全な場合に限界を示す単一モダリティ手法の課題を解決すること。
  • 画像、見出し、説明分類器からの予測を統合するラテン統合の有効性を評価すること。
  • 多様な商品カテゴリにおいて誤分類を低減する上で、どのモダリティが最も寄与しているかを特定すること。
  • 大規模eコマースシステムにおけるスケーラブルで正確かつ自動化された商品タグ付けのためのマルチモーダル統合の可能性を検討すること。

提案手法

  • 各モダリティごとに個別のディープラーニングモデルを訓練した:画像にはResNet-50を基盤とするCNNモデル、見出しと説明には変更を加えたCNNモデルを用いた。
  • ラテン統合は、画像、見出し、説明分類器の出力確率をポリシーネットワークを通じて統合することで実現した。
  • ポリシーネットワークは、画像、見出し、説明分類器からの予測を統合するために、シグモイド関数と双曲正弦関数を用いた3層の全結合層を採用した。
  • 統合戦略には、二重組み合わせ(画像-説明、画像-見出し、見出し-説明)と完全な三モダリティ統合が含まれた。
  • 融合ネットワークのアーキテクチャおよび活性化関数を最適化するためにハイパーパramータチューニングを実施した。
  • フラット化およびフィルタリングを施したラベル階層を用いて、マルチラベル割り当てを処理した。各商品は複数のクラスに属する可能性があった。

実験結果

リサーチクエスチョン

  • RQ1画像、見出し、説明モダリティをラテン統合によって統合することで、単一モダリティモデルと比較してマルチラベル商品分類性能が向上するか?
  • RQ2個々のモダリティ(画像、見出し、説明)は分類精度にどのように異なる寄与をしているのか。また、それらは互いに補完的であるか?
  • RQ3F₁スコアおよび誤分類の低減という観点から、三モダリティ統合は二モダリティ統合を上回るか?
  • RQ4マルチモーダル統合後でも依然として困難な商品カテゴリは何か。その理由は何か?
  • RQ5学習された融合ポリシーは、ヒューリスティックな統合ルールを上回る性能を示すか?

主な発見

  • 三モダリティラテン統合モデルはF₁スコア88.2%を達成し、最良の単一モダリティ分類器(見出し:82.7%)およびすべての二モダリティ統合を著しく上回った。
  • 画像分類器単体ではF₁スコアが最も低く(61.0%)あり、視覚的特徴のみでは複雑な商品分類に不十分であることが示された。
  • 見出し分類器は説明分類器(82.7% 対 77.0%)を上回った。これは、見出しが分類に向けたより特徴的な情報を含んでいることを示唆している。
  • 見出し-説明統合が最高の二モダリティF₁スコア(87.0%)を記録し、テクスチャルモダリティ間の強い相乗効果が確認された。
  • 三モダリティモデルは、最良の単一モダリティモデルと比較して誤分類商品数を5.5%削減し、最良の二モダリティ統合と比較しても1.2%削減した。
  • チュー・トイ、アクセサリー、ホースなどのカテゴリは依然として高頻度に誤分類されており、細分化されたまたは曖昧な商品カテゴリに一貫した課題が残っていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。