Skip to main content
QUICK REVIEW

[論文レビュー] Large Scale Product Categorization using Structured and Unstructured Attributes

Abhinandan Krishnan, Abilash Amarthaluri|arXiv (Cornell University)|Mar 1, 2019
Text and Document Classification Technologies被引用数 4
ひとこと要約

本論文は、構造化済み属性と非構造化属性を1つのテキストに統合することで、大規模製品分類のためのディープラーニング手法を提案する。この手法により、畳み込みニューラルネットワークの有効な利用が可能となり、6,000クラスの分類タクソノミーにおいて分類精度が2.7%向上した。特にタンクトップやオフィスボックスといったニッチ製品タイプにおいて顕著な向上が見られた。

ABSTRACT

Product categorization using text data for eCommerce is a very challenging extreme classification problem with several thousands of classes and several millions of products to classify. Even though multi-class text classification is a well studied problem both in academia and industry, most approaches either deal with treating product content as a single pile of text, or only consider a few product attributes for modelling purposes. Given the variety of products sold on popular eCommerce platforms, it is hard to consider all available product attributes as part of the modeling exercise, considering that products possess their own unique set of attributes based on category. In this paper, we compare hierarchical models to flat models and show that in specific cases, flat models perform better. We explore two Deep Learning based models that extract features from individual pieces of unstructured data from each product and then combine them to create a product signature. We also propose a novel idea of using structured attributes and their values together in an unstructured fashion along with convolutional filters such that the ordering of the attributes and the differing attributes by product categories no longer becomes a modelling challenge. This approach is also more robust to the presence of faulty product attribute names and values and can elegantly generalize to use both closed list and open list attributes.

研究の動機と目的

  • 数千のクラスと数百万の製品を含む動的で変化しやすいEC環境における極めて多数クラスの製品分類の課題に対処すること。
  • 製品データを1つのテキストブロックとして扱うか、構造化属性を無視する伝統的なモデルの限界を克服すること。
  • 構造化属性とその値を非構造化テキストとして扱うことで、多様な製品カテゴリにわたる強力な一般化を可能にする統一表現を開発すること。
  • 畳み込みフィルタを用いて、構造化属性の存在とその値の意味的特徴を効果的に活用することで、モデルの性能を向上させること。
  • 平坦なディープラーニングモデルが、特に統一された属性表現を用いる場合、特定の状況において階層モデルを上回ることを実証すること。

提案手法

  • 属性名と値をセパレータトークンで連結することで、各製品の構造化属性(例:'sleeve_style: tank')を1つの文字列に変換する。
  • 統合されたテキスト表現をMulti-CNNまたはMulti-LSTMモデルに供給し、非構造化属性と構造化属性の両方から深層特徴を同時に抽出する。
  • 各非構造化属性(例:タイトル、説明)に対して個別の単語埋め込み空間を用い、ドメイン固有の意味を捉える。
  • 構造化属性文字列を連結して1次元畳み込みフィルタを適用し、属性の存在と値の意味的特徴に関連するパターンを抽出する。
  • GPUの利用効率を向上させるとともに、プロダクションマイクロサービスデプロイメントにおける推論遅延を低減するため、マイクロバッチ処理とRedisバッファを採用する。
  • ストラティファイドサンプリングと辞書のプルーニングを、特に低サポートクラスにおいて一般化性能を向上させる暗黙の正則化として用いる。

実験結果

リサーチクエスチョン

  • RQ1構造化済み属性と非構造化属性の統一表現が、極めて多数クラスの製品分類において分類精度を向上させることができるか?
  • RQ2属性名と値をセパレータで連結した1つのテキスト文字列に統合することで、属性セットが異なる製品カテゴリ間での一般化性能が向上するか?
  • RQ3平坦なディープラーニングモデルと階層モデルの間で、大規模製品分類タスクにおける性能にどのような差が生じるか?
  • RQ4畳み込みフィルタが、特定の属性の存在とその値の意味的意味を効果的に捉えられるか?
  • RQ5各属性ごとに別々の単語埋め込みを用いることで、共有埋め込み空間と比較してモデル性能にどのような影響を与えるか?

主な発見

  • 提案手法は、ベースラインモデルと比較して、評価セットにおける全体のF1スコアを2.7%向上させた。これは6,000クラス分類問題において顕著な向上である。
  • Multi-CNNモデルはMulti-LSTMモデルと同等の性能を達成したが、並列処理がより効率的であり、学習および推論の両方で高速であった。
  • 構造化属性の恩恵を最も受けた上位5つの製品タイプは、タンクトップ(+0.365 F1スコア向上)、化学実験キット(+0.317)、オフィスボックス(+0.257)、屋外の旗・看板(+0.249)、形状分類おもちゃ(+0.241)であった。
  • 属性名と値の間にセパレータトークンを用いることで、誤った属性間注意を防ぎ、モデル性能が顕著に向上した。
  • 50次元の単語埋め込みでさえ、200次元の埋め込みとほぼ同等の性能を示した。これは、適切な正則化を施せば、より小さな埋め込みでも有効である可能性を示唆している。
  • 各属性ごとの語彙辞書を短縮することは、暗黙の正則化として機能し、特に低サポートクラスにおいて性能向上をもたらした場合がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。