Skip to main content
QUICK REVIEW

[論文レビュー] Don't Classify, Translate: Multi-Level E-Commerce Product Categorization Via Machine Translation

Maggie Yundi Li, Stanley Kok|arXiv (Cornell University)|Dec 14, 2018
Text and Document Classification Technologies参考文献 32被引用数 10
ひとこと要約

本稿では、商品説明をルートからリーフまでの分類ツリー経路に翻訳するというマシン翻訳(MT)ベースの新規アプローチを提案し、多段階の電子商取引向け商品分類を実現する。この手法は、最先端の分類モデルを上回り、新たな意味のあるカテゴリーパスを生成する。分類ツリーを有向無閉路グラフ(DAG)に変換することで、製品の人的な概念的理解をよりよく反映するようになる。

ABSTRACT

E-commerce platforms categorize their products into a multi-level taxonomy tree with thousands of leaf categories. Conventional methods for product categorization are typically based on machine learning classification algorithms. These algorithms take product information as input (e.g., titles and descriptions) to classify a product into a leaf category. In this paper, we propose a new paradigm based on machine translation. In our approach, we translate a product's natural language description into a sequence of tokens representing a root-to-leaf path in a product taxonomy. In our experiments on two large real-world datasets, we show that our approach achieves better predictive accuracy than a state-of-the-art classification system for product categorization. In addition, we demonstrate that our machine translation models can propose meaningful new paths between previously unconnected nodes in a taxonomy tree, thereby transforming the taxonomy into a directed acyclic graph (DAG). We discuss how the resultant taxonomy DAG promotes user-friendly navigation, and how it is more adaptable to new products.

研究の動機と目的

  • 大規模な電子商取引プラットフォームにおける従来の分類ベースの商品分類の限界を是正すること。
  • 最先端のニューラルマシン翻訳(NMT)モデルを用いて、商品分類の予測正確性と頑健性を向上させること。
  • 元のツリー構造を超えて、新たな意味のあるルートからリーフまでのカテゴリーパスを生成可能にする。
  • 有向無閉路グラフ(DAG)に変換することで、分類ツリーを再構築し、ユーザーのナビゲーション性と適応性を向上させること。
  • グローバル電子商取引プラットフォームで既存のMTインfraを活用し、技術的負債と保守コストを削減すること。

提案手法

  • 本手法は、商品のテキスト記述(例:タイトルや説明文)を、分類ツリー内のルートからリーフまでのパスを表すカテゴリーターゲットの系列にマッピングする。
  • Seq2SeqアーキテクチャにTransformerエンコーダ・デコーダを組み合わせたニューラルマシン翻訳(NMT)モデルを採用し、商品テキストからカテゴリーシーケンスへのマッピングを学習する。
  • 実世界の電子商取引データセット上でエンドツーエンドに訓練され、妥当で整合性のあるカテゴリーパスの生成を学習する。
  • システムは、元の分類ツリーに存在しないパスを越えて一般化可能であり、新たなルートからリーフまでのパスの生成を可能にする。
  • 現代のNMTの頑健性を活用し、商品説明における言語的ばらつきやノイズに対しても耐性を持つ。
  • 得られたパスは、正解データとの比較および意味的整合性と構造的新規性の分析を通じて検証される。

実験結果

リサーチクエスチョン

  • RQ1マシン翻訳フレームワークは、従来の分類モデルに比べて、多段階電子商取引商品分類において優れているか?
  • RQ2NMTモデルは、元の分類ツリーに存在しない、新たな意味のあるルートからリーフまでのカテゴリーパスをどの程度生成できるか?
  • RQ3本手法は、分類モデルと比較して、商品説明における言語的ばらつきやノイズをどの程度効果的に処理できるか?
  • RQ4新規パスの生成が、製品分類ツリーの構造的特性と実用性に与える影響は何か?
  • RQ5従来の分類システムと比較して、NMTベースのアプローチはデータが少ない状況下でもどの程度頑健か?

主な発見

  • 提案されたSeq2Seq+Transformerアンサンブルは、80-10-10および60-10-30のデータ分割構成を含む、すべてのデータ分割設定において最先端のDBN+KNN分類モデルを上回る性能を示した。
  • NMTベースのモデルは、学習データの20%のみでさえも、Fスコアを高い水準で維持しており、データ不足に対する優れた頑健性を示した。
  • モデルは意味的に整合性のある新たなルートからリーフまでのパスを生成し、例として「プリンタ」を「オフィス用品」の下に配置することで、より直感的な分類を反映した。
  • システムは誤ったカテゴリを効果的に除外し、例として「楽譜」に対して「楽器」を省略することで、より正確なパス予測を実現した。
  • NMTモデルは、訓練データからの強い構造的事前知識に従い、トップレベルカテゴリから始まり、リーフノードで終わるパスを生成するよう学習した。
  • RDCデータセットでは124の新規フルパスカテゴリ、Ichibaデータセットでは48,455の新規フルパスカテゴリが生成され、分類ツリーが木構造から有向無閉路グラフ(DAG)に変換された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。