Skip to main content
QUICK REVIEW

[論文レビュー] Atlas: A Dataset and Benchmark for E-commerce Clothing Product Categorization

Venkatesh Umaashankar, Girish Shanmugam S|arXiv (Cornell University)|Aug 12, 2019
Advanced Image and Video Retrieval Techniques参考文献 23被引用数 10
ひとこと要約

本稿では、186,150枚のeコマース衣料品画像を含み、52のリーフノードにわたる階層的カテゴリーパathを持つ大規模かつ高品質なデータセットAtlasを紹介する。画像分類およびアテンションベースのシーケンス・ツー・シーケンスモデルを用いてベンチマークを確立し、テストセットでマイクロFスコア0.92を達成した。本研究では、データセット、コード、事前学習済みモデルを公開し、自動製品分類分野の研究を前進させる。

ABSTRACT

In E-commerce, it is a common practice to organize the product catalog using product taxonomy. This enables the buyer to easily locate the item they are looking for and also to explore various items available under a category. Product taxonomy is a tree structure with 3 or more levels of depth and several leaf nodes. Product categorization is a large scale classification task that assigns a category path to a particular product. Research in this area is restricted by the unavailability of good real-world datasets and the variations in taxonomy due to the absence of a standard across the different e-commerce stores. In this paper, we introduce a high-quality product taxonomy dataset focusing on clothing products which contain 186,150 images under clothing category with 3 levels and 52 leaf nodes in the taxonomy. We explain the methodology used to collect and label this dataset. Further, we establish the benchmark by comparing image classification and Attention based Sequence models for predicting the category path. Our benchmark model reaches a micro f-score of 0.92 on the test set. The dataset, code and pre-trained models are publicly available at \url{https://github.com/vumaasha/atlas}. We invite the community to improve upon these baselines.

研究の動機と目的

  • eコマース製品分類において、標準化された実世界のデータセットが不足している問題に対処すること、特に衣料品分野に特化して。
  • 大規模な製品タクソノミーデータを収集・ラベリングするスケーラブルで高品質な手法を構築すること。
  • 深層学習モデルを用いた階層的製品分類の再現可能なベンチマークを確立すること。
  • 人的作業を削減し、eコマースのカタログ品質を向上させる自動的かつスケーラブルな製品分類を実現すること。
  • データセット、コード、事前学習済みモデルをオープンソース化することで、コミュニティ主導の研究を促進すること。

提案手法

  • 実際のeコマース製品データを用いて、3段階の衣料品製品タクソノミーを構築し、52のリーフカテゴリを設定した。
  • 製品タイトルと対応する画像186,150枚を収集し、洗練されたラベリングパイプラインを用いてカテゴリーパスにマッピングした。
  • カテゴリカル・クロスエントロピー損失とワンサイクル学習率スケジューリングを用いて、ResNet34ベースの画像分類モデルを訓練した。
  • 画像特徴から階層的パスを予測する目的で、ビームサーチとドロップアウトを備えたアテンションベースのシーケンス・ツー・シーケンスモデルを構築した。
  • 訓練の安定性を向上させるとともに過学習を防ぐために、エアリー・ストッピングと勾配クリッピングを適用した。
  • クラスの代表が偏らないよう、ストラティファイドなトレイン/バリエーション/テスト分割(65%/5%/30%)を用いてモデルを評価した。

実験結果

リサーチクエスチョン

  • RQ1実世界のeコマース衣料品データを用いて、一貫性のあるタクソノミーラベリングが可能な大規模なデータセットを体系的に構築できるか?
  • RQ2画像分類モデルとシーケンス・ツー・シーケンスモデルは、画像から多段階の製品カテゴリーパスを予測する際に、どのように性能を発揮するか?
  • RQ3アテンションベースのシーケンスモデルは、学習データに存在しない新しい有効で意味のあるカテゴリーパスをどの程度生成できるか?
  • RQ4視覚的およびテキスト的特徴を用いた深層学習モデルの階層的製品分類における性能の上限はどこか?
  • RQ5モデルの解釈可能性とタクソノミー構造を活用することで、生成されたカテゴリーパスの妥当性をどのように向上させられるか?

主な発見

  • ResNet34ベースの画像分類モデルは、テストセットでマイクロFスコア0.92を達成し、最良のパフォーマンスを示したベンチマークとなった。
  • アテンションベースのシーケンス・ツー・シーケンスモデルはマイクロFスコア0.90を達成し、分類モデルより精度は低かったが、強力な性能を示した。
  • シーケンス・ツー・シーケンスモデルは5つの新しいカテゴリーパスを生成したが、そのうち有効なのは2つにとどまり、デコード段階での構造的制約の必要性が示された。
  • 分類モデルがシーケンス・ツー・シーケンスモデルを上回ったのは、リーフカテゴリ数が比較的少ない(52)ためであり、タクソノミーがより大きくなるとシーケンスモデルのスケーラビリティが優れている可能性がある。
  • データセット、コード、事前学習済みモデルはhttps://github.com/vumaasha/atlasにて公開されており、再現可能な研究およびコミュニティによる拡張を支援する。
  • シーケンスモデルが生成する無効なカテゴリーパスをフィルタリングするには、手動での検査が不可欠であり、現在の生成アプローチの限界を浮き彫りにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。