Skip to main content
QUICK REVIEW

[논문 리뷰] Large Scale Product Categorization using Structured and Unstructured Attributes

Abhinandan Krishnan, Abilash Amarthaluri|arXiv (Cornell University)|2019. 03. 01.
Text and Document Classification Technologies인용 수 4
한 줄 요약

이 논문은 구조화된 및 비구조화된 제품 속성을 단일 텍스트 유사 표현으로 통합함으로써 대규모 제품 분류를 위한 딥러닝 접근법을 제안한다. 이는 컨볼루션 신경망의 효과적 사용을 가능하게 하며, 6,000개 클래스로 구성된 분류 체계에서 정확도를 2.7% 향상시켰다. 특히 탱크 탑 및 오피스 박스와 같은 세분화된 제품 유형에서 뚜렷한 성능 향상이 있었다.

ABSTRACT

Product categorization using text data for eCommerce is a very challenging extreme classification problem with several thousands of classes and several millions of products to classify. Even though multi-class text classification is a well studied problem both in academia and industry, most approaches either deal with treating product content as a single pile of text, or only consider a few product attributes for modelling purposes. Given the variety of products sold on popular eCommerce platforms, it is hard to consider all available product attributes as part of the modeling exercise, considering that products possess their own unique set of attributes based on category. In this paper, we compare hierarchical models to flat models and show that in specific cases, flat models perform better. We explore two Deep Learning based models that extract features from individual pieces of unstructured data from each product and then combine them to create a product signature. We also propose a novel idea of using structured attributes and their values together in an unstructured fashion along with convolutional filters such that the ordering of the attributes and the differing attributes by product categories no longer becomes a modelling challenge. This approach is also more robust to the presence of faulty product attribute names and values and can elegantly generalize to use both closed list and open list attributes.

연구 동기 및 목표

  • 수천 개의 클래스와 수백만 개의 제품을 포함하는 동적인 이커머스 환경에서 극단적인 다중 클래스 제품 분류 문제를 해결한다.
  • 기존 모델이 제품 데이터를 단일 텍스트 블록으로만 취급하거나 구조화된 속성을 忽略하는 한계를 극복한다.
  • 구조화된 속성과 그 값들을 비구조화된 텍스트로 간주하여 통합된 표현을 개발함으로써 다양한 제품 카테고리에 걸쳐 강력한 일반화 능력을 확보한다.
  • 컨볼루션 필터를 활용하여 구조화된 속성의 존재 여부와 값의 의미를 효과적으로 활용함으로써 모델 성능을 향상시킨다.
  • 평탄한 딥러닝 모델이 특정 경우, 특히 통합된 속성 표현을 사용할 때 계층적 모델보다 우수한 성능을 보임을 입증한다.

제안 방법

  • 구조화된 속성(예: 'sleeve_style: tank')을 구분자 토큰을 사용해 속성명과 값의 조합으로 하나의 문자열로 표현한다.
  • 통합된 텍스트 표현을 Multi-CNN 또는 Multi-LSTM 모델에 입력하여 비구조화된 및 구조화된 속성에서 동시에 깊이 있는 특징을 추출한다.
  • 각 비구조화된 속성(예: 제목, 설명)에 대해 별도의 워드 임베딩 공간을 사용하여 도메인 특화된 의미를 포착한다.
  • 구조화된 속성 문자열에 1D 컨볼루션 필터를 적용하여 속성 존재 여부 및 값 의미와 관련된 패턴을 추출한다.
  • 생산용 마이크로서비스 배포 환경에서 GPU 활용도를 최적화하고 추론 지연을 줄이기 위해 마이크로배치와 Redis 버퍼를 활용한다.
  • 계층적 샘플링과 사전 정제를 암묵적 정규화 방법으로 활용하여 일반화 능력을 향상시키며, 특히 저지지 클래스에 대해 유의미한 개선을 이룬다.

실험 결과

연구 질문

  • RQ1구조화된 및 비구조화된 제품 속성을 통합한 표현 방식이 극단적인 다중 클래스 제품 분류에서 정확도 향상에 기여하는가?
  • RQ2속성명과 값 사이에 구분자 토큰을 사용해 하나의 텍스트 문자열로 통합할 경우, 다양한 속성 세트를 가진 제품 카테고리 간의 일반화 능력 향상이 가능한가?
  • RQ3평탄한 딥러닝 모델과 계층적 모델 간의 성능을 비교했을 때, 대규모 제품 분류 작업에서 어떤 모델이 더 우수한 성능을 보이는가?
  • RQ4컨볼루션 필터가 특정 속성의 존재 여부와 값의 의미적 의미를 얼마나 효과적으로 포착하는가?
  • RQ5공유 임베딩 공간 대비 각 속성별 별도의 워드 임베딩을 사용할 경우, 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 평가 세트에서 기준 모델 대비 전체 F1 스코어를 2.7% 향상시켰으며, 6,000개 클래스 분류 문제에서 뚜렷한 성과 향상이 있었다.
  • Multi-CNN 모델은 Multi-LSTM 모델과 유사한 성능를 보였지만, 더 나은 병렬 처리 능력을 지녀 학습 및 추론 속도에서 유리했다.
  • 구조화된 속성이 가장 크게 기여한 상위 5개 제품 유형은 탱크 탑(+0.365 F1 향상), 화학 실험 키트(+0.317), 오피스 박스(+0.257), 실외 깃발 및 배너(+0.249), 모양 분류 장난감(+0.241)이었다.
  • 속성명과 값 사이에 구분자 토큰을 사용하는 것이 모델 성능 향상에 크게 기여했으며, 잘못된 상호작용 주의를 방지했다.
  • 50차원의 워드 임베딩이 200차원 임베딩과 거의 유사한 성능를 보였으며, 적절한 정규화를 통해 작은 임베딩이 효과적일 수 있음을 시사했다.
  • 각 속성별로 단어 사전을 정제하는 것이 암묵적 정규화 역할을 하며, 특히 저지지 클래스에서 성능 향상에 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.