Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Label Product Categorization Using Multi-Modal Fusion Models

Pasawee Wirojwatanakul, Artit Wangperawong|arXiv (Cornell University)|2019. 06. 30.
Text and Document Classification Technologies참고 문헌 15인용 수 11
한 줄 요약

이 논문은 아마존에서의 다중 레이블 제품 분류 성능을 향상시키기 위해 이미지, 제목, 설명 특징을 결합하는 후기 융합 다중 모odal 딥 러닝 모델을 제안한다. 각 모odal에 대한 개별 분류기를 세 층으로 구성된 신경망 정책을 통해 융합함으로써, 이 방법은 F₁ 스코어 88.2%를 달성하여 단일 모달 모델과 双모달 융합 모델을 크게 앞서며, 상보적인 모달이 분류 성능을 향상시킨다는 것을 입증한다.

ABSTRACT

In this study, we investigated multi-modal approaches using images, descriptions, and titles to categorize e-commerce products on Amazon. Specifically, we examined late fusion models, where the modalities are fused at the decision level. Products were each assigned multiple labels, and the hierarchy in the labels were flattened and filtered. For our individual baseline models, we modified a CNN architecture to classify the description and title, and then modified Keras' ResNet-50 to classify the images, achieving $F_1$ scores of 77.0%, 82.7%, and 61.0%, respectively. In comparison, our tri-modal late fusion model can classify products more effectively than single modal models can, improving the $F_1$ score to 88.2%. Each modality complemented the shortcomings of the other modalities, demonstrating that increasing the number of modalities can be an effective method for improving the performance of multi-label classification problems.

연구 동기 및 목표

  • 다양한 데이터 모달을 활용하여 전자상거래에서 다중 레이블 제품 분류 성능을 향상시키기 위해.
  • 모호하거나 불완전한 제품 정보를 다루는 데에 한계가 있는 단일 모달 접근 방식의 문제점을 해결하기 위해.
  • 이미지, 제목, 설명 분류기의 예측을 융합하는 후기 융합의 효과성을 평가하기 위해.
  • 다양한 제품 카테고리에서 오분류를 줄이는 데에 가장 기여하는 모달을 특정하기 위해.
  • 대규모 전자상거래 시스템에서 확장 가능하고 정확하며 자동화된 제품 태깅을 위한 다중 모달 융합의 잠재력을 탐색하기 위해.

제안 방법

  • 이미지(ResNet-50 기반)와 제목, 설명에 대해 각각 개별 딥 러닝 모델을 훈련시켰다.
  • 후기 융합은 세 개의 개별 분류기의 출력 확률을 정책 네트워크를 통해 융합함으로써 적용되었다.
  • 정책 네트워크는 이미지, 제목, 설명 분류기의 예측을 융합하기 위해 시그모이드 및 하이퍼볼릭 탄젠트 활성화 함수를 사용한 세 개의 완전 연결 층을 사용했다.
  • 융합 전략으로는 이중 조합(이미지-설명, 이미지-제목, 제목-설명)과 전체 삼중 모달 융합이 포함되었다.
  • 융합 네트워크의 아키텍처와 활성화 함수를 최적화하기 위해 초모수 튜닝을 수행했다.
  • 플랫팅되고 필터링된 레이블 계층을 사용하여 다중 레이블 할당을 처리하였으며, 각 제품은 다수의 클래스에 속할 수 있었다.

실험 결과

연구 질문

  • RQ1이미지, 제목, 설명 모달을 후기 융합을 통해 융합함으로써 단일 모달 모델에 비해 다중 레이블 제품 분류 성능을 향상시킬 수 있는가?
  • RQ2개별 모달(이미지, 제목, 설명)은 분류 정확도에 어떻게 다르게 기여하며, 상호 보완적인가?
  • RQ3F₁ 스코어와 오분류 감소 측면에서 삼중 모달 융합이 双모달 융합을 능가하는가?
  • RQ4다중 모달 융합 이후에도 여전히 도전적인 제품 카테고리는 무엇이며, 그 이유는 무엇인가?
  • RQ5학습된 융합 정책이 다중 모달 제품 분류에서 수동 융합 규칙을 능가할 수 있는가?

주요 결과

  • 삼중 모달 후기 융합 모델은 F₁ 스코어 88.2%를 달성하여 가장 우수한 단일 모달 분류기(제목: 82.7%)와 모든 双모달 융합을 크게 앞섰다.
  • 이미지 분류기 자체는 가장 낮은 F₁ 스코어(61.0%)를 기록하여, 시각적 특징만으로는 복잡한 제품 분류에 부족하다는 것을 시사한다.
  • 제목 분류기가 설명 분류기보다 성능이 뛰어나(82.7% 대비 77.0%), 제목에 분류에 더 유용한 정보가 포함되어 있음을 시사한다.
  • 제목-설명 융합은 가장 높은 双모달 F₁ 스코어(87.0%)를 기록하여, 텍스트 모달 간의 강력한 상호보완성이 있음을 보여준다.
  • 삼중 모달 모델은 가장 우수한 단일 모달 모델 대비 5.5%의 오분류 제품 수 감소를 기록했으며, 가장 우수한 双모달 융합 대비 1.2% 감소를 기록했다.
  • 츄잉 토이, 액세서리, 말 등의 카테고리는 여전히 높은 오분류율을 보이며, 미세한 분류나 모호한 제품 카테고리에서 지속적인 과제가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.