Skip to main content
QUICK REVIEW

[논문 리뷰] A Multimodal Late Fusion Model for E-Commerce Product Classification

Ye Bi, Shuo Wang|arXiv (Cornell University)|2020. 08. 14.
Text and Document Classification Technologies참고 문헌 11인용 수 12
한 줄 요약

이 논문은 프랑스어 텍스트에 CamemBERT를, 이미지에 ResNet 기반 분류기를 사용하여 전자상거래 제품 분류를 위한 다중모달 후기 융합 모델을 제안한다. 결정 수준 융합은 얕은 신경망을 통해 이루어지며, SIGIR 2020 전자상거래 워크숍 도전 대회에서 매크로-F1 스코어 91.44를 기록하여 1등을 차지했다.

ABSTRACT

The cataloging of product listings is a fundamental problem for most e-commerce platforms. Despite promising results obtained by unimodal-based methods, it can be expected that their performance can be further boosted by the consideration of multimodal product information. In this study, we investigated a multimodal late fusion approach based on text and image modalities to categorize e-commerce products on Rakuten. Specifically, we developed modal specific state-of-the-art deep neural networks for each input modal, and then fused them at the decision level. Experimental results on Multimodal Product Classification Task of SIGIR 2020 E-Commerce Workshop Data Challenge demonstrate the superiority and effectiveness of our proposed method compared with unimodal and other multimodal methods. Our team named pa_curis won the 1st place with a macro-F1 of 0.9144 on the final leaderboard.

연구 동기 및 목표

  • 다중모달 데이터를 활용하여 대규모이자 불균형적이며 노이즈가 많은 전자상거래 제품 분류 문제를 해결하기 위해.
  • 텍스트와 이미지 모달을 융합하여 단일모달 접근 방식을 초월한 분류 성능 향상을 위해.
  • 실제 전자상거래 환경에서 특징 수준 융합과 결정 수준 융합 전략을 평가하고 비교하기 위해.
  • SIGIR 2020 전자상거래 워크숍 데이터 도전 대회에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 제품 제목과 설명에 대해 프랑스어 텍스트 표현을 위해 CamemBERT-base 및 CamemBERT-large를 사용하고, 미세조정을 수행하였다.
  • 제품 이미지에 대해 데이터 노이즈 제거와 DCL(분산형 대비 학습)를 적용한 ResNet 기반 이미지 분류기를 사용하여 개선된 특징 학습을 구현하였다.
  • 이중 단계 결정 수준 융합 전략을 구현: 먼저 각 모달 전용 분류기를 훈련한 후, 각 모달의 클래스 확률을 기반으로 얕은 신경망을 훈련하였다.
  • 다양한 구성(텍스트, 이미지, 융합 모델)을 가진 12개의 모델을 다수결 투표 방식으로 조합하여 앙상블 학습을 적용하였다.
  • 융합 정책 훈련을 위해 8겹 교차 검증을 사용하였으며, 매크로-F1 스코어 기반으로 최고 성능 체크포인트를 선택하였다.
  • 훈련 데이터 품질 향상을 위해 cleanlab의 확률적 레이블링을 적용하여 노이즈 감소를 구현하였다.

실험 결과

연구 질문

  • RQ1다중모달 전자상거래 제품 분류에서 결정 수준 융합이 특징 수준 융합보다 우월한가?
  • RQ2최신 기술 수준의 프랑스어 NLP 모델과 딥 이미지 분류기를 조합하면, 대규모이자 불균형적인 제품 데이터셋에서 분류 정확도를 향상시킬 수 있는가?
  • RQ3실제 전자상거래 환경에서 모달 전용 분류기를 사용한 후기 융합 방식이 단일모달 기반 모델에 비해 얼마나 효과적인가?
  • RQ4모델 앙상블이 다중모달 제품 분류에서 성능 향상에 얼마나 기여하는가?

주요 결과

  • 결정 수준 융합 모델은 테스트 세트의 1단계에서 매크로-F1 스코어 90.94, 2단계에서 90.17을 기록하여 단일모달 및 특징 수준 융합 기반 모델을 모두 압도했다.
  • 최종 앙상블 모델은 최종 랭킹에서 매크로-F1 스코어 91.44를 기록하여 SIGIR 2020 전자상거래 워크숍 데이터 도전 대회에서 1등을 차지했다.
  • 단일모달 텍스트 분류기만으로도 매크로-F1 89.93을 기록하여 뛰어난 성능를 보였지만, 다중모달 융합 모델에 의해 뛰어넘어졌다.
  • 특징 수준 융합 방법은 결정 수준 융합에 비해 열등한 결과를 보였으며, 이는 후기 융합이 모달 전용 표현을 더 잘 유지함을 시사한다.
  • 다양한 백본, 학습률, 데이터 노이즈 제거 방법, 융합 아키텍처를 가진 12개의 다양한 구성으로 이루어진 모델 앙상블은 일관된 성능 향상을 이끌어냈다.
  • cleanlab를 통한 노이즈 감소 적용으로 모델 일반화 능력이 향상되었으며, 특히 극도로 불균형한 카테고리 분포 상황에서 두드러진 효과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.