[논문 리뷰] Multi-Modal Generative Adversarial Network for Short Product Title Generation in Mobile E-Commerce
이 논문은 텍스트, 시각적 정보 및 속성 정보를 통합하여 모바일 전자상거래를 위한 간결하고 인간처럼 보이는 제품 제목을 생성하는 다중모달 생성적 적대적 네트워크인 MM-GAN을 제안한다. 인간처럼 출력물을 평가하는 디스criminator를 갖춘 강화학습 작업으로서 제목 생성을 설정함으로써, MM-GAN은 최신 기술을 초월하여 실세계 A/B 테스트에서 클릭률을 1.66% 향상시키고 클릭 전환률을 1.87% 향상시켰다.
Nowadays, more and more customers browse and purchase products in favor of using mobile E-Commerce Apps such as Taobao and Amazon. Since merchants are usually inclined to describe redundant and over-informative product titles to attract attentions from customers, it is important to concisely display short product titles on limited screen of mobile phones. To address this discrepancy, previous studies mainly consider textual information of long product titles and lacks of human-like view during training and evaluation process. In this paper, we propose a Multi-Modal Generative Adversarial Network (MM-GAN) for short product title generation in E-Commerce, which innovatively incorporates image information and attribute tags from product, as well as textual information from original long titles. MM-GAN poses short title generation as a reinforcement learning process, where the generated titles are evaluated by the discriminator in a human-like view. Extensive experiments on a large-scale E-Commerce dataset demonstrate that our algorithm outperforms other state-of-the-art methods. Moreover, we deploy our model into a real-world online E-Commerce environment and effectively boost the performance of click through rate and click conversion rate by 1.66% and 1.87%, respectively.
연구 동기 및 목표
- 제한된 화면 공간을 가진 모바일 전자상거래 앱에서 간결하고 정보적인 제품 제목을 생성하는 데 도전하는 것.
- 노출 편향을 앓고 종합적 평가가 부족한 텍스트 중심 모델의 한계를 극복하는 것.
- 텍스트, 제품 이미지 및 속성 태그와 같은 다중모달 입력을 통합하여 개선된 제목 품질을 위한 통합 생성 프레임워크에 통합하는 것.
- 모델을 실세계 온라인 환경에서 평가하고 CTR 및 CVR과 같은 핵심 비즈니스 지표에 미치는 영향을 검증하는 것.
제안 방법
- MM-GAN은 장제목, 제품 이미지의 시각적 특징, 속성 태그를 입력으로 사용하여 짧은 제품 제목을 생성하는 생성자(generator)를 사용한다.
- 생성자는 강화학습을 통해 훈련되며, 보상 신호로는 생성된 제목이 인간이 작성한 것인지 기계가 생성한 것인지 평가하는 디스criminator에서 온다.
- 디스criminator는 실제 인간이 작성한 제목과 기계가 생성한 제목을 구분하도록 훈련되어 생성자가 인간처럼 유창하고 일관성 있는 표현을 학습하도록 한다.
- 시각적 특징은 합성곱 신경망(CNN)을 사용해 추출되며, 텍스트 및 속성 특징은 심층 신경망을 통해 인코딩된다.
- 모델은 어텐션 메커니즘을 갖춘 시퀀스-투-시퀀스 아키텍처를 사용하여 자연스럽고 정보가 풍부한 짧은 제목을 생성한다.
- 훈련 과정에서 MLE를 사용해 토큰을 순차적으로 예측하는 방식을 피하고 전체 시퀀스를 평가함으로써 노출 편향을 방지한다.
실험 결과
연구 질문
- RQ1텍스트, 이미지, 속성 정보를 포함한 다중모달 입력은 텍스트 중심 모델에 비해 짧은 제품 제목 생성 품질을 향상시키는가?
- RQ2인간처럼 행동하는 디스criminator를 갖춘 강화학습 작업으로서 제목 생성을 설정하면 노출 편향을 줄이고 유창성 및 정보성 향상을 이룰 수 있는가?
- RQ3시각적 및 속성 정보의 통합이 장제목에서 부적절하거나 중복된 단어를 걸러내는 데 어떻게 기여하는가?
- RQ4제안된 모델이 실세계 전자상거래 지표인 클릭률 및 클릭 전환률을 얼마나 향상시키는가?
주요 결과
- MM-GAN은 타오바오 앱에서 실세계 A/B 테스트에서 기준 시스템 대비 클릭률(CTR)이 1.66% 향상되었다.
- 동일한 A/B 테스트에서 모델은 클릭 전환률(CVR)을 1.87% 향상시켜 사용자 참여도 및 구매 의도 향상을 시사했다.
- 정성적 분석 결과, MM-GAN이 생성한 제목은 더 유창하고 정보가 풍부했으며 'Artka'와 '레트로'와 같은 핵심 제품 속성을 정확히 반영했다.
- MM-GAN은 FE-Net 및 Agree-MTL과 같은 기준 모델보다 장제목에서 과도하게 정보가 많은 또는 관련 없는 용어를 올바르게 걸러내는 데 뛰어났다.
- 여러 다양한 제품 카테고리(여성의류, 남성의류 포함)에서 뛰어난 내구성을 보이며 광범위한 적용 가능성을 입증했다.
- 강력한 성능에도 불구하고 일부 생성된 제목은 반복적이거나 관련 없는 단어를 포함하고 있어 향후 개선 여지가 있음을 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.