Skip to main content
QUICK REVIEW

[논문 리뷰] A Multi-task Learning Approach for Improving Product Title Compression with User Search Log Data

Jingang Wang, Junfeng Tian|arXiv (Cornell University)|2018. 01. 05.
Topic Modeling참고 문헌 28인용 수 19
한 줄 요약

이 논문은 공유된 의미적 임베딩과 어텐션 분포 정렬을 사용하여 제품 제목 압축과 사용자 쿼리 생성을 동시에 최적화하는 다중 작업 학습 프레임워크를 제안한다. 사용자 검색 로그와 수작업으로 압축된 제목을 활용함으로써 압축 품질과 온라인 전환율을 향상시키며, A/B 테스트에서 베이스라인 ILP 방법 대비 CTR 2.58% 향상과 CVR 1.32% 향상을 달성한다.

ABSTRACT

It is a challenging and practical research problem to obtain effective compression of lengthy product titles for E-commerce. This is particularly important as more and more users browse mobile E-commerce apps and more merchants make the original product titles redundant and lengthy for Search Engine Optimization. Traditional text summarization approaches often require a large amount of preprocessing costs and do not capture the important issue of conversion rate in E-commerce. This paper proposes a novel multi-task learning approach for improving product title compression with user search log data. In particular, a pointer network-based sequence-to-sequence approach is utilized for title compression with an attentive mechanism as an extractive method and an attentive encoder-decoder approach is utilized for generating user search queries. The encoding parameters (i.e., semantic embedding of original titles) are shared among the two tasks and the attention distributions are jointly optimized. An extensive set of experiments with both human annotated data and online deployment demonstrate the advantage of the proposed research for both compression qualities and online business values.

연구 동기 및 목표

  • 모바일 전자상거래에서 긴, SEO 최적화된 제품 제목을 압축함으로써 사용자 경험과 전환율을 훼손하지 않도록 하는 도전 과제를 해결하기 위해.
  • 기존 추출 기반 요약 방법에서 비용이 많이 들고 수작업이 필요한 전처리 및 특징 공학에 의존도를 줄이기 위해.
  • 거래 데이터와 함께 수작업으로 편집된 단순화된 제목 및 사용자 검색 쿼리를 함께 학습시켜 압축 품질을 향상시키기 위해.
  • 사용자 검색 행동과 관련된 关键 키워드를 우선시하여 비즈니스 성과를 최적화하기 위해.
  • 규칙 기반 및 단일 작업 접근 방식보다 우수한 실세계 구현 성능을 보이는 데이터 기반, 종단 간 프레임워크를 개발하기 위해.

제안 방법

  • 두 개의 병렬 시퀀스-투-시퀀스 모델을 갖춘 다중 작업 학습 프레임워크를 설계하였으며, 하나는 추출 기반 제목 압축을 위해, 다른 하나는 사용자 쿼리 생성을 위해 사용된다.
  • 두 모델은 원본 제품 제목의 통합된 의미적 임베딩을 생성하기 위해 동일한 인코더를 공유한다.
  • 포인터 네트워크와 어텐션 메커니즘을 사용하여 원본 제목의 단어들에서만 추출된 단어들을 출력함으로써, 출력 단어가 원본 제목에 포함된 단어들로만 구성되도록 보장한다.
  • 원본 제목 토큰에 대한 어텐션 분포를 함께 최적화하여, 제목 압축과 사용자 검색 의도 양쪽에 모두 관련이 깊은 중요한 단어들에 초점을 맞춘다.
  • 두 작업 간 어텐션 집중의 일관성을 유도하기 위해 일치 손실(loss)을 도입하여 주요 키워드 식별 능력을 향상시킨다.
  • 실제 중국 전자상거래 플랫폼의 데이터를 기반으로 프레임워크를 훈련하였으며, 이는 수작업으로 압축된 제목과 거래성 검색 로그를 포함한다.

실험 결과

연구 질문

  • RQ1공유된 의미 표현을 통해 다중 작업 학습 프레임워크가 제품 제목 압축과 사용자 쿼리 생성을 동시에 향상시킬 수 있는가?
  • RQ2압축과 쿼리 생성 간 어텐션 분포 정렬이 제목 압축에서 주요 키워드 선택에 어떻게 기여하는가?
  • RQ3제안된 방법이 전통적인 규칙 기반(ILP 등) 및 단일 작업 딥러닝 접근 방식에 비해 압축 품질과 비즈니스 지표에서 얼마나 뛰어난가?
  • RQ4거래 신호를 포함한 사용자 검색 로그 데이터를 통합함으로써 사용자 의도와의 일치도가 향상되고 전환율이 높아지는가?
  • RQ5데이터 기반, 종단 간 모델이 전자상거래 제목 압축에서 수작업 전처리 및 특징 공학의 필요성을 줄일 수 있는가?

주요 결과

  • 제안된 Agree-MTL 모델은 온라인 A/B 테스트에서 기준 ILP 방법 대비 CTR에 대해 2.58% 상대적 향상을 달성했다.
  • 모델은 기준 대비 CTR 1.32% 향상으로, 클릭 후 전환 성능 향상을 나타내었다.
  • 어텐션 일치 메커니즘이 사용자 검색 로그에서 선호하는 키워드, 예를 들어 영문 브랜드명(예: D’ZZIT)을 성공적으로 강조하였다.
  • 프레임워크는 일반적인 다중 작업 학습 및 표준 포인터 네트워크보다 추출 기반 압축 품질과 비즈니스 가치에서 뛰어난 성능을 보였다.
  • 인간 평가 결과, 생성된 단순화된 제목들이 유창하고 문법적으로 올바르며 핵심 제품 특성을 유지하고 있음을 확인하였다.
  • 온라인 배포 결과, 모델이 간결한 제목을 통해 사용자 경험을 향상시키고 동시에 거래 전환율을 직접적으로 높이고 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.