[논문 리뷰] Towards Personalized and Semantic Retrieval: An End-to-End Solution for E-commerce Search via Embedding Learning
이 논문은 전자상거래 검색을 위한 딥러닝 기반 엔드 투 엔드 시스템인 DPSR을 제안하며, 학습된 임bedding을 통해 의미적 및 개인화된 검색을 향상시킵니다. 다중 헤드 쿼리 인코딩, 주의 기반 손실, 사용자별 특징을 갖춘 이중 타워 신경망 아키텍처를 활용함으로써 DPSR은 검색 관련성, 특히 장꼬리 쿼리에 대해 향상됩니다. 온라인 A/B 테스트에서 전환율은 1.29% 향상되었고, 장꼬리 쿼리에서는 10.03% 향상되었으며, 스케일링에 적합한 낮은 지연 시간을 제공하여 생산 환경에 쉽게 구현 가능합니다.
Nowadays e-commerce search has become an integral part of many people's shopping routines. Two critical challenges stay in today's e-commerce search: how to retrieve items that are semantically relevant but not exact matching to query terms, and how to retrieve items that are more personalized to different users for the same search query. In this paper, we present a novel approach called DPSR, which stands for Deep Personalized and Semantic Retrieval, to tackle this problem. Explicitly, we share our design decisions on how to architect a retrieval system so as to serve industry-scale traffic efficiently and how to train a model so as to learn query and item semantics accurately. Based on offline evaluations and online A/B test with live traffics, we show that DPSR model outperforms existing models, and DPSR system can retrieve more personalized and semantically relevant items to significantly improve users' search experience by +1.29% conversion rate, especially for long tail queries by +10.03%. As a result, our DPSR system has been successfully deployed into JD.com's search production since 2019.
연구 동기 및 목표
- 기존의 역색인 기반 후보 검색 방식이 의미적 유사성과 개인화를 포착하지 못하는 데서 비롯되는 한계를 해결하기 위해.
- 실시간으로 낮은 지연 시간을 제공할 수 있는 확장성 있고 생산 환경에 적합한 딥러닝 시스템을 설계하기 위해.
- 정확한 단어 매칭 시스템이 자주 무시하는 장꼬리 쿼리의 검색 성능을 향상시키기 위해.
- 수동으로 정의된 규칙에 의존하지 않고도 사용자별 특징(예: 성별, 구매력)을 검색 프로세스에 통합하기 위해.
- 오프라인 평가와 실시간 트래픽을 활용한 온라인 A/B 테스트를 통해 제안된 모델의 효과성을 검증하기 위해.
제안 방법
- 쿼리와 아이템이 공유된 벡터 공간에 임베딩되어 의미적 매칭이 이루어지는 이중 타워 신경망 아키텍처를 제안합니다.
- 다양한 사용자 의도의 측면을 포착하기 위해 다중 헤드 쿼리 타워를 활용하여 표현 학습을 향상시킵니다.
- 학습 중 하드 네거티브 샘플을 우선적으로 고려하기 위해 주의 기반 손실 함수를 도입하여 모델 일반화 능력을 향상시킵니다.
- 긍정 및 부정 예측 간 균형을 맞추기 위해 맞춤형 음성 샘플링 전략을 사용하여 학습의 안정성과 효과성을 높입니다.
- 대규모 임베딩 학습에 최적화된 효율적인 학습 알고리즘을 구현하여 분산 데이터 및 모델 병렬 처리를 활용합니다.
- 인간의 평가 데이터를 활용해 모델 예측을 정교화하고 인간의 관련성 판단과 일치시킵니다.
실험 결과
연구 질문
- RQ1딥러닝 기반 검색 시스템은 기존의 역색인 기반 방법보다 전자상거래 검색에서 의미적 관련성을 더 잘 포착할 수 있는가?
- RQ2규칙 기반 히우리스틱에 의존하지 않고도 사용자별 개인화를 검색 파이프라인에 효과적으로 통합할 수 있는가?
- RQ3제안된 모델은 키워드 기반 시스템이 어려워하는 장꼬리 쿼리에서 얼마나 향상된 검색 성능을 보이는가?
- RQ4실제 생산 워크로드 하에서 시스템의 지연 시간과 처리량 성능은 어떠한가?
- RQ5전환율 및 총 판매 금액(GMV)과 같은 핵심 비즈니스 지표에서 일관된 향상이 이루어지는가?
주요 결과
- DPSR은 실시간 트래픽의 10%에서 온라인 A/B 테스트를 통해 사용자 전환율(UCVR)을 +1.29% 향상시켜 뚜렷한 비즈니스 영향을 입증했습니다.
- 총 판매 금액(GMV)은 +2.19% 향상되었고, 쿼리 리라이팅 비율(QRR)은 4.29% 감소하여 사용자 만족도 향상을 시사했습니다.
- 장꼬리 쿼리에서는 전환율이 +10.03% 향상되어 모호하거나 드문 검색어 처리에 효과적임을 입증했습니다.
- 오프라인 인간 평가에서 '나쁜' 관련성 사례가 6% 감소했으며, 500개의 장꼬리 쿼리에서 나쁜 결과 비율이 17.86%에서 13.70%로 감소했습니다.
- CPU 기반으로는 10ms 미만의 검색 지연 시간, GPU 기반으로는 1ms 이내의 검색 지연 시간을 달성했고, GPU에서는 QPS가 14배 높아 실시간 구현 가능성을 입증했습니다.
- 2헤드 쿼리 타워와 개인화 버전(1헤드-p13n) 모두 기존의 단일 헤드 모델보다 성능이 뛰어나 아키텍처 개선의 가치를 확인했습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.