[논문 리뷰] Optimizing Gross Merchandise Volume via DNN-MAB Dynamic Ranking Paradigm
이 논문은 JD.com에서의 실시간 사용자 피드백(클릭 및 전환율 등)을 통합함으로써 사용자 의도와의 일치도를 향상시켜 생산 환경에서 거래 금액 총액(GMV)을 크게 향상시키기 위해 동적 랭킹 프레임워크인 DNN-MAB를 제안한다. 이 프레임워크는 쌍별 딥 뉴럴 네트워크(DNN) 전랭커와 개선된 톰슨 샘플링 다중 손잡이 띠자(이하 MAB) 후랭킹 기반의 동적 랭킹을 결합한다.
With the transition from people's traditional `brick-and-mortar' shopping to online mobile shopping patterns in web 2.0 $\mathit{era}$, the recommender system plays a critical role in E-Commerce and E-Retails. This is especially true when designing this system for more than $\mathbf{236~million}$ daily active users. Ranking strategy, the key module of the recommender system, needs to be precise, accurate, and responsive for estimating customers' intents. We propose a dynamic ranking paradigm, named as DNN-MAB, that is composed of a pairwise deep neural network (DNN) $\mathit{pre}$-ranker connecting a revised multi-armed bandit (MAB) dynamic $\mathit{post}$-ranker. By taking into account of explicit and implicit user feedbacks such as impressions, clicks, conversions, etc. DNN-MAB is able to adjust DNN $\mathit{pre}$-ranking scores to assist customers locating items they are interested in most so that they can converge quickly and frequently. To the best of our knowledge, frameworks like DNN-MAB have not been discussed in the previous literature to either E-Commerce or machine learning audiences. In practice, DNN-MAB has been deployed to production and it easily outperforms against other state-of-the-art models by significantly lifting the gross merchandise volume (GMV) which is the objective metrics at JD.
연구 동기 및 목표
- 사용자 의도와 피드백이 동적으로 통합되지 않는 전자상거래 추천 시스템에서의 정적 랭킹의 한계를 해결하기 위해.
- 사용자 행동 기반 실시간 랭킹 조정을 통해 전환율과 거래 금액 총액(GMV)을 향상시키기 위해.
- 탐색과 이용의 균형을 맞추는 실시간 추천 환경에서 확장 가능하고 생산 환경에 적합한 동적 랭킹 프레임워크를 설계하기 위해.
- 전통적인 러닝-투-랭킹 및 MAB 모델의 단점을 보완하기 위해, 두 단계의 랭킹 파이프라인에서 딥 러닝과 컨텍스트 기반 밴딧을 통합하기 위해.
- 2억 3,600만 명 이상의 활성 사용자를 보유한 대규모 전자상거래 환경에서 프레임워크의 효과성을 검증하고, GMV 및 DCG와 같은 실세계 성능 지표에 집중하기 위해.
제안 방법
- 프레임워크는 사용자 및 아이템 특성 기반으로 초기 아이템 관련성 점수를 생성하기 위해 쌍별 DNN를 전랭커로 사용한다.
- 개선된 톰슨 샘플링 알고리즘은 실시간 피드백(노출, 클릭, 전환)을 사용하여 전랭킹 점수를 동적으로 조정하는 후랭킹 기능을 수행한다.
- MAB 구성 요소는 생산 환경 배포 시 수렴 속도를 향상시키고 초기 손실을 줄이기 위해 새로운 초기화 전략을 적용한다.
- 시스템은 실시간으로 사용자 상호작용을 처리하여 온라인 학습을 가능하게 하고, 현재 사용자 의도에 맞게 랭킹을 지속적으로 적응시킨다.
- 두 단계 아키텍처는 정적 관련성 모델링(DNN)과 동적 피드백 적응(MAB)을 분리함으로써 확장성과 반응성 향상을 도모한다.
- 프레임워크는 JD.com에서 생산 환경에 배포되어 있으며, 사용자 상호작용에서 지속적으로 학습하고 실시간으로 랭킹을 업데이트한다.
실험 결과
연구 질문
- RQ1딥 러닝 기반 전랭커와 컨텍스트 기반 밴딧 후랭킹 기반의 조합이 전자상거래에서 동적 랭킹 향상에 효과적으로 기여할 수 있는가?
- RQ2실시간 피드백 통합(예: 클릭, 전환)이 정적 모델 대비 GMV 및 랭킹 효과성에 미치는 영향은 무엇인가?
- RQ3맞춤형 초기화 전략을 적용한 개선된 톰슨 샘플링 알고리즘이 대규모 생산 환경의 추천 시스템에서 수렴 속도와 성능을 향상시키는가?
- RQ4하이브리드 DNN-MAB 프레임워크는 확장성 유지와 함께 최신 기술 수준의 모델 대비 GMV 및 DCG 측면에서 슈퍼리어한 성능을 낼 수 있는가?
- RQ5GMV 최적화와 다른 KPI(예: 주문 수) 간의 상충 관계는 무엇이며, 동적 랭킹에서 다목적 최적화는 어떻게 해결할 수 있는가?
주요 결과
- DNN-MAB 프레임워크는 생산 환경에서 베이스라인 모델을 크게 능가하여, JD에서 주요 비즈니스 지표인 거래 금액 총액(GMV)에 측정 가능한 명확한 증가를 이끌어냈다.
- DCG(할인 누적 수익) 지표에서 향상된 성능를 기록하여, 더 나은 랭킹 품질과 사용자 만족도를 반영했다.
- 맞춤형 초기화 전략을 적용한 개선된 톰슨 샘플링 알고리즘은 수렴 속도를 향상시키고 초기 손실을 감소시켜 사용자 피드백에 대한 반응성을 향상시켰다.
- 프레임워크는 실세계 환경에서의 뛰어난 내구성을 입증했으며, 2억 3,600만 명 이상의 활성 사용자와 일일 수십억 건의 상호작용을 처리할 수 있었다.
- GMV 및 DCG 향상에도 불구하고, 일부 기간 동안 주문 수에 일시적인 부정적 영향을 미친 것으로 나타나, 다중 KPI 최적화의 필요성을 시사했다.
- DNN 전랭킹과 MAB 후랭킹의 통합은 효과적이며 확장성 있는 것으로 입증되었으며, 생산 환경에서의 확장성 문제는 보고되지 않았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.