[논문 리뷰] Value-aware Recommendation based on Reinforced Profit Maximization in E-commerce Systems
이 논문은 전자상거래 시스템에서 수익을 직접 최적화하기 위해 강화학습을 사용하는 가치 인식 추천 프레임워크를 제안한다. 이는 클릭률 전환율(CVR)을 임의의 사용자 행동(XVR)으로 일반화하고 각 행동의 경제적 가치를 환산하여 수익을 최적화한다. 이 방법은 전통적인 랭킹 지표와 시스템 전체 수익 모두에서 뚜렷한 향상을 이룩했으며, 온라인 A/B 테스트에서 DNN 기반 기준 대비 6.8%의 GMV 증가를 기록했다.
Existing recommendation algorithms mostly focus on optimizing traditional recommendation measures, such as the accuracy of rating prediction in terms of RMSE or the quality of top-$k$ recommendation lists in terms of precision, recall, MAP, etc. However, an important expectation for commercial recommendation systems is to improve the final revenue/profit of the system. Traditional recommendation targets such as rating prediction and top-$k$ recommendation are not directly related to this goal. In this work, we blend the fundamental concepts in online advertising and micro-economics into personalized recommendation for profit maximization. Specifically, we propose value-aware recommendation based on reinforcement learning, which directly optimizes the economic value of candidate items to generate the recommendation list. In particular, we generalize the basic concept of click conversion rate (CVR) in computational advertising into the conversation rate of an arbitrary user action (XVR) in E-commerce, where the user actions can be clicking, adding to cart, adding to wishlist, etc. In this way, each type of user action is mapped to its monetized economic value. Economic values of different user actions are further integrated as the reward of a ranking list, and reinforcement learning is used to optimize the recommendation list for the maximum total value. Experimental results in both offline benchmarks and online commercial systems verified the improved performance of our framework, in terms of both traditional top-$k$ ranking tasks and the economic profits of the system.
연구 동기 및 목표
- 전통적인 지표(예: RMSE 또는 MAP)를 넘어서 전자상거래 추천 시스템의 수익을 직접 최적화하기 위해.
- 높은 클릭 수를 기록하지만 마진이 낮은 항목들로 인해 추천 정확도 향상과 실제 수익성 간 격차를 해소하기 위해.
- 클릭, 장바구니 담기, 구매와 같은 다양한 사용자 행동을 수익 기반 경제적 가치로 매핑하여 수익 중심 랭킹을 위한 통합 프레임워크를 개발하기 위해.
- 실제 전자상거래 환경에서의 대규모 온라인 A/B 테스트를 통해 성능을 검증하기 위해.
제안 방법
- 광고 분야의 클릭 전환율(CVR) 개념을 임의의 사용자 행동 전환율(XVR)으로 일반화하여, 클릭, 장바구니 담기, 구매와 같은 행동의 수익화를 가능하게 한다.
- 이력 기반 행동 로그를 바탕으로 각 사용자 행동에 금전적 가치를 할당하여 기대 수익 기여도를 반영한다(예: 구매 = 높은 가치, 클릭 = 낮은 가치).
- 추천 목록 내의 수익화된 행동을 종합하여 통합 보상 함수를 구성함으로써 총 기대 수익을 표현한다.
- 누적 기대 수익을 최대화하기 위해 정책 네트워크를 훈련하기 위해 딥 강화학습(PPO 기반)을 활용한다.
- 모델의 오프라인 훈련 및 평가를 위해 실제 전자상거래 로그에서 유도된 벤치마크 데이터셋을 사용한다.
- 하루 2억 건 이상의 클릭을 처리하는 실시간 시스템에서 200만 명 이상의 사용자 트래픽을 대상으로 온라인 A/B 테스트를 시행하여 성능 검증을 수행한다.
실험 결과
연구 질문
- RQ1추천 시스템이 전통적인 랭킹 정확도가 아닌 수익을 직접 최적화하도록 훈련시킬 수 있는가?
- RQ2클릭, 장바구니 담기, 구매와 같은 다양한 사용자 행동을 수익 최적화를 위해 각각의 경제적 가치로 매핑할 수 있는가?
- RQ3CVR을 XVR(임의의 행동의 전환율)로 일반화함으로써 기존 랭킹 지표보다 더 나은 수익 중심 랭킹을 달성할 수 있는가?
- RQ4가치 기반 보상 함수를 사용한 강화학습이 랭킹 품질과 시스템 수준의 경제적 결과 모두를 얼마나 향상시키는가?
- RQ5제안된 방법이 실제 온라인 배포 환경에서 통계적으로 유의미하고 사업적으로 의미 있는 향상을 달성할 수 있는가?
주요 결과
- 가치 기반 강화학습 모델은 온라인 A/B 테스트에서 DNN 기반 러닝-투-랭크(LTR) 기준 대비 총 거래 금액(GMV)에 6.8%의 상대적 향상을 기록했다.
- 모델은 온라인 클릭률(CTR)을 0.3% 향상시키고, 항목 수준의 구매량(IPV)을 0.4% 향상시켰으며, 둘 다 통계적으로 유의미하다(p < 0.005).
- 오프라인 평가에서 모델은 DNN 기반 LTR 기준 대비 정규화된 기대 GMV에서 7.3% 향상되었고, 수익 기반 지표인 R’_page에서 6.0% 향상되었다.
- 가산 담기 및 위시리스트 추가와 같은 행동을 가치 모델에 포함시킴으로써 기대 GMV가 3.1% 향상되었고, MAP는 최대 6.6% 향상되었다.
- 모델은 DNN 기반 LTR 기준 대비 정밀도를 2.5%, 재현율을 2.4%, MAP를 0.7% 향상시켜 더 나은 랭킹 품질을 입증했다.
- 결과는 수익을 직접 최적화할 경우, 전통적 지표를 명시적으로 고려하지 않더라도 더 나은 비즈니스 성과를 달성할 수 있음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.