[논문 리뷰] Learning to Collaborate: Multi-Scenario Ranking via Multi-Agent Reinforcement Learning
이 논문은 중심화된 크리틱, 비공개 액터(정책이 결정적인) 및 순환 메시지 전달을 통해 다중 시나리오(예: 검색, 추천, 광고) 간의 컨텍스트 공유를 가능하게 하는 다중 에이전트 강화학습 프레임워크인 MA-RDPG를 제안한다. 대규모 전자상거래 플랫폼에서 평가된 결과, MA-RDPG는 독립 최적화 기반 모델 대비 전반적인 플랫폼 성능에서 뚜렷한 향상을 보이며, 장기적인 보상 최적화를 통한 협력적이고 균형 잡힌 순위 매칭 품질 향상을 입증한다.
Ranking is a fundamental and widely studied problem in scenarios such as search, advertising, and recommendation. However, joint optimization for multi-scenario ranking, which aims to improve the overall performance of several ranking strategies in different scenarios, is rather untouched. Separately optimizing each individual strategy has two limitations. The first one is lack of collaboration between scenarios meaning that each strategy maximizes its own objective but ignores the goals of other strategies, leading to a sub-optimal overall performance. The second limitation is the inability of modeling the correlation between scenarios meaning that independent optimization in one scenario only uses its own user data but ignores the context in other scenarios. In this paper, we formulate multi-scenario ranking as a fully cooperative, partially observable, multi-agent sequential decision problem. We propose a novel model named Multi-Agent Recurrent Deterministic Policy Gradient (MA-RDPG) which has a communication component for passing messages, several private actors (agents) for making actions for ranking, and a centralized critic for evaluating the overall performance of the co-working actors. Each scenario is treated as an agent (actor). Agents collaborate with each other by sharing a global action-value function (the critic) and passing messages that encodes historical information across scenarios. The model is evaluated with online settings on a large E-commerce platform. Results show that the proposed model exhibits significant improvements against baselines in terms of the overall performance.
연구 동기 및 목표
- 대규모 온라인 플랫폼에서 다수의 시나리오 간 순위 전략을 독립적으로 최적화할 경우 발생하는 최적 성능 이하의 성능 문제를 해결하기 위해.
- 현재 고립된 최적화에서 忽시되고 있는 다양한 순위 시나리오(예: 메인 검색, 상점 내 검색) 간의 사용자 행동 간 상관관계를 모델링하기 위해.
- 각 시나리오를 다중 에이전트 강화학습 프레임워크 내의 협력적 에이전트로 간주하여 CTR, CVR, GMV 등의 다중 순위 목표를 공동 최적화할 수 있도록 하기 위해.
- 연속된 행동 공간과 장기적 책임 할당을 지원하는 확장 가능한, 완전히 협력적인, 부분 관측 가능한 다중 에이전트 RL 모델을 설계하기 위해.
- 에이전트들이 자체 메트릭을 넘어서 향후 보상을 고려함으로써 전반적인 플랫폼 수준의 성능 향상을 이끌기 위해.
제안 방법
- 다중 시나리오 순위 매칭을 완전히 협력적이고 부분 관측 가능한 다중 에이전트 순차적 의사결정 문제로 공식화한다.
- 전반적인 성능를 평가하기 위해 글로벌 행동가치 함수를 평가하는 중심화된 크리틱을 갖춘 MA-RDPG 모델을 도입한다.
- 각 시나리오별로 비공개 액터(에이전트)를 활용하여 연속된 행동(예: 아이템 순위 매기기)을 결정적 정책을 통해 생성한다.
- 에이전트들이 이전의 다중 시나리오 컨텍스트를 인코딩한 메시지를 전달할 수 있도록 순환 통신 구성 요소를 통합한다.
- 메시지 역사 정보를 인코딩하고 시나리오 간 의존성의 시간적 모델링을 가능하게 하기 위해 순환 신경망(LSTM)을 사용한다.
- 중앙 집중적 훈련과 분산 실행을 적용한 순환 결정 정책 기울기(RDPG) 알고리즘을 사용하여 학습 안정성과 연속된 행동 공간 지원을 확보한다.
실험 결과
연구 질문
- RQ1다양한 순위 시나리오 간 협업 최적화는 독립 최적화 대비 더 나은 전반적 플랫폼 성능을 이끌 수 있는가?
- RQ2사용자 행동의 다중 시나리오 간 상관관계를 효과적으로 모델링하여 공동 순위 매칭 성능을 향상시킬 수 있는가?
- RQ3에이전트 간 통신과 공유된 가치 함수 학습이 다중 에이전트 순위 매칭 성능에 미치는 영향은 무엇인가?
- RQ4메시지 전달 기능이 있는 중심화된 크리틱은 다중 시나리오 순위 매칭에서 더 나은 책임 할당과 장기적 보상 최적화를 가능하게 하는가?
- RQ5제안된 MA-RDPG 모델은 각 시나리오를 독립적으로 최적화하는 기준 기반 모델과 비교해 어떻게 성능이 뛰어나게 되는가?
주요 결과
- MA-RDPG는 각 시나리오를 독립적으로 최적화하는 기준 기반 모델 대비 전반적인 플랫폼 성능에서 뚜렷한 향상을 보였다.
- MA-RDPG는 다중 시나리오 간 CTR, CVR, GMV의 공동 최적화를 가능하게 하여 시나리오 간 협업과 장기적 보상 고려를 통해 성능 향상을 이끌었다.
- 대규모 전자상거래 플랫폼에서 실시한 온라인 A/B 테스트 결과, MA-RDPG는 L2R+L2R 기준 모델 대비 전반적인 순위 효과성에서 뛰어난 성능을 보였다.
- 사례 연구 결과, MA-RDPG가 생성한 메인 검색 결과는 상점 내 검색 목표와 더 전략적으로 일치했으며, 향후 전환율 향상을 위해 고의도 사용자와 브랜드 제품을 우선적으로 강조했다.
- MA-RDPG의 통신 메커니즘은 시나리오 간 컨텍스트 정보 공유를 가능하게 하여 보다 일관되고 글로벌 최적의 순위 결정을 이끌었다.
- 모델은 사용자 시나리오 전환 행동(예: 메인 검색에서 상점 내 검색으로 전환 비율 25.46%)을 효과적으로 포착하여 이 상관관계를 활용해 다중 시나리오 성능 향상을 이끌었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.