[논문 리뷰] Learning to Collaborate in Multi-Module Recommendation via Multi-Agent Reinforcement Learning without Communication
이 논문은 다중 모듈 전자상거래 추천을 위한 다중 에이전트 강화학습 프레임워크인 MASSA를 제안하며, 직접적인 통신 없이도 협업을 가능하게 한다. 이는 관련 균형에 영감을 받은 신호 네트워크와 엔트로피 정규화를 사용하여 탐색을 조율함으로써, 실제 타아바오 데이터에서 기존 방법들에 비해 전반적인 성능을 크게 향상시킨다.
With the rise of online e-commerce platforms, more and more customers prefer to shop online. To sell more products, online platforms introduce various modules to recommend items with different properties such as huge discounts. A web page often consists of different independent modules. The ranking policies of these modules are decided by different teams and optimized individually without cooperation, which might result in competition between modules. Thus, the global policy of the whole page could be sub-optimal. In this paper, we propose a novel multi-agent cooperative reinforcement learning approach with the restriction that different modules cannot communicate. Our contributions are three-fold. Firstly, inspired by a solution concept in game theory named correlated equilibrium, we design a signal network to promote cooperation of all modules by generating signals (vectors) for different modules. Secondly, an entropy-regularized version of the signal network is proposed to coordinate agents' exploration of the optimal global policy. Furthermore, experiments based on real-world e-commerce data demonstrate that our algorithm obtains superior performance over baselines.
연구 동기 및 목표
- 독립적으로 최적화된 모듈 간의 협업 부족으로 인한 다중 모듈 전자상거래 추천에서의 전역 성능 저하 문제를 해결하기 위해.
- 직접적인 통신이 불가능한 다중 에이전트 RL 프레임워크를 설계하기 위해.
- 에이전트 간의 명시적 상호작용 없이도 중심화된 신호 네트워크를 통해 에이전트를 조율하여 전역 정책 최적화를 향상시키기 위해.
- 고차원 상태 및 행동 공간에서의 탐색을 향상시키기 위해 신호 네트워크에 엔트로피 정규화를 도입하기 위해.
제안 방법
- 사용자 맥락에 기반해 각 모듈에 관련 신호를 생성하는 신호 네트워크를 도입하여, 에이전트 간 직접 통신 없이도 중심화된 조정자 역할을 한다.
- 에이전트의 탐색 다양성과 전역 최적화를 장려하기 위해 엔트로피 정규화를 적용한 정책 기반 강화학습 방법으로 신호 네트워크를 훈련시킨다.
- 신호 네트워크의 손실 함수에 엔트로피 항을 추가하여 신호 분포를 평탄하게 만들고, 공동 행동 공간의 광범위한 탐색을 촉진한다.
- 각 모듈에 대해 이중 지연 딥 디터민리스틱 정책 기반 강화학습(DDPG) 컴포넌트를 포함한 액터-크리틱 아키텍처를 사용하며, 다중 에이전트 환경에서 훈련한다.
- 신호 네트워크를 에이전트와 함께 엔드 투 엔드로 훈련시어, 에이전트가 보상이 높은 공동 행동으로 유도될 수 있도록 학습시킨다.
- 실제 타아바오 전자상거래 데이터를 기반으로 오프라인 및 온라인 실험을 통해 방법을 평가한다.
실험 결과
연구 질문
- RQ1중앙 집중식 신호 네트워크는 다중 에이전트 RL 환경에서 직접 통신이 불가능한 추천 모듈 간에 효과적인 협업을 가능하게 할 수 있는가?
- RQ2신호 네트워크의 엔트로피 정규화는 탐색 향상과 전역 최적 정책 수렴에 어떻게 기여하는가?
- RQ3제안된 방법은 기존의 통신 기반 및 통신이 없는 다중 에이전트 RL 기준선에 비해 다중 모듈 추천에서 뛰어난 성능을 보일 수 있는가?
- RQ4엔트로피 정규화 하이퍼파rameter α는 성능과 탐색 다이내믹스에 어떤 영향을 미치는가?
- RQ5신호 네트워크의 설계는 성능 및 안정성 측면에서 다른 조율 메커니즘과 비교해 어떻게 다른가?
주요 결과
- MASSA는 실제 타아바오 데이터에서 오프라인 및 온라인 평가 모두에서 모든 기준선, 특히 COMA와 MASAC를 능가한다.
- 엔트로피 정규화 없이도 신호 네트워크만으로 MASAC보다 성능 향상을 보이며, 통신 없이도 협업을 가능하게 하는 효과를 입증한다.
- 엔트로피 정규화가 적용된 MASSA(즉, MASSA)는 엔트로피 정규화 없이 사용한 MASSA보다 유의미하게 뛰어난 성능을 보이며, 엔트로피 정규화가 부분 최적 정책로의 조기 수렴을 방지함을 보여준다.
- 온라인 학습 곡선을 분석한 결과, MASSA는 약 30,000단계에서 지속적인 탐색 덕분에 부분 최적 해를 벗어나는 반면, 엔트로피 정규화 없이 사용한 MASSA는 갇히며 최종 단계에서 분산이 증가하는 경향을 보인다.
- 제거 실험 결과, α = 0.01일 때가 가장 뛰어난 성능를 보이며, 신호 네트워크에서 탐색과 이용의 균형을 잘 맞춘다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.