Skip to main content
QUICK REVIEW

[논문 리뷰] A Multi-Agent Reinforcement Learning Method for Impression Allocation in Online Display Advertising

Di Wu, Cheng Chen|arXiv (Cornell University)|2018. 09. 10.
Auction Theory and Applications참고 문헌 23인용 수 9
한 줄 요약

이 논문은 불안정한 환경에서 게임 이론적 분석을 통해 최적의 인플루언서 할당 전략을 확보하고, 실시간 입찰(Real-Time Bidding, RTB)과 계약 간 인플루언서를 최적으로 할당하여 게임이익을 극대화하는 다중 에이전트 강화학습 방법 MAPOLO를 제안한다. 이 방법은 기존 최고 수준의 다중 에이전트 강화학습(MARL) 방법들보다 빠른 수렴 속도와 뛰어난 확장성을 확보하며, 대규모 데이터셋에서 10,000초 이내에 최적 수익의 90%를 달성한다.

ABSTRACT

In online display advertising, guaranteed contracts and real-time bidding (RTB) are two major ways to sell impressions for a publisher. Despite the increasing popularity of RTB, there is still half of online display advertising revenue generated from guaranteed contracts. Therefore, simultaneously selling impressions through both guaranteed contracts and RTB is a straightforward choice for a publisher to maximize its yield. However, deriving the optimal strategy to allocate impressions is not a trivial task, especially when the environment is unstable in real-world applications. In this paper, we formulate the impression allocation problem as an auction problem where each contract can submit virtual bids for individual impressions. With this formulation, we derive the optimal impression allocation strategy by solving the optimal bidding functions for contracts. Since the bids from contracts are decided by the publisher, we propose a multi-agent reinforcement learning (MARL) approach to derive cooperative policies for the publisher to maximize its yield in an unstable environment. The proposed approach also resolves the common challenges in MARL such as input dimension explosion, reward credit assignment, and non-stationary environment. Experimental evaluations on large-scale real datasets demonstrate the effectiveness of our approach.

연구 동기 및 목표

  • 불안정하고 동적인 광고 환경에서 보장 계약과 실시간 입찰(RTB) 간 최적의 인플루언서 할당 문제를 해결하기 위해.
  • 계약 이행, RTB 수익, 보상 회피를 종합적으로 최적화하여 게임이익을 극대화하기 위해.
  • 입력 차원의 폭발, 보상 책임 할당, 비정적 환경과 같은 일반적인 과제를 해결할 수 있는 확장성 있고 효율적인 MARL 프레임워크를 개발하기 위해.
  • 보장 계약을 최적의 입찰 함수를 가진 가상 입찰자로 모델링하여 보장 계약이 실시간 경매에 참여할 수 있도록 하기 위해.

제안 방법

  • 각 보장 계약이 개별 인플루언서에 대해 가상 입찰을 제출하는 경매 문제로 인플루언서 할당을 수립한다.
  • 게임 이론적 분석을 통해 계약의 최적 입찰 함수를 유도하여 최적의 할당 전략을 보장한다.
  • MADDPG 기반의 중앙집중적 훈련 및 분산 실행 MARL 프레임워크인 MAPOLO를 제안하며, 비정적 환경을 줄이기 위한 새로운 보상 함수를 도입한다.
  • 게임이익 총합을 직접 반영하는 보상 함수(식 6)를 도입하여 책임 할당과 수렴성을 향상시킨다.
  • 에이전트 수가 증가하더라도 각 에이전트의 차원을 낮게 유지하는 입력 표현을 설계하여 확장성을 향상시킨다.
  • 중앙집중적 크리틱을 활용하여 정책을 조율하고 계약 입찰자들의 행동을 공동 최적화할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1보장 계약을 실시간 입찰에 효과적으로 통합하여 인플루언서 할당 효율성과 게임이익을 향상시킬 수 있는가?
  • RQ2동적인 불안정한 환경에서 RTB와 경쟁할 때 보장 계약의 최적 입찰 전략은 무엇인가?
  • RQ3입력 차원의 폭발, 보상 책임 할당, 비정적 환경을 다룰 수 있는 다중 에이전트 강화학습(MARL) 방법은 어떻게 설계할 수 있는가?
  • RQ4중앙집중적 훈련 및 분산 실행 프레임워크가 인플루언서 할당 분야에서 기존 MARL 방법들보다 수렴 속도와 확장성 면에서 뛰어나게 작용할 수 있는가?
  • RQ5제안된 보상 함수는 비정적 광고 환경에서 학습 안정성과 수렴성에 어떤 영향을 미치는가?

주요 결과

  • MAPOLO는 게임이익 1(68개 에이전트) 및 게임이익 3(25개 에이전트) 데이터셋에서 각각 10,000초 이내에 최적 수익의 90%($R/R^* = 0.9$)에 도달하여 수렴한다.
  • MAPOLO는 MADDPG보다 뚜렷한 수렴 속도 향상을 보이며, 에이전트 수가 2.7배 증가할 때마다 에피소드당 시간이 2.5배 증가하는 반면, MADDPG는 4.7배 증가한다.
  • MAPOLO에서 제안된 보상 함수는 비정적 환경의 영향을 줄여 더 안정적이고 효율적인 학습을 가능하게 한다.
  • 계약 수에 관계없이 MAPOLO는 각 에이전트의 입력 차원을 낮게 유지하여 대규모 산업 응용에 대한 확장성을 확보한다.
  • MAPOLO는 수렴 효율성과 확장성 면에서 기존 최고 수준의 MARL 기준 모델들을 능가하며, 실세계 적용 가능성의 실현 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.