Skip to main content
QUICK REVIEW

[논문 리뷰] MoTiAC: Multi-Objective Actor-Critics for Real-Time Bidding

Zhou, Haolin, Chaoqi Yang|arXiv (Cornell University)|2020. 02. 18.
Auction Theory and Applications참고 문헌 23인용 수 6
한 줄 요약

MoTiAC는 디스play 광고에서 실시간 입찰을 위한 다목적 액터-크리틱 강화학습 프레임워크를 제안하며, 이는 목표별 에이전트 간 이방향 학습을 가능하게 하여 이전의 일치성에 기반해 목표를 적응적으로 가중치 조정한다. 이는 파레토 최적성에 도달하고, 텐센트 산업 데이터셋에서 베이스라인보다 뛰어나며, 평균적으로 ROI를 2.7% 향상시키고 수익을 4.2% 증가시킨다.

ABSTRACT

Online Real-Time Bidding (RTB) is a complex auction game among which advertisers struggle to bid for ad impressions when a user request occurs. Considering display cost, Return on Investment (ROI), and other influential Key Performance Indicators (KPIs), large ad platforms try to balance the trade-off among various goals in dynamics. To address the challenge, we propose a Multi-ObjecTive Actor-Critics algorithm based on reinforcement learning (RL), named MoTiAC, for the problem of bidding optimization with various goals. In MoTiAC, objective-specific agents update the global network asynchronously with different goals and perspectives, leading to a robust bidding policy. Unlike previous RL models, the proposed MoTiAC can simultaneously fulfill multi-objective tasks in complicated bidding environments. In addition, we mathematically prove that our model will converge to Pareto optimality. Finally, experiments on a large-scale real-world commercial dataset from Tencent verify the effectiveness of MoTiAC versus a set of recent approaches

연구 동기 및 목표

  • 예산 제약과 ROI 최적화가 공존하는 실시간 디스플레이 광고에서의 동적이고 다목적 입찰 도전 과제를 해결한다.
  • 수익 또는 ROI에만 집중하는 단일 목표 강화학습 모델의 한계를 극복하여 서로 충돌하는 KPI를 균형 있게 조율한다.
  • 역사적 사전 지식에서 학습하고 목표 가중치를 동적으로 조정함으로써 강력하고 적응적인 입찰 정책을 개발하는 프레임워크를 구축한다.
  • 비정적이고 시간에 따라 변화하는 RTB 환경에서 다목적 최적화에서 파레토 최적성에 수렴하도록 보장한다.
  • 텐센트 광고 플랫폼의 대규모 실세계 상용 데이터셋을 기반으로 모델을 검증하여 산업 적용 가능성을 입증한다.

제안 방법

  • 다양한 목표별 액터-크리틱 네트워크가 동일한 환경과 상호작용하도록 이방향 이점 액터-크리틱(A3C) 프레임워크를 다수의 목표별 에이전트를 지원하도록 변형한다.
  • 목표 인식 에이전트를 사용해 각각 다른 보상 신호(예: 비용 통제, ROI, 수익)에 따라 맞춤화된 특정 KPI를 지향하는 글로벌 정책 네트워크를 이방향으로 업데이트한다.
  • 에이전트의 사전 지식과 현재 상태 간의 일치성에 기반해 목표의 가중치를 적응적으로 조정하여 고정된 선형 조합을 대체한다.
  • 다목적 강화학습 문제를 다수의 보상 함수를 가진 마르코프 결정 과정(MDP)으로 공식화하여 장기적 유틸리티 최적화를 가능하게 한다.
  • 제안된 학습 동역학 하에서 MoTiAC가 파레토 최적 해에 수렴함을 수학적으로 증명한다.
  • 역사적 데이터를 활용해 사전 지식을 미리 학습시켜 적응형 가중치 조정 메커니즘을 향상시키고, 동적인 환경에서 정책 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1실시간 입찰의 동적이고 비정적 조건에서 예산 통제와 ROI 등 상충하는 KPI를 효과적으로 균형 잡는 다목적 강화학습 프레임워크는 가능한가?
  • RQ2사전 지식 일치성에 기반한 목표의 적응형 가중치 조정 방식은 고정 또는 정적 선형 조합 대비 입찰 정책 성능을 어떻게 향상시키는가?
  • RQ3MoTiAC는 파레토 최적성과 실제 성능 지표 측면에서 단일 목표 및 다목적 베이스라인보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ4MoTiAC의 장기적 탐색 전략은 ROI와 수익을 장기간 유지를 위해 피드백 기반의 탐색 전략인 PID와 비교해 어떻게 우월한가?
  • RQ5복잡한 산업 규모의 RTB 환경에서 MoTiAC는 강건성과 파레토 최적성 수렴성을 유지하는가?

주요 결과

  • MoTiAC는 테스트된 캠프에 걸쳐 평균적으로 베이스라인 PID 모델 대비 ROI를 2.7% 높이고 수익을 4.2% 향상시킨다.
  • 24시간 동안 누적 ROI와 수익 측면에서 MoTiAC는 PID를 뛰어넘어, 이른바 탐욕스럽고 단기적인 최적화가 아닌 장기적인 전략적 계획 수립 능력을 입증한다.
  • 베이지안 우선순위 설정에서는 목표 가중치가 사전 지식 일치성에 기반해 적응적으로 설정되며, 특히 동적 환경에서 다른 전략에 비해 성능이 뛰어나다.
  • MoTiAC의 ROI 곡선은 지속적인 상승 추세를 보이며, PID의 곡선은 조기에 정점에 도달한 후 하락하는 경향을 보여, MoTiAC가 탐색을 유지하고 조기 수렴을 피할 수 있음을 시사한다.
  • 실험 결과 MoTiAC는 이론적으로 증명된 바와 같이 다목적 강화학습 공식화 하에서 파레토 최적 해에 수렴함을 확인한다.
  • 고전환율 광고에 대한 사례 연구에서 MoTiAC는 즉각적인 이익에서 일시적으로 벗어나더라도 더 높은 수익을 유지하면서 더 나은 ROI 균형을 달성함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.