Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Advertise with Adaptive Exposure via Constrained Two-Level Reinforcement Learning.

Weixun Wang, Junqi Jin|arXiv (Cornell University)|2018. 09. 10.
Advanced Bandit Algorithms Research참고 문헌 21인용 수 3
한 줄 요약

이 논문은 전자상거래에서의 적응형 광고 노출을 위한 제약이 있는 이중 수준 강화학습 프레임워크를 제안한다. 광고 슬롯 할당과 광고 선택을 분리하면서, 각 상태에서 제약을 부여한 MDP를 통해 쿼리 수준 및 일일 수준의 제약을 강제한다. 제약이 있는 후행 경험 재생 메커니즘을 도입하여 더 높은 광고 수익을 달성하면서도 학습 안정성과 속도를 향상시켰으며, 실제 데이터를 통해 검증되었다.

ABSTRACT

For online advertising in e-commerce, the traditional problem is to assign the right ad to the right user on fixed ad slots. In this paper, we investigate the problem of advertising with adaptive exposure, in which the number of ad slots and their locations can dynamically change over time based on their relative scores with recommendation products. In order to maintain user retention and long-term revenue, there are two types of constraints that need to be met in exposure: query-level and day-level constraints. We model this problem as constrained markov decision process with per-state constraint (psCMDP) and propose a constrained two-level reinforcement learning to decouple the original advertising exposure optimization problem into two relatively independent sub-optimization problems. We also propose a constrained hindsight experience replay mechanism to accelerate the policy training process. Experimental results show that our method can improve the advertising revenue while satisfying different levels of constraints under the real-world datasets. Besides, the proposal of constrained hindsight experience replay mechanism can significantly improve the training speed and the stability of policy performance.

연구 동기 및 목표

  • 동적 광고 슬롯 할당 및 배치 문제를 해결하기 위해, 슬롯 수와 위치가 제품 점수에 따라 변화하는 전자상거래 광고 환경에서의 도전 과제를 다루는 것.
  • 광고 노출에 대해 쿼리 수준(각 검색 쿼리당) 및 일일 수준(하루당)의 두 가지 유형의 제약을 강제하여 사용자 유지를 유지하고 장기적인 수익을 확보하는 것.
  • 적응형 광고 노출 문제를 정확한 제약 처리를 위해 상태별 제약이 있는 마르코프 결정 과정(psCMDP)으로 모델링하는 것.
  • 복잡한 최적화 문제를 두 개의 독립적인 하위최적화 문제로 분해하여 학습 효율성과 정책 안정성을 향상시키는 것.
  • 제약이 있는 후행 경험 재생 메커니즘을 통해 정책 학습을 가속화하고 성능 안정성을 향상시키는 것.

제안 방법

  • 제약이 상태 수준에서 부여되는 상태별 제약이 있는 MDP(psCMDP)로 적응형 광고 노출 문제를 수식화한다.
  • 원래 문제를 두 개의 독립적인 하위최적화 작업으로 분해한다: (1) 제품 점수 기반 슬롯 선택, (2) 각 슬롯에 대한 광고 선택.
  • 제약이 있는 이중 수준 강화학습을 적용하여 두 하위문제를 별도로 최적화하면서도 제약 준수를 유지한다.
  • 과거 경험을 저장하고 제약 인식 샘플링을 통해 재생하는 제약이 있는 후행 경험 재생 메커니즘을 도입하여 데이터 효율성을 향상시킨다.
  • 이중 최적화 접근법을 사용하여 제약를 처리하고, 정책 갱신이 쿼리 수준 또는 일일 수준의 노출 한도를 위반하지 않도록 보장한다.
  • 재정의된 비정책 학습을 활용하고 우선순위 기반 경험 재생을 적용하며, 재생 샘플링 단계에서 제약 검증을 추가하여 학습 안정성을 향상시킨다.

실험 결과

연구 질문

  • RQ1이중 수준 강화학습 프레임워크는 적응형 광고 노출에서 슬롯 할당과 광고 선택을 효과적으로 분리할 수 있는가?
  • RQ2제안된 방법은 쿼리 수준 및 일일 수준의 노출 제약를 충족하면서도 사용자 유지와 장기 수익을 얼마나 잘 유도할 수 있는가?
  • RQ3제약이 있는 후행 경험 재생 메커니즘이 얼마나 정책 학습 속도와 정책 성능 안정성 향상에 기여하는가?
  • RQ4다양한 제약 수준에서 기준 대비 기준 방법과 비교해 실제 전자상거래 데이터셋에서 이 방법의 성능은 어떠한가?
  • RQ5psCMDP 수식화 방식은 기존 비제약 강화학습 방법에 비해 더 나은 제약 준수와 최적화 효율성을 제공하는가?

주요 결과

  • 제안된 방법은 기준 방법보다 광고 수익을 향상시키면서도 쿼리 수준 및 일일 수준의 노출 제약를 엄격히 준수한다.
  • 제약이 있는 이중 수준 강화학습 프레임워크는 최적화 문제를 성공적으로 분리하여 더 안정적이고 효율적인 학습을 가능하게 한다.
  • 제약이 있는 후행 경험 재생 메커니즘이 정책 학습을 크게 가속화하고 정책 성능의 안정성을 향상시킨다.
  • 실제 전자상거래 데이터셋에서의 실험 결과, 다양한 제약 수준에서 수익과 제약 준수 성능이 일관되게 향상됨을 입증하였다.
  • 엄격한 제약 환경에서도 높은 성능을 유지함으로써, 실제 운영 환경에서의 강력한 내구성과 확장성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.