Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Knapsack Optimization Towards Efficient Multi-Channel Sequential Advertising

Xiaotian Hao, Zhaoqing Peng|arXiv (Cornell University)|2020. 06. 29.
Advanced Bandit Algorithms Research인용 수 9
한 줄 요약

이 논문은 예산 제약 하에 장기 누적 수익을 최대화하기 위해 다중 채널 순차 광고를 동적 배낭 문제로 공식화하는 이중 최적화 프레임워크인 MSBCB를 제안한다. 입찰 전략 학습과 예산 배분을 분리하고, 행동 공간 축소 및 이론적으로 보장된 보상 형상 조절을 통해 MSBCB는 타오바오에서 실시한 온라인 A/B 테스트에서 최신 기술 기준 대비 10.08% 수익 증가와 10.31% ROI 향상을 달성하였다.

ABSTRACT

In E-commerce, advertising is essential for merchants to reach their target users. The typical objective is to maximize the advertiser's cumulative revenue over a period of time under a budget constraint. In real applications, an advertisement (ad) usually needs to be exposed to the same user multiple times until the user finally contributes revenue (e.g., places an order). However, existing advertising systems mainly focus on the immediate revenue with single ad exposures, ignoring the contribution of each exposure to the final conversion, thus usually falls into suboptimal solutions. In this paper, we formulate the sequential advertising strategy optimization as a dynamic knapsack problem. We propose a theoretically guaranteed bilevel optimization framework, which significantly reduces the solution space of the original optimization space while ensuring the solution quality. To improve the exploration efficiency of reinforcement learning, we also devise an effective action space reduction approach. Extensive offline and online experiments show the superior performance of our approaches over state-of-the-art baselines in terms of cumulative revenue.

연구 동기 및 목표

  • 단기 수익에만 집중하는 기존 광고 시스템의 최적화되지 않은 성능을 해결하기 위해 장기적 사용자 전환 효과를 고려한 접근이 필요하다.
  • 누적 사용자 수준의 가치와 예산 제약 조건을 고려한 동적 배낭 문제로 순차적 다중 채널 광고 과정을 모델링하기 위해.
  • 입찰 및 예산 할당의 공동 최적화 문제를 해결하기 위해 해결 공간을 분해하여 이중 최적화 프레임워크로 전환함으로써 비가역적인 해결 공간을 줄이기 위해.
  • 하위 최적화에서 강화 학습의 효율성을 향상시키기 위해 행동 공간 축소 및 이론적으로 보장된 보상 형상 조절을 통해.
  • 실제 온라인 전자상거래 플랫폼에서의 오프라인 분석 및 대규모 온라인 A/B 테스트를 통해 프레임워크의 우수성을 실증적으로 검증하기 위해.

제안 방법

  • 다중 채널에서의 사용자 노출 횟수에 따라 각 사용자의 장기적 가치와 비용을 추정함으로써 순차 광고 문제를 동적 배낭 문제로 공식화한다.
  • 이중 최적화 프레임워크를 제안한다: 상위 수준은 사용자 간 예산 할당을 최적화하고, 하위 수준은 사용자별 최적의 입찰 정책을 학습한다.
  • 장기 누적 수익 최대화와 일치시키기 위해 하위 최적화의 강화 학습에 대해 이론적으로 보장된 최적 보상 함수를 유도한다.
  • 하위 최적화에서의 샘플 효율성 향상과 정책 학습 가속화를 위해 행동 공간 축소 기법을 도입한다.
  • 이중 단계 훈련 파이프라인을 구현한다: 첫 번째 단계는 축소된 행동 공간을 사용한 강화 학습을 통해 사용자별 입찰 정책을 학습하고, 두 번째 단계는 추정된 가치를 기반으로 전역 예산 할당을 최적화한다.
  • 프레임워크를 타오바오에 구현하여 사용자 수준의 가치 예측 기반 실시간 입찰 조정과 동적 예산 할당을 가능하게 한다.

실험 결과

연구 질문

  • RQ1다중 채널 순차 광고에서 입찰 및 예산 할당의 공동 최적화 문제를 효과적으로 해결하기 위해 이중 최적화 프레임워크가 해결 공간을 줄일 수 있는가?
  • RQ2장기적 사용자 전환 효과를 어떻게 모델링하고 최적화할 수 있으며, 이는 단기적 단일 단계 수익 최대화 방식을 능가할 수 있는가?
  • RQ3동적 광고 환경에서 장기 수익 최대화를 보장하는 이론적 근거를 가진 강화 학습의 보상 형상 조절 전략은 무엇인가?
  • RQ4행동 공간 축소 기법이 사용자별 입찰 정책 학습에서 샘플 효율성과 수렴 속도를 어느 정도 향상시키는가?
  • RQ5실제 운영 환경에서 제안된 프레임워크는 생산 기준 모델 대비 통계적으로 유의미한 수준의 누적 수익 및 ROI 향상을 달성하는가?

주요 결과

  • MSBCB는 생산 제어 모델인 크로스 엔트로피 메서드(Cross Entropy Method, CEM) 대비 10.08% 수익 상승과 10.31% ROI 향상을 기록하였다.
  • 프레임워크는 제어군 대비 전환율을 6.04% 향상시키고 페이지 뷰를 15.37% 증가시켜 더 넓은 사용자 참여도와 향상된 타겟팅 능력을 보여주었다.
  • 1억 3,580만 명의 사용자와 72,147개의 광고 항목을 대상으로 한 온라인 A/B 테스트를 통해 MSBCB가 실제 전자상거래 환경에서의 강건성과 확장성을 입증하였다.
  • 일일 ROI 향상 곡선은 CEM 기준 대비 일관되고 안정적인 성과 향상을 보이며 장기 전략의 효과성을 검증하였다.
  • 행동 공간 축소 기법은 샘플 효율성을 크게 향상시켜 하위 최적화의 강화 학습 구성 요소에서 더 빠른 수렴을 가능케 하였다.
  • 이론적 분석을 통해 하위 최적화에서 도출된 보상 함수가 예산 제약 조건 하에 최적의 장기 수익으로 수렴함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.