[논문 리뷰] Dynamic Learning of Sequential Choice Bandit Problem under Marketing Fatigue
이 논문은 마케팅 피로를 모델링하기 위해 순차적 메시지 전달에서 사용자가 수락, 건너뛰기, 또는 기권할 수 있는 상황을 고려한 Sequential Choice Bandit (SC-Bandit) 문제를 제안한다. 저자들은 탐색과 이용의 균형을 이루는 동적 학습 알고리즘을 제안하여 $O(N\sqrt{T\log T})$의 리그레트 한계를 달성하며, 개인화를 위해 GLM-UCB를 활용해 사용자 맥락을 모델에 통합한다.
Motivated by the observation that overexposure to unwanted marketing activities leads to customer dissatisfaction, we consider a setting where a platform offers a sequence of messages to its users and is penalized when users abandon the platform due to marketing fatigue. We propose a novel sequential choice model to capture multiple interactions taking place between the platform and its user: Upon receiving a message, a user decides on one of the three actions: accept the message, skip and receive the next message, or abandon the platform. Based on user feedback, the platform dynamically learns users' abandonment distribution and their valuations of messages to determine the length of the sequence and the order of the messages, while maximizing the cumulative payoff over a horizon of length T. We refer to this online learning task as the sequential choice bandit problem. For the offline combinatorial optimization problem, we show that an efficient polynomial-time algorithm exists. For the online problem, we propose an algorithm that balances exploration and exploitation, and characterize its regret bound. Lastly, we demonstrate how to extend the model with user contexts to incorporate personalization.
연구 동기 및 목표
- 과도한 메시지 전달로 인한 사용자 기권과 플랫폼의 제재가 발생하는 순차적 디지털 메시징 환경에서 마케팅 피로 문제를 해결한다.
- 사용자 행동을 수락, 건너뛰기, 기권의 세 가지 행동으로 구성된 순차적 선택 과정으로 모델링하여 실제 사용자 참여 동역학을 반영한다.
- 누적 수익을 최대화하기 위해 시간이 지남에 따라 메시지 가치와 기권 분포를 동시에 학습하는 온라인 학습 프레임워크를 개발한다.
- 최적의 메시지 순서를 효율적으로 계산할 수 있도록 가능한 계산을 허용하는 오프라인 최적화 문제를 위한 효율적 알고리즘을 설계한다.
- 사용자 특성에 기반한 맥락을 통합하여 개인화된 메시지 순서를 수립하고 참여도를 향상시키는 모델을 확장한다.
제안 방법
- 사용자가 각 메시지 이후 수락, 건너뛰기, 기권 중 하나의 결정을 내리는 새로운 순차적 선택 모델을 제안하며, 보상과 기권에 따른 보상 손실을 고려한다.
- 오프라인 문제를 조합 최적화 문제로 공식화하고, 메시지 가치 대 기권 확률 비율에 기반한 근사 알고리즘을 사용해 다항식 시간 내에 해를 구할 수 있음을 증명한다.
- 시퀀스 전반에 걸쳐 메시지 가치와 기권 확률을 동시에 학습하는 온라인 탐색-이용 알고리즘을 설계한다.
- 온라인 알고리즘의 리그레트 한계를 $O(N\sqrt{T\log T})$로 도출하며, 여기서 $N$은 메시지 수이고 $T$는 시간 영역이다.
- 사용자 특성에 기반한 메시지 가치와 기권 확률를 모델링하기 위해 GLM-UCB 기반 알고리즘을 제안하여 맥락 기반 SC-Bandit 문제를 해결한다.
- 합성 실험을 통해 제안된 알고리즘을 탐색-이용 기반 벤치마크와 비교하여, 비맥락적 및 맥락적 환경 모두에서 뛰어난 성능을 보임을 입증한다.
실험 결과
연구 질문
- RQ1사용자가 마케팅 피로로 인해 기권할 수 있는 상황에서 플랫폼은 누적 수익을 극대화하기 위해 어떻게 메시지를 최적의 순서로 배치할 수 있는가?
- RQ2순차적 선택과 기권이 존재하는 상황에서 최적의 메시지 순서 선택 문제의 계산 복잡도는 어떻게 되는가?
- RQ3사용자 기권으로 인해 피드백이 차단되는 상황에서 온라인 학습 알고리즘이 탐색과 이용을 효과적으로 균형 잡을 수 있는가?
- RQ4순차적 선택 밴딧 환경에서 온라인 학습에 대해 이론적으로 확보할 수 있는 리그레트 한계는 무엇인가?
- RQ5사용자 고유의 맥락을 메시지 순서 정책에 통합하여 개인화와 성능 향상을 어떻게 달성할 수 있는가?
주요 결과
- 오프라인 순차적 선택 최적화 문제는 메시지 보상 대 기권 확률 비율에 기반한 근사 알고리즘을 통해 다항식 시간 내에 효율적으로 해결 가능하다.
- 제안된 온라인 알고리즘은 $O(N\sqrt{T\log T})$의 리그레트 한계를 달성하며, 이는 비선형이 아니고 시간이 지남에 따라 근사 최적 성능에 수렴함을 나타낸다.
- 비맥락적 실험에서는 제안된 알고리즘이 탐색-이용 기반 벤치마크보다 뚜렷이 뛰어난 성능을 보이며, 탐색 기간 동안 학습하는 Benchmark-2는 표준 탐색 전략보다 성능 향상을 보였다.
- 맥락적 환경에서는 GLM-UCB 기반 알고리즘이 개인화된 메시지 순서 정책에서 기존 기준 방법보다 뛰어난 리그레트 성능을 보였다.
- 모델은 피드백이 조기 기권으로 인해 차단되는 상황에서 순서가 늦어질수록 메시지 가치를 학습하는 데 어려움이 있음을 드러냈다. 이는 메시지의 진정한 가치를 추정하는 데 시간이 더 오래 걸림을 의미한다.
- 실증 결과는 피드백이 조기 기권으로 인해 불완전하더라도 알고리즘이 메시지 가치와 기권 분포를 효과적으로 학습함을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.