Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Dynamic Assortment Optimization in the Presence of Outlier Customers

Xi Chen, Akshay Krishnamurthy|arXiv (Cornell University)|2019. 10. 09.
Advanced Bandit Algorithms Research참고 문헌 19인용 수 8
한 줄 요약

이 논문은 다항 로짓(MNL) 모델에 대한 $\varepsilon$-오염 상황에서 강건한 온라인 어셈블리 최적화 정책을 제안한다. 여기서 $\varepsilon$의 비율을 차지하는 일부 고객은 임의의 선택을 한다. 활성 제거 전략을 사용함으로써, 정책은 조합 용량이 일정할 경우 $T$에 대해 로그 단위로 근사 최적의 손실 한계를 달성하며, $\varepsilon$에 대한 사전 지식이 없더라도 효과적으로 작동한다. 시뮬레이션 결과, 비강건한 UCB 및 톰슨 샘플링보다 우수한 성능을 보였다.

ABSTRACT

We consider the dynamic assortment optimization problem under the multinomial logit model (MNL) with unknown utility parameters. The main question investigated in this paper is model mis-specification under the $\varepsilon$-contamination model, which is a fundamental model in robust statistics and machine learning. In particular, throughout a selling horizon of length $T$, we assume that customers make purchases according to a well specified underlying multinomial logit choice model in a $(1-\varepsilon)$-fraction of the time periods, and make arbitrary purchasing decisions instead in the remaining $\varepsilon$-fraction of the time periods. In this model, we develop a new robust online assortment optimization policy via an active elimination strategy. We establish both upper and lower bounds on the regret, and show that our policy is optimal up to logarithmic factor in $T$ when the assortment capacity is constant. %% capacity of assortments has a constant upper limit. We further develop a fully adaptive policy that does not require any prior knowledge of the contamination parameter $\varepsilon$. In the case of the existence a sub-optimality gap between optimal and sub-optimal products, we also established gap-dependent logarithmic regret upper bounds and lower bounds in both the known-$\varepsilon$ and unknown-$\varepsilon$ cases. Our simulation study shows that our policy outperforms the existing policies based on upper confidence bounds (UCB) and Thompson sampling.

연구 동기 및 목표

  • 표준 MNL 선택 모델을 따르지 않는 이질 고객으로 인한 모델 잘못 지정 문제를 동적 어셈블리 최적화에서 해결하기 위해.
  • 일부 고객이 임의의 구매를 하는 등 악성 오염이 존재하는 온라인 학습 환경에서, 정책이 강건하게 작동하도록 하기 위해.
  • 알려진 $\varepsilon$와 알려지지 않은 $\varepsilon$ 모두에서 손실 한계를 엄밀하게 분석하고, 갭-의존 분석을 포함하기 위해.
  • 오염 수준 $\varepsilon$에 대한 사전 지식이 필요 없는 적응형 정책을 설계하기 위해.
  • 실증적으로 제안된 방법이 오염 상황에서 비강건한 기준 방법(Ub, 톰슨 샘플링 등)보다 뛰어난 성능을 보임을 보여주기 위해.

제안 방법

  • 논문은 MNL 모델 하에서 강건한 신뢰구간을 기반으로 하위 최적 제품을 체계적으로 제거하는 새로운 활성 제거 기반 정책을 도입한다.
  • 고객 행동을 일반적으로 잘 지정된 MNL 분포(일반 고객)와 임의의 오염 분포(이상 고객)의 혼합으로 모델링하며, 오염 수준은 $\varepsilon$로 설정한다.
  • 오염 분포 $Q_t$가 시간에 따라 변화하더라도 강건한 추정 프레임워크를 사용해 이에 저항하는 신뢰구간을 계산한다.
  • 알 수 없는 $\varepsilon$의 경우, 사전 지식 없이 관측된 데이터에 기반해 동적으로 조정되는 완전한 적응 전략을 사용하며, 두 배 증가 전략과 신뢰구간 강화를 활용한다.
  • 손실 분석은 갭-의존 한계를 활용하며, 최적과 하위 최적 제품 간의 하위 최적 갭이 수렴 속도에 영향을 준다.
  • 이론적 보장은 손실의 상한 및 하한을 통해 확립되며, 조합 용량이 일정할 경우 $T$에 대해 로그 단위로 근사 최적의 성능을 보임을 입증한다.

실험 결과

연구 질문

  • RQ1어떤 비율의 고객이 임의의 선택을 하며, 가정된 MNL 모델을 따르지 않을 때도 효과적인 동적 어셈블리 최적화 정책을 설계할 수 있는가?
  • RQ2이러한 악성 오염이 존재할 경우 온라인 어셈블리 최적화에서 손실의 기본 한계(하한)는 무엇인가?
  • RQ3강건한 정책의 성능은 최적과 두 번째로 좋은 제품 간의 하위 최적 갭에 따라 어떻게 달라지는가?
  • RQ4오염 수준 $\varepsilon$에 대한 사전 지식이 없이도 좋은 손실 성능을 달성할 수 있는 적응형 정책을 개발할 수 있는가?
  • RQ5실제 이상 고객 시나리오 하에서 제안된 강건한 정책이 비강건한 방법(Ub, 톰슨 샘플링 등)과 비교해 어떻게 성능을 내는가?

주요 결과

  • 알려진 $\varepsilon$ 설정 하에서 조합 용량이 일정할 경우 제안된 활성 제거 정책은 $T$에 대해 로그 단위로 최적의 손실 한계를 달성한다.
  • 갭-의존 영역에서는 하위 최적 갭에 따라 스케일링되는 로그 단위 손실 상한을 달성하며, 최적 제품이 현저히 우수할 경우 더 빠른 수렴을 확인한다.
  • 알 수 없는 $\varepsilon$의 경우, 적응형 정책는 알려진 $\varepsilon$ 정책와 동일한 순서의 손실 성능을 달성함으로써 오염 수준에 대한 사전 지식 없이도 강건함을 입증한다.
  • 시뮬레이션 결과, $\varepsilon > 0$일 경우 제안된 방법은 평균 손실이 0.02~0.06으로 UCB 및 톰슨 샘플링보다 훨씬 낮게 안정화되며, 시간 범위 $T$가 증가함에 따라 손실이 감소하는 반면, 기준 방법은 그렇지 않다.
  • $\varepsilon = 0$일 경우 제안된 방법은 기준 방법보다 略로 약간 열등하지만, 평균 손실 감소 속도는 동일하므로 오염이 없을 경우 최소한의 오버헤드를 유발한다.
  • 시간에 따라 변하는 이질 고객 분포 $Q_t$에 대해서도 강건하므로, 정적 오염 모델보다 더 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.