Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Model Selection Framework: An Application to Airline Pricing

Naman Shukla, Arinbjörn Kolbeinsson|arXiv (Cornell University)|2019. 05. 21.
Advanced Bandit Algorithms Research참고 문헌 11인용 수 3
한 줄 요약

이 논문은 다중 손잡이 밴딧 설정에서 톰슨 샘플링을 사용하여 실시간으로 항공사 고객을 가장 잘 성과를 내는 부가가격 설정 모델로 동적으로 라우팅하는 적응형 메타결정 프레임워크를 제안한다. 지속적으로 온라인 반응에서 학습함으로써, 무작위 모델 선택 대비 평균 오퍼당 수익을 43% 향상시키고 전환율을 58% 향상시켰으며, 다양한 고객 맥락에서 어떤 단일 모델보다도 뛰어난 성능을 보였다.

ABSTRACT

Multiple machine learning and prediction models are often used for the same prediction or recommendation task. In our recent work, where we develop and deploy airline ancillary pricing models in an online setting, we found that among multiple pricing models developed, no one model clearly dominates other models for all incoming customer requests. Thus, as algorithm designers, we face an exploration - exploitation dilemma. In this work, we introduce an adaptive meta-decision framework that uses Thompson sampling, a popular multi-armed bandit solution method, to route customer requests to various pricing models based on their online performance. We show that this adaptive approach outperform a uniformly random selection policy by improving the expected revenue per offer by 43% and conversion score by 58% in an offline simulation.

연구 동기 및 목표

  • 모든 고객 맥락에서 항상 다른 모델보다 뛰어나지 않는 다수의 모델이 존재하는 온라인 항공사 부가가격 설정에서 탐색-이용 딜레마를 해결하기 위해.
  • 실시간으로 고객 요청을 가장 효과적인 가격 설정 모델로 적응적으로 라우팅하여 수익 및 전환율 지표를 향상시키기 위해.
  • 정적 오프라인 지표에 의존하지 않고도 확장 가능한 데이터 기반의 동적 모델 선택을 가능하게 하는 스케일러블한 메타결정 프레임워크를 개발하기 위해.
  • 향후 온라인 추천 및 가격 설정 시스템에 문맥 기반 다중 손잡이 밴딧 방법을 도입하기 위한 기반을 마련하기 위해.

제안 방법

  • 각 모델가 다중 손잡이 밴딧 프레임워크 내의 '손'으로 간주되며, 각 손은 별개의 기계학습 가격 설정 모델에 해당한다.
  • 성능의 사후 분포를 기반으로 확률적으로 모델을 선택함으로써 탐색과 이용을 균형 있게 유지하기 위해 톰슨 샘플링을 사용한다.
  • 실시간 고객 반응(구매/비구매)을 기반으로 각 모델의 전환 확률에 대한 사후 믿음을 유지하며, 베타-이항 공액 사전을 사용한다.
  • 시스템은 자동으로 성능이 열악한 모델의 트래픽을 줄임으로써 능동 학습을 지원하며, 탐색 기간 동안 수익 손실을 최소화한다.
  • 고객 특성(예: 여행 유형, 노선 등)을 통합함으로써 프레임워크를 문맥 기반 밴딧으로 확장한다.
  • 실제 항공사 데이터를 사용하여 성능을 평가하기 위해 시뮬레이션 환경을 구축하며, 오퍼당 수익 및 전환율을 측정한다.

실험 결과

연구 질문

  • RQ1동적 항공사 부가가격 설정 환경에서 적응형 라우팅 메커니즘이 무작위 또는 고정된 모델 선택보다 뛰어나게 작동할 수 있는가?
  • RQ2톰슨 샘플링 기반의 모델 선택은 온라인 환경에서 오퍼당 수익 및 전환율과 같은 비즈니스 지표를 어떻게 향상시키는가?
  • RQ3메타결정 프레임워크는 정적 또는 규칙 기반 라우팅 대비 모델 탐색 중 수익 손실을 어느 정도 줄일 수 있는가?
  • RQ4프레임워크는 비정적 환경과 문맥 기반 고객 특성을 처리하도록 확장할 수 있는가?
  • RQ5경계 기반 샘플링 및 동시성(concurrence)의 통합은 실시간 구현에서 강건성과 성능을 어떻게 향상시키는가?

주요 결과

  • 오프라인 시뮬레이션에서 적응형 모델 선택 프레임워크는 균일한 무작위 모델 선택 정책 대비 평균 오퍼당 예상 수익을 43% 향상시켰다.
  • 프레임워크는 랜덤 기준선 대비 전환 점수를 58% 향상시켜 고객 반응율 향상에서 뚜렷한 성과를 보였다.
  • 동적 라우팅을 통해 맥락 기반 모델 강점을 적응적으로 반영함으로써, 고립된 단일 모델보다도 더 뛰어난 종합 성능을 달성했다.
  • 톰슨 샘플링은 탐색과 이용을 효과적으로 균형 잡아 장기적 회귀를 줄이고, 열악한 모델 사용으로 인한 수익 손실을 최소화했다.
  • 시스템은 시간이 지남에 따라 성능이 열악한 모델의 가중치를 자동으로 낮춰 탐색 단계 동안 수익을 보호했다.
  • 프레임워크는 문맥 기반 밴딧으로 확장 가능하며, 향후 경계 기반 샘플링 및 동시성 통합을 지원하여 강건성을 향상시킬 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.