[论文解读] Adaptive Model Selection Framework: An Application to Airline Pricing
本文提出一种基于多臂老虎机设置中Thompson采样的自适应元决策框架,以实时动态地将航空客户路由至表现最佳的附加定价模型。通过持续学习在线响应,该框架使每项报价的收入提升43%,转化率提升58%,相比随机模型选择表现更优,且在多样化客户情境下优于任何单一模型。
Multiple machine learning and prediction models are often used for the same prediction or recommendation task. In our recent work, where we develop and deploy airline ancillary pricing models in an online setting, we found that among multiple pricing models developed, no one model clearly dominates other models for all incoming customer requests. Thus, as algorithm designers, we face an exploration - exploitation dilemma. In this work, we introduce an adaptive meta-decision framework that uses Thompson sampling, a popular multi-armed bandit solution method, to route customer requests to various pricing models based on their online performance. We show that this adaptive approach outperform a uniformly random selection policy by improving the expected revenue per offer by 43% and conversion score by 58% in an offline simulation.
研究动机与目标
- 解决在线航空附加定价中的探索-利用困境,即在所有客户情境下均无单一模型能持续优于其他模型。
- 通过实时自适应地将客户请求路由至最有效的定价模型,提升收入和转化率指标。
- 开发一种可扩展的元决策框架,实现实时、数据驱动的模型选择,而无需依赖静态离线指标。
- 为未来在在线推荐和定价系统中部署上下文多臂老虎机方法奠定基础。
提出的方法
- 将模型视为多臂老虎机框架中的“臂”,每条臂对应一个独立的机器学习定价模型。
- 使用Thompson采样通过基于性能后验分布的随机选择来平衡探索与利用。
- 系统使用Beta-二项分布共轭先验,持续维护各模型转化概率的后验信念,并根据实时客户响应(购买/未购买)进行更新。
- 通过自动减少对表现较差模型的流量,实现主动学习,从而在探索过程中最小化收入损失。
- 通过引入客户特定特征(如出行类型、航线等)将方法扩展至上下文老虎机,以提高路由精度。
- 构建仿真环境,利用真实航空数据评估性能,测量每项报价的收入和转化率。
实验结果
研究问题
- RQ1自适应路由机制是否能在动态航空附加定价中优于随机或固定模型选择?
- RQ2基于Thompson采样的模型选择在在线环境中如何提升收入每项报价和转化率等业务指标?
- RQ3与静态或基于规则的路由相比,元决策框架在模型探索期间能在多大程度上减少收入损失?
- RQ4该框架能否扩展以处理非平稳环境和上下文客户特征?
- RQ5谨慎采样和一致性机制的引入如何提升实际部署中的鲁棒性和性能?
主要发现
- 在离线模拟中,与均匀随机模型选择策略相比,自适应模型选择框架使每项报价的预期收入提升了43%。
- 与随机基线相比,该框架使转化率得分提高了58%,显著提升了客户响应率。
- 由于能够根据情境特定的模型优势动态路由,该方法的整体性能优于任何单一模型。
- Thompson采样有效平衡了探索与利用,减少了长期遗憾,并最小化了因使用次优模型造成的收入损失。
- 系统会随时间自动降低表现较差模型的权重,从而在探索阶段保护收入。
- 该框架可扩展至上下文老虎机,并支持未来集成谨慎采样和一致性机制以增强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。