Skip to main content
QUICK REVIEW

[論文レビュー] Robust Dynamic Assortment Optimization in the Presence of Outlier Customers

Xi Chen, Akshay Krishnamurthy|arXiv (Cornell University)|Oct 9, 2019
Advanced Bandit Algorithms Research参考文献 19被引用数 8
ひとこと要約

本稿は、$\varepsilon$-汚染下における多項ロジット(MNL)モデルに対する、ロバストなオンラインアソートメント最適化ポリシーを提案する。ここで、割合$\varepsilon$の顧客が任意の選択を行うアウトライヤーである。アクティブな排除戦略を用いることで、アソートメント容量が一定の場合、$T$に関して対数的となる近似的最適なレグレットバウンドを達成する。また、$\varepsilon$の事前知識がなくても有効であり、シミュレーションでは非ロバストなUCBやトムソンサンプリングを上回る性能を示す。

ABSTRACT

We consider the dynamic assortment optimization problem under the multinomial logit model (MNL) with unknown utility parameters. The main question investigated in this paper is model mis-specification under the $\varepsilon$-contamination model, which is a fundamental model in robust statistics and machine learning. In particular, throughout a selling horizon of length $T$, we assume that customers make purchases according to a well specified underlying multinomial logit choice model in a $(1-\varepsilon)$-fraction of the time periods, and make arbitrary purchasing decisions instead in the remaining $\varepsilon$-fraction of the time periods. In this model, we develop a new robust online assortment optimization policy via an active elimination strategy. We establish both upper and lower bounds on the regret, and show that our policy is optimal up to logarithmic factor in $T$ when the assortment capacity is constant. %% capacity of assortments has a constant upper limit. We further develop a fully adaptive policy that does not require any prior knowledge of the contamination parameter $\varepsilon$. In the case of the existence a sub-optimality gap between optimal and sub-optimal products, we also established gap-dependent logarithmic regret upper bounds and lower bounds in both the known-$\varepsilon$ and unknown-$\varepsilon$ cases. Our simulation study shows that our policy outperforms the existing policies based on upper confidence bounds (UCB) and Thompson sampling.

研究の動機と目的

  • 標準的なMNL選択モデルから逸脱するアウトライヤー顧客によるモデル誤指定が、動的アソートメント最適化に与える影響を是正すること。
  • 割合$\varepsilon$の顧客が任意の購入を行うという悪意のある汚染が生じるオンライン学習設定において、ロバストな意思決定ポリシーを開発すること。
  • 既知および未知の$\varepsilon$の両状況下で、ギャップ依存解析を含めたタイトなレグレットバウンドを確立すること。
  • 汚染レベル$\varepsilon$の事前知識が不要な適応的ポリシーを設計すること。
  • 実験的に、提案手法が、$\varepsilon > 0$の状況下で非ロバストなベースライン(UCBやトムソンサンプリング)を上回ることを示すこと。

提案手法

  • 本稿は、MNLモデル下でのロバストな信頼区間に基づき、劣悪な製品を体系的に除外する、新しいアクティブな排除に基づくポリシーを導入する。
  • 顧客行動を、通常のMNL分布(通常の顧客)と任意の汚染分布(アウトライヤー)の混合としてモデル化し、汚染レベルを$\varepsilon$とする。
  • 汚染分布$Q_t$が時間とともに変化しても耐性を持つ信頼区間を計算するためのロバスト推定フレームワークを用いる。
  • 未知の$\varepsilon$の場合、汚染レベル$\varepsilon$の事前知識がなくても、観測データに基づいて動的に調整する完全な適応戦略を採用し、ダブリングテクニックと信頼区間の狭小化を用いる。
  • レグレット解析では、最適と劣悪なアイテムの間のサブ最適性ギャップが収束速度に影響することを考慮したギャップ依存バウンドを用いる。
  • 理論的保証として、上界と下界の両方のレグレットバウンドを確立し、アソートメント容量が一定の場合、$T$に関して対数的要因を除き近似的最適性を示す。

実験結果

リサーチクエスチョン

  • RQ1割合$\varepsilon$の顧客が、想定されたMNLモデルに従わず任意の選択を行う状況下でも、有効な動的アソートメント最適化ポリシーを設計できるか?
  • RQ2このような悪意のある汚染が存在するオンラインアソートメント最適化における、レグレットの根本的限界(下界)は何か?
  • RQ3ロバストなポリシーの性能は、最良製品と第二位製品との間のサブ最適性ギャップにどのように依存するか?
  • RQ4汚染レベル$\varepsilon$の事前知識がなくても、良好なレグレット性能を達成できる適応的ポリシーを開発できるか?
  • RQ5実際のアウトライヤー状況下で、提案されたロバストポリシーは、非ロバスト手法(UCB や トムソンサンプリング)と比較してどのように性能を示すか?

主な発見

  • 提案されたアクティブな排除ポリシーは、アソートメント容量が一定の場合、既知の$\varepsilon$設定下で$T$に関して対数的要因を除き最適なレグレットバウンドを達成する。
  • ギャップ依存的領域では、サブ最適性ギャップに応じて、レグレット上界が対数的になる。最適製品が著しく優れている場合、収束が速くなることが確認された。
  • 未知の$\varepsilon$の場合、適応的ポリシーは、既知の$\varepsilon$ポリシーと同等のオーダーのレグレットを達成し、汚染レベルの事前知識がなくてもロバストであることを示した。
  • シミュレーション結果では、$\varepsilon > 0$の状況下で、提案手法の平均レグレットはUCB や トムソンサンプリングよりも著しく低く(0.02〜0.06に安定)、時間の経過とともに減少する。
  • $\varepsilon = 0$の場合、提案手法はベースラインよりわずかに劣るが、平均レグレットの減少率は同じであり、汚染がない状況でも最小限のオーバーヘッドであることが示された。
  • 本手法は、時間的に変化するアウトライヤー分布$Q_t$に対してもロバストであるため、静的汚染モデルよりも実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。