Skip to main content
QUICK REVIEW

[論文レビュー] Semi-parametric dynamic contextual pricing

Virag Shah, José Blanchet|arXiv (Cornell University)|Jan 7, 2019
Advanced Bandit Algorithms Research参考文献 26被引用数 7
ひとこと要約

本稿では、購入/非購入という右打ち切りバイナリフィードバックから、パラメトリック回帰係数とノンパrametricな残差分布の両方を学習する半パラメトリックな動的コンテキスト価格設定アルゴリズムを提案する。アーム排除フレームワークと適応的価格セットを用いた無料の探索を活用することで、高次元の顧客および商品コンテキストを伴うリアルタイムの電子商取引環境におけるスケーラブルで効率的な収益最大化が可能となり、$\tfrac{1}{2}}$ のレグレットを達成する。これは最適である。

ABSTRACT

Motivated by the application of real-time pricing in e-commerce platforms, we consider the problem of revenue-maximization in a setting where the seller can leverage contextual information describing the customer's history and the product's type to predict her valuation of the product. However, her true valuation is unobservable to the seller, only binary outcome in the form of success-failure of a transaction is observed. Unlike in usual contextual bandit settings, the optimal price/arm given a covariate in our setting is sensitive to the detailed characteristics of the residual uncertainty distribution. We develop a semi-parametric model in which the residual distribution is non-parametric and provide the first algorithm which learns both regression parameters and residual distribution with $ ilde O(\sqrt{n})$ regret. We empirically test a scalable implementation of our algorithm and observe good performance.

研究の動機と目的

  • 購入/非購入というバイナリフィードバックのみが観測される電子商取引プラットフォームにおける収益最大化の動的価格設定の課題に対処すること。
  • 期待対数評価のコンテキスト(顧客および商品)との関係を、期待対数評価のためのパラメトリックモデルとしてモデル化する一方で、残差の不確実性をノンパラメトリックに扱うこと。
  • 右打ち切りフィードバック下で、パラメトリック係数とノンパラメトリック誤差分布の両方を同時に学習するアルゴリズムの開発。
  • 説明変数の次元および滑らかさパラメータに多項式的依存性を示す、$\tfrac{1}{2}}$ の最適なレグレットスケーリングを達成すること。
  • 実用的なオンラインプラットフォームへの導入を想定し、凸最適化に基づく半パラメトリック回帰を用いたスケーラブルな実装の設計。

提案手法

  • 説明変数の線形関数として期待対数評価をモデル化し、非負の評価を保証するとともに、効率的な推定を可能にする。
  • 予測値と実際の対数評価の差である残差誤差分布をノンパラメトリックに扱い、ノイズに関するパラメトリックな仮定を最小限に抑える。
  • 現在の説明変数ベクトルに依存する時刻に依存するアクティブ価格セットを用いたアーム排除アプローチを採用し、複数の価格選択肢における無料の探索を可能にする。
  • アクティブセットから一様に価格を選択する確率的方策を実装し、十分な探索を確保するとともに、レグレットの保証を維持する。
  • 凸最適化技術を活用して、スケーラブルな方法でパラメトリック成分とノンパラメトリック誤差分布の両方を推定する。
  • 濃度不等式と体積の上限に基づく理論的分析を用い、残差分布に最小限の仮定を置いた状態で、最小限の仮定のもとでレグレットバウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1右打ち切りフィードバックとノンパラメトリックな残差誤差分布が与えられた場合、最適なレグレットを達成できるか?
  • RQ2右打ち切りフィードバックを伴うコンテキストバンディット設定において、無料の探索をどのように活用すればレグレットを低減できるか?
  • RQ3限られたフィードバック下で、パラメトリックモデルの学習とノンパラメトリック誤差分布の推定との間に、最適なトレードオフは何か?
  • RQ4リアルタイムの電子商取引応用に実用的であると同時に、$\tfrac{1}{2}}$ のレグレットを維持できるスケーラブルなアルゴリズムを設計できるか?
  • RQ5滑らかさパラメータ$\tfrac{1}{2}}$ が、ノンパラメトリックノイズの存在下でレグレットスケーリングに与える影響は何か?

主な発見

  • 提案されたアルゴリズムは、時間枠$ n $に対して$ \tfrac{1}{2}} $のレグレットを達成しており、これは最適であり、このクラスの問題に対する下界と一致する。
  • レグレットは説明変数の次元$ d $および滑らかさパラメータ$ \tfrac{1}{2}} $に対して多項式的スケーリングを示しており、高次元のコンテキストに対して頑健であることが示された。
  • アルゴリズムは無料の探索を活用しており、1回の価格テストが複数の価格選択肢に関する情報を提供することで、学習効率が向上する。
  • 凸最適化に基づくスケーラブルな実装は、実験的に妥当性が確認され、シミュレートデータ上でも優れた性能を示した。
  • 理論的分析により、残差分布に最小限の仮定を置いた状態で、誤差および説明変数分布にややきつい正則性条件を除き、レグレットバウンドが成立することが確認された。
  • 敵対的説明変数およびサブガウスチアルサポートへの拡張について、同じレグレットスケーリングが保持されると予想され、i.i.d.仮定を超えた頑健性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。