Skip to main content
QUICK REVIEW

[論文レビュー] Approximation Algorithms for Correlated Knapsacks and Non-Martingale Bandits

Anupam Gupta, Ravishankar Krishnaswamy|arXiv (Cornell University)|Feb 18, 2011
Optimization and Search Problems参考文献 8被引用数 16
ひとこと要約

本稿では、相関する報酬とサイズを伴う確率的ナップサック問題およびマルティングルール性を満たさない予算学習問題に対する、初めての定数倍近似アルゴリズムを提示する。時間インデックス付き線形計画法の緩和と、ギャップフィルディングおよび暗黙の戦略木を用いた分解ベースのラウンド法を導入し、性能保証付きの適応的かつ確率的なスケジューリング方針に分数解を変換する。

ABSTRACT

In the stochastic knapsack problem, we are given a knapsack of size B, and a set of jobs whose sizes and rewards are drawn from a known probability distribution. However, we know the actual size and reward only when the job completes. How should we schedule jobs to maximize the expected total reward? We know O(1)-approximations when we assume that (i) rewards and sizes are independent random variables, and (ii) we cannot prematurely cancel jobs. What can we say when either or both of these assumptions are changed? The stochastic knapsack problem is of interest in its own right, but techniques developed for it are applicable to other stochastic packing problems. Indeed, ideas for this problem have been useful for budgeted learning problems, where one is given several arms which evolve in a specified stochastic fashion with each pull, and the goal is to pull the arms a total of B times to maximize the reward obtained. Much recent work on this problem focus on the case when the evolution of the arms follows a martingale, i.e., when the expected reward from the future is the same as the reward at the current state. What can we say when the rewards do not form a martingale? In this paper, we give constant-factor approximation algorithms for the stochastic knapsack problem with correlations and/or cancellations, and also for budgeted learning problems where the martingale condition is not satisfied. Indeed, we can show that previously proposed LP relaxations have large integrality gaps. We propose new time-indexed LP relaxations, and convert the fractional solutions into distributions over strategies, and then use the LP values and the time ordering information from these strategies to devise a randomized adaptive scheduling algorithm. We hope our LP formulation and decomposition methods may provide a new way to address other correlated bandit problems with more general contexts.

研究の動機と目的

  • 報酬とサイズが相関する場合、およびジョブのキャンセルが許可される場合の確率的ナップサック問題に対処すること。これは、先行研究の定数倍近似が失敗する設定である。
  • マルティングルール性が成り立たない場合の予算学習問題に近似技法を拡張すること。これは先行研究で一般的に仮定されていた条件である。
  • 相関性や非マルティングルール性がある場合に、既存のLP緩和の大きな整数性ギャップを克服するため、新しい時間インデックス付きLP定式化を導入すること。
  • ギャップフィルディングと暗黙の戦略木を用いた構築により、多項式時間で動作する確率的適応的アルゴリズムを設計し、定数倍近似を達成すること。
  • 本研究で取り上げた問題の範囲を越えて、より広範な相関バンディット問題のクラスに適用可能な一般枠組みを提供すること。

提案手法

  • 相関する確率的ナップサック問題および予算学習問題における時間的依存性と状態遷移を捉える、新しい時間インデックス付き線形計画法の緩和を提案する。
  • 分数LP解を適応的戦略の確率分布に変換するための分解と「ギャップフィルディング」技術を導入し、実行可能性と性能保証を確保する。
  • 指数的爆発を避けるために、コンactな戦略DAG(D)から必要に応じて経路を生成する暗黙の戦略木表現(DT)を設計する。
  • 完全な木走査をエミュレートするが、直接DAG上で動作する暗黙のシミュレーションアルゴリズム(ImplicitPlay)を用いる。これにより、時間と状態情報を動的に維持できる。
  • 分数解からの時間順序とLP値を活用して、確率的適応的スケジューリング意思決定をガイドし、期待報酬が最適解の定数倍以内に収まるようにする。
  • 暗黙のアルゴリズムと完全な木ベースのシミュレーション(ImplicitFill)との等価性を証明し、定理5.5により正しさと定数倍近似を確立する。

実験結果

リサーチクエスチョン

  • RQ1報酬とサイズが相関する確率的ナップサック問題に対して、定数倍近似アルゴリズムを設計することは可能か?
  • RQ2相関性やキャンセル可能な確率的ナップサック問題に対して、既存のLP緩和の性能は何か?また、それらを改善できるか?
  • RQ3マルティングルール性が成り立たない予算学習問題に、近似アルゴリズムを拡張することは可能か?
  • RQ4時間インデックス付きLP緩和をどのように構築すれば、不確実性と相関性下での適応的意思決定をモデル化できるか?
  • RQ5指数的に大きな戦略木を明示的に構築せずに、適応的戦略を効率的にシミュレートすることは可能か?

主な発見

  • 本稿は、報酬とサイズが相関する確率的ナップサック問題に対する、初めての定数倍近似アルゴリズムを提示し、先行手法の制限を克服した。
  • 相関性や非マルティングルール性が存在する場合、確率的ナップサックおよび予算学習問題に対する既存のLP緩和は、大きな整数性ギャップを示す。
  • 提案された時間インデックス付きLP緩和は、適応的意思決定における時間的および状態依存的依存性を捉えることで、定数倍近似を達成する。
  • ギャップフィルディングと分解アプローチにより、分数LP解を損失が有界な適応的戦略の確率分布に効果的に変換できた。
  • 暗黙の戦略木構築により、明示的な列挙を伴わずに、多項式時間で適応的方針のシミュレーションが可能となり、正しさと性能保証を維持した。
  • 最終的なアルゴリズムであるImplicitPlayは、多項式時間で実行され、コンパクトなDAG表現を用いて必要な時点で完全な戦略木をオンデマンドでシミュレートすることで、定数倍近似を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。