Skip to main content
QUICK REVIEW

[論文レビュー] Decomposition Algorithms for Stochastic Programming on a Computational Grid

Jeff Linderoth, Stephen J. Wright|ArXiv.org|Jun 18, 2001
Risk and Portfolio Optimization参考文献 18被引用数 15
ひとこと要約

本稿では、再配置付き二段階確率的線形計画法に対して、非同期分解アルゴリズム(L字型法および信頼領域法)を提示する。これらのアルゴリズムは、動的かつ非均質な計算グリッド上でCondorシステムとMWランタイムライブラリを用いて実装されており、第二段階の部分問題を分散ワーカーに配分することにより、大規模問題のスケーラブルな解法を実現している。特に10^10以上の変数を有するstormG2インスタンスを解くことに成功し、非均質なハードウェアを有する機会的グリッド環境でも収束性と頑健性を示している。

ABSTRACT

We describe algorithms for two-stage stochastic linear programming with recourse and their implementation on a grid computing platform. In particular, we examine serial and asynchronous versions of the L-shaped method and a trust-region method. The parallel platform of choice is the dynamic, heterogeneous, opportunistic platform provided by the Condor system. The algorithms are of master-worker type (with the workers being used to solve second-stage problems, and the MW runtime support library (which supports master-worker computations) is key to the implementation. Computational results are presented on large sample average approximations of problems from the literature.

研究の動機と目的

  • 動的かつ非均質な計算グリッド上で、再配置付き二段階確率的線形計画法のためのスケーラブルで非同期の分解アルゴリズムを開発すること。
  • 第二段階の部分問題の解法を地理的に分散した機会的リソースに分散させることにより、大規模な確率的計画問題の効率的解法を可能にすること。
  • グリッドコンピューティング環境に一般的に見られる動的かつ不安定な条件においても、分解法の収束性と頑健性を保証すること。
  • 特に10^7件のシナリオを有するstormG2のような極めて大規模なサンプリング確率的計画問題を、グリッドベースの並列化によって実際に解くことの可能性と性能を示すこと。
  • MWライブラリとCondorを組み合わせた実用的で生産環境向けの実装フレームワークを提供すること。このフレームワークは、計算グリッド上でのマスターワーカー型確率的プログラミングを対象としている。

提案手法

  • L字型法は非同期実行に適応され、マスターが繰り返し第一段階問題を解き、各シナリオ固有の第二段階部分問題をワーカーに送信する。この際、双対解からの劣勾配情報が用いられる。
  • ℓ∞-ノルムに基づく信頼領域法が採用され、二次的正則化を用いて、ノイズや遅延のある劣勾配情報が存在する状況でも収束性を安定化させ、頑健性を向上させる。
  • MWランタイムライブラリにより、マスターワーカー間の通信およびタスクのグリッド全体への配布が可能となり、動的かつ利用可能なワーカーの変動や障害回復のためのチェックポイント機能をサポートする。
  • Condorシステムにより、複数の機関に所属するクラスタを含む非均質なマシン間でのジョブスケジューリングとリソース割り当てが管理され、動的負荷分散と空きリソースの機会的利用が実現される。
  • 決定的同等問題は、各イテレーションごとにN個の第二段階線形計画問題を独立して解くことで、期待再配置関数の評価を通じて暗黙的に解かれる。
  • 劣勾配情報は第二段階問題の双対解から得られ、各イテレーションで -T(ω_i)^T π(ω_i) が期待再配置関数の劣勾配を形成する。

実験結果

リサーチクエスチョン

  • RQ1動的かつ不安定なワーカーの利用可能性に直面しても、二段階確率的計画問題のための非同期分解アルゴリズムが収束性と頑健性を維持できるか。
  • RQ2L字型法および信頼領域法の性能は、速度や利用可能性が異なる多様なリソースを有する非均質的かつ機会的な計算リソース上でどのようにスケーリングされるか。
  • RQ3動的ワーカープールの構成変化やネットワーク遅延が、確率的プログラミングアルゴリズムの収束速度と解の品質に与える影響は何か。
  • RQ410^10以上の変数を有する大規模な確率的計画問題を、グリッドベースの分解によって実際に解くことは可能か。また、その際の計算ボトルネックは何か。
  • RQ5MWライブラリおよびCondorシステムが、実世界のグリッド環境における、障害耐性がありスケーラブルなマスターワーカー型確率的プログラミングワークロードの実行をどの程度サポートできるか。

主な発見

  • ℓ∞-ノルム正則化を用いた信頼領域法は、遅延やノイズのある劣勾配情報が存在する状況でも収束性と頑健性を示した。特に非均質なグリッド環境でも同様の性能を発揮した。
  • 10^7件のシナリオを有するstormG2問題は、決定的同等問題に10^10以上の変数を有し、32時間の計算後、最終的な目的関数値が15,526,740に達するまでに正常に解かれた。
  • 合計40,837のタスクが生成され、それに対応する第二段階線形計画問題が合計3.99×10^8件にのぼり、ピーク時には1秒あたり平均3,472件の問題が解かれた。
  • 最大556人のワーカーが12の機関にまたがって使用され、マシンの速度比が12:1に達した。累積CPU時間は9,014時間にのぼり、1年を超える連続計算に相当する。
  • 動的ワーカー利用状況にもかかわらず高いリソース利用率が達成され、同時に平均して433人のワーカーが常に稼働状態にあり、チェックポイントと手動再起動により障害からの回復が実現された。
  • 非同期実装により、ワーカーはマスターがブロッキングされている間でも独立して処理を進めることができ、待機時間を最小限に抑え、機会的グリッド環境における全体の効率性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。