Skip to main content
QUICK REVIEW

[論文レビュー] Safe and Adaptive Decision-Making for Optimization of Safety-Critical Systems: The ARTEO Algorithm

Buse Sibel Korkmaz, Marta Zagórowska|arXiv (Cornell University)|Nov 10, 2022
Advanced Bandit Algorithms Research被引用数 4
ひとこと要約

本稿では、不確実性下での安全で適応的なリアルタイム最適化のためのARTEOを提案する。マルチアームド・バンディット問題をガウス過程を用いて不確実性をモデル化する制約付き最適化問題として定式化し、信頼区間を用いて動的に探索を調整することで、安全性を確保しつつパフォーマンスを最適化する。2つの実世界の事例において、安全なUCBの変種よりも累積的リグレットが低かった。

ABSTRACT

We consider the problem of decision-making under uncertainty in an environment with safety constraints. Many business and industrial applications rely on real-time optimization to improve key performance indicators. In the case of unknown characteristics, real-time optimization becomes challenging, particularly because of the satisfaction of safety constraints. We propose the ARTEO algorithm, where we cast multi-armed bandits as a mathematical programming problem subject to safety constraints and learn the unknown characteristics through exploration while optimizing the targets. We quantify the uncertainty in unknown characteristics by using Gaussian processes and incorporate it into the cost function as a contribution which drives exploration. We adaptively control the size of this contribution in accordance with the requirements of the environment. We guarantee the safety of our algorithm with a high probability through confidence bounds constructed under the regularity assumptions of Gaussian processes. We demonstrate the safety and efficiency of our approach with two case studies: optimization of electric motor current and real-time bidding problems. We further evaluate the performance of ARTEO compared to a safe variant of upper confidence bound based algorithms. ARTEO achieves less cumulative regret with accurate and safe decisions.

研究の動機と目的

  • 重要なパrameterが未知であり、安全制約を厳密に守らなければならないリアルタイム最適化の課題に対処すること。
  • 安全でない意思決定を回避しつつ、パフォーマンス目標を最適化するため、探索と活用のバランスを適応的にとるアルゴリズムを開発すること。
  • ガウス過程による不確実性の定量化を、安全を高確率で保証する制約付き最適化フレームワークに統合すること。
  • 電動モーターの電流制御やリアルタイムオンライン入札などの産業応用において、この手法の有効性を実証すること。
  • 制約違反やリグレットを最小限に抑えながら最適化目標を維持する点で、既存の安全な探索アルゴリズムを上回ること。

提案手法

  • 安全制約とパフォーマンス制約を備えた制約付き数学的プログラミング問題としてマルチアームド・バンディット問題を定式化する。
  • 未知の報酬関数および制約関数をモデル化するためにガウス過程を用い、カーネル関数を用いて滑らかさの仮定を組み込む。
  • GPの事後分布からの分散推定値をコスト関数に組み込み、適応的探索ボーナスとして活用する。
  • GPの滑らかさ仮定に基づく信頼区間を用いて、高確率での安全保証を構築する。
  • 環境要件に応じて探索寄与を動的に調整し、専用の探索フェーズを必要とせずに安全を確保する。
  • 各ステップで、入札上限、ROIしきい値、非負制約を尊重する制約付きソルバを用いて最適化問題を解く。

実験結果

リサーチクエスチョン

  • RQ1別個の探索フェーズを必要とせずに、安全で適応的な探索を安全対象システムで達成できるか?
  • RQ2ガウス過程による不確実性の定量化をリアルタイム最適化に統合し、探索と活用のバランスを取ることは可能か?
  • RQ3アルゴリズムは、最適化目標(例:ROI、電流リファレンス)を維持しつつ、安全制約が一切違反されない程度にまで対応できるか?
  • RQ4実世界の応用において、ARTEOは安全なUCBベースのアルゴリズムの変種と比較して、性能と安全性の面で優れているか?
  • RQ5アルゴリズムは動的な環境要件に基づいて、その探索行動を適応的に変更できるか?

主な発見

  • ARTEOは、電動モーター電流最適化およびオンライン入札の両事例において、安全なUCBの変種よりも累積的リグレットが低かった。
  • オンライン入札実験では、ARTEOは安全基準を上回るROIを維持しながら、ベンチマークアルゴリズムよりも低い入札価格を設定した。
  • 両事例において制約違反を効果的に回避し、信頼区間を用いた高確率での安全保証を実証した。
  • ARTEOは動的に探索を適応させ、不要または危険な探索を回避しつつ、時間経過とともにパフォーマンスを改善した。
  • コスト関数にGPベースの不確実性を組み込むことで、別個の探索フェーズを必要とせずに効果的かつ安全な探索が可能になった。
  • シミュレーション結果から、iPinYouデータセットにおいてARTEOはベースラインアルゴリズムよりも高いROIと低いコストを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。