Skip to main content
QUICK REVIEW

[논문 리뷰] Safe and Adaptive Decision-Making for Optimization of Safety-Critical Systems: The ARTEO Algorithm

Buse Sibel Korkmaz, Marta Zagórowska|arXiv (Cornell University)|2022. 11. 10.
Advanced Bandit Algorithms Research인용 수 4
한 줄 요약

이 논문은 불확실성 하에서 안전한 핵심 시스템에서 실시간 최적화를 위한 안전하고 적응형 알고리즘인 ARTEO를 제안한다. 다중 손잡이 밴딧 문제를 가우시안 프로세스를 사용해 불확실성을 모델링하는 제약 최적화 문제로 재구성하며, 신뢰 구간을 통해 탐색을 동적으로 조정하여 안전성과 성능 최적화를 동시에 확보한다. 두 가지 실제 사례 연구에서 기존의 안전한 UCB 변종보다 더 낮은 누적 손실을 기록하였다.

ABSTRACT

We consider the problem of decision-making under uncertainty in an environment with safety constraints. Many business and industrial applications rely on real-time optimization to improve key performance indicators. In the case of unknown characteristics, real-time optimization becomes challenging, particularly because of the satisfaction of safety constraints. We propose the ARTEO algorithm, where we cast multi-armed bandits as a mathematical programming problem subject to safety constraints and learn the unknown characteristics through exploration while optimizing the targets. We quantify the uncertainty in unknown characteristics by using Gaussian processes and incorporate it into the cost function as a contribution which drives exploration. We adaptively control the size of this contribution in accordance with the requirements of the environment. We guarantee the safety of our algorithm with a high probability through confidence bounds constructed under the regularity assumptions of Gaussian processes. We demonstrate the safety and efficiency of our approach with two case studies: optimization of electric motor current and real-time bidding problems. We further evaluate the performance of ARTEO compared to a safe variant of upper confidence bound based algorithms. ARTEO achieves less cumulative regret with accurate and safe decisions.

연구 동기 및 목표

  • 주요 매개변수가 미지수이며 안전 제약 조건을 엄격히 준수해야 하는 실시간 최적화 문제를 해결하기 위해.
  • 탐색과 이용의 균형을 적응적으로 유지하여 위험한 결정을 피하면서 성능 목표를 최적화하기 위해.
  • 가우시안 프로세스를 통한 불확실성 측정을 제약 최적화 프레임워크에 통합하여 고확률로 안전성을 보장하기 위해.
  • 전기 모터 전류 제어 및 실시간 온라인 입찰과 같은 산업 적용 사례에서 접근 방식의 유효성을 입증하기 위해.
  • 제약 위반과 손실를 최소화하면서도 최적화 목표를 유지하는 것에서 기존의 안전 탐색 알고리즘을 능가하기 위해.

제안 방법

  • 안전성 및 성능 제약 조건을 갖춘 제약 최적화 문제로 다중 손잡이 밴딧 문제를 재구성한다.
  • 알 수 없는 보상 함수 및 제약 함수를 모델링하기 위해 가우시안 프로세스를 사용하며, 커널 함수를 통해 규칙성 가정을 표현한다.
  • GP 사후 분포에서 유도된 분산 추정치를 비용 함수에 포함시켜 적응형 탐색 보너스를 도입한다.
  • GP 규칙성 가정에서 유도된 신뢰 구간을 활용해 고확률 안전 보장을 구성한다.
  • 환경 요구 조건에 따라 탐색 기여도를 동적으로 조정하여 전용 탐색 단계 없이도 안전성을 확보한다.
  • 매 단계에서 입찰 한도, ROI 기준, 비음성 제약 조건을 준수하는 제약 최적화 솔버를 사용해 문제를 해결한다.

실험 결과

연구 질문

  • RQ1전용 탐색 단계 없이도 안전하고 적응형 탐색을 실현할 수 있는가?
  • RQ2가우시안 프로세스를 통한 불확실성 측정을 실시간 최적화에 통합하여 탐색과 이용의 균형을 어떻게 달성할 수 있는가?
  • RQ3알고리즘이 제약 조건 위반을 절대 허용하지 않으면서 최적화 목표(예: ROI, 전류 기준값)를 얼마나 잘 유지할 수 있는가?
  • RQ4실제 적용 사례에서 ARTEO는 UCB 기반 알고리즘의 안전 변종 대비 성능과 안전성 면에서 어떻게 비교되는가?
  • RQ5알고리즘이 동적인 환경 요구 조건에 따라 탐색 행동을 적응적으로 조정할 수 있는가?

주요 결과

  • ARTEO는 전기 모터 전류 최적화 및 온라인 입찰 사례 연구 모두에서 안전한 UCB 변종보다 낮은 누적 손실을 기록하였다.
  • 온라인 입찰 실험에서 ARTEO는 안전 기준을 충족시키면서도 벤치마크 알고리즘보다 낮은 입찰 가격을 설정하였다.
  • 두 사례 연구 모두에서 제약 위반을 성공적으로 방지하였으며, 신뢰 구간을 통한 고확률 안전 보장을 입증하였다.
  • ARTEO는 탐색을 동적으로 조정하여 불필요하거나 위험한 탐색을 피하면서도 시간이 지남에 따라 성능을 향상시켰다.
  • 비용 함수에 GP 기반 불확실성 요소를 통합함으로써 전용 탐색 단계 없이도 효과적이고 안전한 탐색이 가능했다.
  • 시뮬레이션 결과, iPinYou 데이터셋에서 ARTEO는 기준 알고리즘 대비 더 높은 ROI와 더 낮은 비용을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.