Skip to main content
QUICK REVIEW

[논문 리뷰] Log Barriers for Safe Black-box Optimization with Application to Safe Reinforcement Learning

Ilnura Usmanova, Yarden As|arXiv (Cornell University)|2022. 07. 21.
Stochastic Gradient Optimization Techniques인용 수 4
한 줄 요약

이 논문은 제약 조건을 만족시키기 위해 로그 바리어 근사에 기반한 적응형 스텝 사이즈를 사용하는 확률적 경사 하강법(LB-SGD)을 제안한다. 이 방법은 학습 중 제약 조건을 보장하면서 고차원 비볼록 문제에서 제로-오더 및 일阶 피드백을 활용해 효율적인 수렴을 달성하며, 기존의 안전한 베이지안 최적화 방법에 비해 더 낮은 샘플 및 계산 복잡도를 제공한다.

ABSTRACT

Optimizing noisy functions online, when evaluating the objective requires experiments on a deployed system, is a crucial task arising in manufacturing, robotics and many others. Often, constraints on safe inputs are unknown ahead of time, and we only obtain noisy information, indicating how close we are to violating the constraints. Yet, safety must be guaranteed at all times, not only for the final output of the algorithm. We introduce a general approach for seeking a stationary point in high dimensional non-linear stochastic optimization problems in which maintaining safety during learning is crucial. Our approach called LB-SGD is based on applying stochastic gradient descent (SGD) with a carefully chosen adaptive step size to a logarithmic barrier approximation of the original problem. We provide a complete convergence analysis of non-convex, convex, and strongly-convex smooth constrained problems, with first-order and zeroth-order feedback. Our approach yields efficient updates and scales better with dimensionality compared to existing approaches. We empirically compare the sample complexity and the computational cost of our method with existing safe learning approaches. Beyond synthetic benchmarks, we demonstrate the effectiveness of our approach on minimizing constraint violation in policy search tasks in safe reinforcement learning (RL).

연구 동기 및 목표

  • 제약 조건이 알려져 있지 않고 오직 노이즈가 섞인 측정값만 제공되는 고차원 스토케스틱 문제에 대해 확장 가능하고 안전한 최적화 방법을 개발하는 것.
  • 모든 최적화 반복이 항상 타당 영역 내에 머무르도록 보장하여 안전하지 않은 시스템 상호작용을 방지하는 것.
  • 기존의 안전한 베이지안 최적화 방법에 비해 고차원 환경에서 더 낮은 샘플 및 계산 복잡도를 달성하는 것.
  • 안전한 학습에서 제로-오더 및 일阶 피드백을 위한 통합 프레임워크를 제공하는 것.
  • 안전한 강화 학습 및 실제 정책 탐색 작업에서의 효과성을 입증하는 것.

제안 방법

  • LB-SGD는 제약 조건이 있는 최적화 문제의 로그 바리어 근사를 사용하여 최적화 과정 중 타당성을 보장한다.
  • 이 방법은 로그 바리어 목적 함수를 최소화하기 위해 적응형 스텝 사이즈 규칙을 적용한 확률적 경사 하강법을 사용한다.
  • 제로-오더 피드백의 경우, 무작위 방향과 노이즈를 사용한 유한 차분 기반의 제로-오더 경사 추정기를 적용한다.
  • 일阶 피드백의 경우, 직접적으로 노이즈가 섞인 경사 측정값을 SGD 업데이트에 사용한다.
  • 알고리즘은 바리어 함수의 구조를 통해 반복값이 타당 영역 내에 유지되도록 하여 안전성을 확보한다.
  • 부드럽고 리프시츠 조건을 가정할 때 비볼록, 볼록, 강하게 볼록 문제에 대해 수렴성을 분석한다.

실험 결과

연구 질문

  • RQ1제약 조건에 대한 사전 지식 없이도 학습 과정 전반에 걸쳐 타당성을 유지하는 안전한 최적화 방법을 설계할 수 있는가?
  • RQ2고차원 환경에서 LB-SGD의 샘플 및 계산 복잡도는 안전한 베이지안 최적화에 비해 어떻게 비교되는가?
  • RQ3노이즈가 섞인 함수 평가만으로도 비볼록 문제에서 정류점으로의 수렴을 달성할 수 있는가?
  • RQ4적응형 스텝 사이즈 선택은 블랙박스 최적화에서 수렴성과 제약 위반에 어떤 영향을 미치는가?
  • RQ5기존의 안전한 최적화 기반 방법에 비해 LB-SGD는 안전한 강화 학습 정책 탐색에서 어떻게 성능을 발휘하는가?

주요 결과

  • 부드럽고 리프시츠 조건을 만족할 경우, LB-SGD는 비볼록 문제에서 고확률로 정류점으로 수렴한다.
  • 특히 고차원에서 안전한 베이지안 최적화에 비해 더 나은 샘플 복잡도 스케일링을 보인다.
  • 데이터 포인트 수와 차원 수에 따라 계산 비용이 효율적으로 증가하며, 가우스 프로세스 방법의 세제곱 스케일링을 피한다.
  • 실험 결과, 기존 기반 방법에 비해 안전한 강화 학습 정책 탐색 과제에서 훨씬 낮은 제약 위반을 보였다.
  • 이론적 분석을 통해 로그 바리어 근사가 모든 반복값이 타당 영역 내에 머무르도록 보장하여 언제나 안전성을 보장함을 확인했다.
  • 적응형 스텝 사이즈 규칙이 합성 및 실제 기준 모두에서 더 빠른 수렴과 제약 위반 감소에 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.