Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Exploration for Identifying Linear Systems via Robust Optimization

Tyler Lu, Martin Zinkevich|arXiv (Cornell University)|2017. 11. 30.
Fault Detection and Control Systems참고 문헌 17인용 수 3
한 줄 요약

이 논문은 선형 가우시안 시스템에서의 안전 탐색을 위한 강건 최적화 프레임워크를 제안하며, 명목상의 안전 행동 주변의 안전 행동 영역을 계산하여 실패 없는 효율적인 시스템 식별을 가능하게 한다. 모델 오차에 대한 PAC 스타일의 경계를 사용하면서 동작 공간에서 안전한 구역을 반복적으로 확장함으로써, 샘플 효율성을 향상시킨다. 이는 단일 구역 탐색 대비 더 적은 샘플로 낮은 모델 오차를 달성함으로써 실험적으로 입증되었다.

ABSTRACT

Safely exploring an unknown dynamical system is critical to the deployment of reinforcement learning (RL) in physical systems where failures may have catastrophic consequences. In scenarios where one knows little about the dynamics, diverse transition data covering relevant regions of state-action space is needed to apply either model-based or model-free RL. Motivated by the cooling of Google's data centers, we study how one can safely identify the parameters of a system model with a desired accuracy and confidence level. In particular, we focus on learning an unknown linear system with Gaussian noise assuming only that, initially, a nominal safe action is known. Define safety as satisfying specific linear constraints on the state space (e.g., requirements on process variable) that must hold over the span of an entire trajectory, and given a Probably Approximately Correct (PAC) style bound on the estimation error of model parameters, we show how to compute safe regions of action space by gradually growing a ball around the nominal safe action. One can apply any exploration strategy where actions are chosen from such safe regions. Experiments on a stylized model of data center cooling dynamics show how computing proper safe regions can increase the sample efficiency of safe exploration.

연구 동기 및 목표

  • 불안전한 행동이 치명적인 실패로 이어질 수 있는 알려지지 않은 물리적 시스템을 안전하게 탐색하는 문제에 대응한다.
  • 전체 궤적에 걸쳐 상태 변수에 대한 안전 제약 조건이 있는 선형 가우시안 동역학에서 효율적인 시스템 식별을 가능하게 한다.
  • 역학 모델에 대한 사전 지식이 필요 없는 비베이지안, 강건 최적화 접근법을 제공하여 안전 행동 영역을 계산한다.
  • 단일 영역 대신 다수의 안전 행동 영역을 통해 탐색 영역을 확장하여 안전 탐색의 샘플 효율성을 향상시킨다.
  • 탐색 과정 全 주기 동안 모델 추정 오차에 대한 이론적 경계를 유지하면서 안전성을 보장한다.

제안 방법

  • 산업 공정 제어에 기인한 동적 궤적의 모든 시간 단계에서 상태 변수에 대한 선형 부등식 제약 조건을 만족하는 것으로 안전성을 정의한다.
  • 최소 제곱 추정치에 대한 PAC 스타일의 경계를 사용하여 진짜 시스템이 높은 확률로 포함되는 타당한 모델 집합을 정의한다.
  • 모든 초기 상태에서 시작하는 궤적이 안전 제약 조건 내에 머무르도록 보장하는 강건 최적화 문제를 풀어 안전 행동 영역을 계산한다.
  • 모델 오차 경계에 기반한 반복적 정밀 조정을 통해 명목상의 안전 행동 주변의 안전 행동 영역을 점진적으로 확장한다.
  • 최대 14개까지의 안전한 구역을 유지하여 탐색 공간을 확장하며, 각 구역은 감소하는 이론적 모델 오차에 기반해 업데이트된다.
  • 선택된 안전한 구역에서 균일하게 랜덤으로 탐색 행동을 생성함으로써 다양한 데이터 수집을 가능하게 하면서도 안전 보장을 유지한다.

실험 결과

연구 질문

  • RQ1명목상의 안전 행동만 알려진 상태에서 선형 가우시안 시스템에서 체계적으로 안전 탐색을 수행할 수 있는 방법은 무엇인가?
  • RQ2모델 불확실성 하에서 어떤 행동 시퀀스도 궤적 안전성을 보장하는 동작 공간 내 최대 안전 영역은 무엇인가?
  • RQ3다수의 안전 행동 영역을 통해 탐색할 경우 단일 영역 탐색 대비 샘플 효율성이 어떻게 향상되는가?
  • RQ4안전 탐색 중에도 실시간으로 모델 추정 오차에 대한 이론적 경계를 계산할 수 있는가?
  • RQ5다수의 영역을 통한 안전 탐색은 목표 모델 정확도에 도달하기 위해 필요한 샘플 수를 얼마나 줄일 수 있는가?

주요 결과

  • 20,000개의 예제 이후 다중 구역 탐색은 이론적 모델 오차 0.0224와 실제 오차 0.0045를 달성했으며, 단일 구역 탐색의 0.0305와 0.0075를 초월했다.
  • 다중 구역 탐색에서는 더 넓은 동작 공간 영역을 더 빠르게 커버했으며, 샘플 효율성이 향상되어 안전 구역이 더 빠르게 확장되었다.
  • 이론적 모델 오차는 실제 오차보다 보수적인 추정치였으며, 제어 정책 최적화에 사용될 경우 자체적으로도 보수적인 추정이었다.
  • 50,000개의 예제 이후 안전 구역의 성장 속도가 크게 둔화되었으며, 이는 모델 오차 감소의 수익 감소 현상과 대응되었다.
  • 실제 시스템 식별은 병렬로 여러 물리적 단위(예: 팬코일)를 통해 탐색함으로써 가속화될 수 있으며, 이로 인해 효과적인 탐색 시간이 약 6.5일에서 그 일부로 감소한다.
  • 이 방법은 안전 기반 정책이 필요 없이도 안전 탐색을 가능하게 하여, 그러한 정책이 확보되지 않은 환경에도 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.