Skip to main content
QUICK REVIEW

[论文解读] Safe Exploration for Identifying Linear Systems via Robust Optimization

Tyler Lu, Martin Zinkevich|arXiv (Cornell University)|Nov 30, 2017
Fault Detection and Control Systems参考文献 17被引用 3
一句话总结

本文提出了一种针对线性高斯系统安全探索的鲁棒优化框架,通过计算围绕一个名义安全动作的安全动作区域,实现高效且无故障的系统辨识。通过在动作空间中迭代扩展安全球体,并利用模型误差的PAC风格边界,该方法提升了样本效率——在较少样本下实现了更低的模型误差,相较于单球体探索表现更优。

ABSTRACT

Safely exploring an unknown dynamical system is critical to the deployment of reinforcement learning (RL) in physical systems where failures may have catastrophic consequences. In scenarios where one knows little about the dynamics, diverse transition data covering relevant regions of state-action space is needed to apply either model-based or model-free RL. Motivated by the cooling of Google's data centers, we study how one can safely identify the parameters of a system model with a desired accuracy and confidence level. In particular, we focus on learning an unknown linear system with Gaussian noise assuming only that, initially, a nominal safe action is known. Define safety as satisfying specific linear constraints on the state space (e.g., requirements on process variable) that must hold over the span of an entire trajectory, and given a Probably Approximately Correct (PAC) style bound on the estimation error of model parameters, we show how to compute safe regions of action space by gradually growing a ball around the nominal safe action. One can apply any exploration strategy where actions are chosen from such safe regions. Experiments on a stylized model of data center cooling dynamics show how computing proper safe regions can increase the sample efficiency of safe exploration.

研究动机与目标

  • 解决在未知物理系统中安全探索的挑战,其中不安全动作可能导致灾难性后果。
  • 在状态变量在整个轨迹上受安全约束的线性高斯动力学下,实现高效系统辨识。
  • 提供一种非贝叶斯、鲁棒的优化方法,可在无需动力学模型先验知识的情况下计算安全动作区域。
  • 通过在多个安全动作区域而非单一区域中扩展探索,提升安全探索的样本效率。
  • 在确保探索过程中全程安全的前提下,维持模型估计误差的理论边界。

提出的方法

  • 将安全性定义为在轨迹的每个时间步均满足状态变量的线性不等式约束,其动机源于工业过程控制。
  • 利用最小二乘参数估计的PAC风格边界,定义一个高概率包含真实系统的合理模型集合。
  • 通过求解鲁棒优化问题计算安全动作区域,以确保从任意初始状态出发的所有轨迹均保持在安全约束范围内。
  • 基于模型误差边界,通过迭代细化逐步在名义安全动作周围扩展安全动作球体。
  • 维持多个安全球体(最多14个),以扩大探索空间,每个球体根据理论模型误差的减小而更新。
  • 从选定的安全球体中均匀随机生成探索动作,实现在保持安全保证的同时收集多样化数据。

实验结果

研究问题

  • RQ1当仅已知一个名义安全动作时,如何系统地在线性高斯系统中执行安全探索?
  • RQ2在模型不确定性下,动作空间中最大安全区域是什么?该区域中任意动作序列均可保证轨迹安全。
  • RQ3与单区域探索相比,在多个安全动作区域中探索如何提升样本效率?
  • RQ4在探索过程中,是否可以在线计算模型估计误差的理论边界,同时保持安全性?
  • RQ5与单区域探索相比,采用多区域安全探索在多大程度上减少了达到目标模型精度所需的样本数量?

主要发现

  • 在20,000个样本后,多球体探索的理论模型误差为0.0224,实际误差为0.0045,优于单球体探索的0.0305和0.0075。
  • 多球体探索制度更快覆盖了动作空间的更大区域,由于样本效率提升,安全球体增长速度更快。
  • 理论模型误差被发现是对实际模型误差的保守估计,而实际误差在用于控制策略优化时本身也具有保守性。
  • 在50,000个样本后,安全球体的增长显著放缓,对应于模型误差降低的收益递减。
  • 通过在多个物理单元(如风机盘管)上并行探索,可显著加速实际系统辨识,将有效探索时间从约6.5天减少到其几分之一。
  • 该方法可在无需安全基线策略的情况下实现安全探索,使其适用于此类策略不可用的场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。