[논문 리뷰] Closing the Closed-Loop Distribution Shift in Safe Imitation Learning.
이 논문은 자원이 제한된 시스템을 위한 효율적이고 증명 가능한 안전성 보장이 있는 정책으로, 제어 리아프노프 또는 장벽 함수를 사용하는 최적화 기반 제어 정책을 품질 높은 정책으로 압축하는 새로운 온정책 일관성 학습 알고리즘인 CMILe를 제안한다. 확률적 혼합, 제약 조건이 있는 정책 최적화, 비선형 안정성 제어를 통합함으로써, CMILe는 폐쇄형 루프 분포 이탈을 해소하고, 작업 시간에 관계없이 안전성과 안정성 보장을 달성한다. 이는 인식 기반 입력을 사용하는 경우에도 마찬가지다.
Commonly used optimization-based control strategies such as model-predictive and control Lyapunov/barrier function based controllers often enjoy provable stability, robustness, and safety properties. However, implementing such approaches requires solving optimization problems online at high-frequencies, which may not be possible on resource-constrained commodity hardware. Furthermore, how to extend the safety guarantees of such approaches to systems that use rich perceptual sensing modalities, such as cameras, remains unclear. In this paper, we address this gap by treating safe optimization-based control strategies as experts in an imitation learning problem, and train a learned policy that can be cheaply evaluated at run-time and that provably satisfies the same safety guarantees as the expert. In particular, we propose Constrained Mixing Iterative Learning (CMILe), a novel on-policy robust imitation learning algorithm that integrates ideas from stochastic mixing iterative learning, constrained policy optimization, and nonlinear robust control. Our approach allows us to control errors introduced by both the learning task of imitating an expert and by the distribution shift inherent to deviating from the original expert policy. The value of using tools from nonlinear robust control to impose stability constraints on learned policies is shown through sample-complexity bounds that are independent of the task time-horizon. We demonstrate the usefulness of CMILe through extensive experiments, including training a provably safe perception-based controller using a state-feedback-based expert.
연구 동기 및 목표
- 자원이 제한된 하드웨어에 고주기 최적화 기반 안전 제어 정책을 구현하는 데 도전하는 데에 대비한다.
- 최적화 기반 제어기의 안전성과 안정성 보장을 카메라와 같은 풍부한 인지 입력을 사용하는 시스템으로 확장한다.
- 일관성 학습에서 전문가 정책을 모방할 때 발생하는 폐쇄형 루프 분포 이탈을 해결한다. 특히 정책 이탈으로 인한 분포 이탈 상황에서의 대응이 핵심이다.
- 작업 시간에 의존하지 않고도 증명 가능한 안전성과 안정성을 유지하는 샘플 효율적인 온정책 일관성 학습 알고리즘을 개발한다.
- 상태 피드백 기반 전문가와 동일한 안전 보장을 갖춘 인식 기반 제어기를 구현할 수 있도록 한다.
제안 방법
- CMILe 는 전문가 최적화 기반 제어기와 동일한 안전성과 안정성 제약 조건을 만족하는 학습된 정책을 보장하기 위해 제약 조건이 있는 정책 최적화 프레임워크를 사용한다.
- 샘플 효율성과 정책 압축 중 안정성을 향상시키기 위해 확률적 혼합 반복 학습을 통합한다.
- 비선형 안정성 제어 이론을 통합하여 훈련 중에 명시적으로 강제 적용되는 안정성 제약 조건을 정의한다.
- 일관성 학습 문제를 폐쇄형 루프 안정성과 안전성을 딱딱한 제약 조건으로 설정한 제약 최적화 문제로 공식화한다. 이는 보상으로서만 고려되는 것이 아니라, 핵심 조건으로서 작용한다.
- 정책 이탈 상황에서의 폐쇄형 루프 동역학을 모델링하여 전문가와 모방자 간의 분포 이탈을 최소화한다.
- 작업 시간에 의존하지 않는 샘플 복잡도 한계를 유도함으로써 장수행 작업에 대한 효율적인 훈련이 가능하도록 한다.
실험 결과
연구 질문
- RQ1고주기 최적화 기반 제어기의 안전성과 안정성 특성을 경량화되고 실행 시간 효율적인 정책으로 압축할 수 있는가?
- RQ2모방 정책이 전문가 정책에서 벗어날 때 발생하는 인식 기반 제어에서 폐쇄형 루프 분포 이탈을 어떻게 해결할 수 있는가?
- RQ3작업 시간에 의존하지 않고도 일관성 학습에서 증명 가능한 안전성과 안정성 보장을 달성할 수 있는가?
- RQ4비선형 안정성 제어는 분포 이탈 상황에서 정책의 안정성을 유지하기 위해 학습된 정책을 어떻게 제약 조건으로 설정하는가?
- RQ5확률적 혼합을 통합하면 안전 일관성 학습에서 샘플 효율성과 안정성은 어떻게 향상되는가?
주요 결과
- CMILe 는 상태 피드백 기반 전문가 제어기와 동일한 안전성과 안정성 보장을 갖춘 인식 기반 제어기를 성공적으로 학습시켰다.
- 작업 시간에 의존하지 않는 샘플 복잡도 한계를 달성하여 장수행 작업에 대한 확장성이 있음을 보여주었다.
- 비선형 안정성 제어 제약 조건을 통합함으로써 정책 이탈으로 인한 분포 이탈 상황에서도 안정성을 유지함을 입증했다.
- 이 방법은 폐쇄형 루프 분포 이탈을 효과적으로 해소하여, 풍부한 인지 입력을 사용하는 일관성 학습에서 안전성과 성능을 유지한다.
- 광범위한 실험을 통해 CMILe 는 일반 하드웨어에서 저비용 추론을 가능하게 하면서도 전문가 수준의 안전성을 유지함을 입증했다.
- 확률적 혼합의 사용은 특히 분포 이탈 상황에서 일관성 학습 과정의 수렴성과 안정성을 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.