Skip to main content
QUICK REVIEW

[논문 리뷰] MESA: Offline Meta-RL for Safe Adaptation and Fault Tolerance

Michael Luo, Ashwin Balakrishna|arXiv (Cornell University)|2021. 12. 07.
Anomaly Detection Techniques and Applications인용 수 5
한 줄 요약

MESA는 다양한 오프라인 데이터셋을 통해 환경 간 안전 지식을 전이하는 오프라인 메타-강화학습 프레임워크를 제안하며, 새로운 환경에서 미리 보지 못한 동역학을 빠르게 적응시켜 위험 측정치를 조정한다. 최소한의 테스트 데이터로 메타학습한 안전 비평가를 미세조정함으로써 MESA는 시뮬레이션에서 5개의 연속 제어 도메인 전반에서 제약 위반을 최대 50% 감소시키면서도 작업 성능을 유지한다.

ABSTRACT

Safe exploration is critical for using reinforcement learning (RL) in risk-sensitive environments. Recent work learns risk measures which measure the probability of violating constraints, which can then be used to enable safety. However, learning such risk measures requires significant interaction with the environment, resulting in excessive constraint violations during learning. Furthermore, these measures are not easily transferable to new environments. We cast safe exploration as an offline meta-RL problem, where the objective is to leverage examples of safe and unsafe behavior across a range of environments to quickly adapt learned risk measures to a new environment with previously unseen dynamics. We then propose MEta-learning for Safe Adaptation (MESA), an approach for meta-learning a risk measure for safe RL. Simulation experiments across 5 continuous control domains suggest that MESA can leverage offline data from a range of different environments to reduce constraint violations in unseen environments by up to a factor of 2 while maintaining task performance. See https://tinyurl.com/safe-meta-rl for code and supplementary material.

연구 동기 및 목표

  • 온라인 상호작용이 비용이 많이 드는 실패를 초래할 수 있는 위험 감수성 있는 강화학습 환경에서의 위험한 탐색 문제를 해결하기 위해.
  • 부분적인 액추에이터 고장이나 시스템 파rameter의 변화와 같이 이전에 보지 못한 동역학을 가진 새로운 환경에서의 안전한 적응을 가능하게 하기 위해.
  • 다양한 훈련 환경에서의 오프라인 데이터셋을 활용하여 온라인 상호작용에 대한 의존도를 줄이고 위험 측정치를 학습하기 위해.
  • 테스트 단계에서 작업 특화 데이터가 필요 없이 환경 간 안전 지식을 전이할 수 있는 방법을 개발하기 위해.
  • 미래의 환경에서의 적응 과정 동안 제약 위반을 최소화하면서도 높은 작업 성능을 유지하기 위해.

제안 방법

  • MESA는 다양한 동역학을 가진 다수의 훈련 환경에서의 오프라인 데이터셋을 기반으로 메타학습을 수행하는 오프라인 메타-강화학습 문제로 안전한 강화학습을 공식화한다.
  • 다양한 환경에서 제약 위반의 위험을 추정하는 전이 가능한 안전 비평가 $Q^{\text{risk}}_{\pi}$를 메타학습한다.
  • 적응 단계에서는 새로운 환경에서 이전에 보지 못한 동역학을 가진 소량의 오프라인 테스트 데이터를 사용하여 메타학습한 안전 비평가를 미세조정한다.
  • 적응된 안전 비평가는 복구 정책과 함께 사용되어, 테스트 환경에서 안전한 온라인 학습을 가능하게 하며, 이는 복구 강화학습 파라다임을 따르는 것이다.
  • 위험 추정치를 다양한 환경 간에 정렬하고 분포 외 동역학으로의 일반화를 향상시키기 위해 대조 학습 목표를 활용한다.
  • 작업 수익과 위험을 동시에 예측하기 위해 다중 헤드 네트워크 아키텍처를 사용하여 공유 표현을 활용한 엔드 투 엔드 훈련을 가능하게 한다.

실험 결과

연구 질문

  • RQ1오프라인 메타-강화학습이 다양한 환경에서의 안전 지식을 전이하여, 새로운 환경에서 이전에 보지 못한 동역학을 빠르게 적응시킬 수 있는가?
  • RQ2제약 위반을 최소화하면서 효과적인 안전 적응을 가능하게 하기 위해 테스트 데이터는 얼마나 작아질 수 있는가?
  • RQ3다른 기준 방법에 비해 MESA는 부분적인 관절 고장과 같은 상당히 다른 동역학을 가진 환경으로의 일반화 성능이 얼마나 우수한가?
  • RQ4적응 과정에서 제약 위반을 줄이면서도 MESA가 작업 성능을 얼마나 잘 유지하는가?
  • RQ5MESA는 테스트 환경에서 온라인 상호작용이나 작업 특화 데이터 없이도 안전한 적응을 달성할 수 있는가?

주요 결과

  • MESA는 최소한의 테스트 데이터로도 이전의 오프라인 강화학습 방법보다 제약 위반을 최대 2배까지 감소시킨다.
  • 메타학습 기반의 안전 비평가를 통해 다중 작업 학습 기반 방법에 비해 안전성과 샘플 효율성 측면에서 뛰어난 성능을 유지하면서도 높은 작업 성능을 유지한다.
  • MESA는 부분적인 관절 고장이 발생한 환경으로의 일반화가 효과적으로 이루어지며, 다중 작업 학습 방법에 비해 뛰어난 성능과 더 적은 제약 위반을 기록한다.
  • 테스트 데이터가 원래 크기의 1/16(10K 전이)로 줄어들었을 때 성능이 떨어지기 시작함으로써, 소량의 테스트 데이터에 대해 강건함을 보인다.
  • 테스트 데이터가 원래 크기의 1/4(10K 전이)로 줄어들었을 때도 MESA는 높은 성능을 유지함으로써, 훈련 데이터 대비 최대 40배 적은 테스트 데이터로도 운영 가능하다는 것을 시사한다.
  • 제거 실험 결과, MESA의 메타학습된 위험 측정치가 메타학습 기간 동안 관찰되지 않은 분포 외 동역학, 예를 들어 부분적인 액추에이터 고장 등에도 잘 일반화됨을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.