Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Safety Constraints from Demonstrations with Unknown Rewards

David Lindner, Xin Chen|arXiv (Cornell University)|2023. 05. 25.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 보상 함수가 알려져 있지 않고 환경 동역학에 대한 지식이 없는 경우, 제약이 있는 마코프 결정 과정(CMDPs)에서 안전 제약을 지도 데이터로부터 학습하는 새로운 방법 CoCoRL을 제안한다. 다양한, 잠재적으로 최적화되지 않은 지도 데이터로부터 볼록 안전 집합을 구성함으로써 CoCoRL은 안전성을 보장하고, 최적에 가까운 정책에 대해 渐近 최적성(Asymptotic optimality)을 달성하며, 안전성을 보장하지 못하는 IRL 기반 기준선보다 뛰어난 성능을 발휘한다.

ABSTRACT

We propose Convex Constraint Learning for Reinforcement Learning (CoCoRL), a novel approach for inferring shared constraints in a Constrained Markov Decision Process (CMDP) from a set of safe demonstrations with possibly different reward functions. While previous work is limited to demonstrations with known rewards or fully known environment dynamics, CoCoRL can learn constraints from demonstrations with different unknown rewards without knowledge of the environment dynamics. CoCoRL constructs a convex safe set based on demonstrations, which provably guarantees safety even for potentially sub-optimal (but safe) demonstrations. For near-optimal demonstrations, CoCoRL converges to the true safe set with no policy regret. We evaluate CoCoRL in gridworld environments and a driving simulation with multiple constraints. CoCoRL learns constraints that lead to safe driving behavior. Importantly, we can safely transfer the learned constraints to different tasks and environments. In contrast, alternative methods based on Inverse Reinforcement Learning (IRL) often exhibit poor performance and learn unsafe policies.

연구 동기 및 목표

  • 보상 함수가 알려져 있지 않고 환경 동역학이 관측되지 않는 상황에서 제약이 있는 마코프 결정 과정(CMDPs)에서 안전 제약을 학습하는 문제에 대응하기 위해.
  • 최적화되지 않았지만 안전한 지도 데이터조차도 안전성을 보장하는 방법을 개발하기 위해.
  • 환경의 동역학이나 보상 함수를 알지 못한 채, 최적에 가까운 지도 데이터에 대해 渐近 최적성(Asymptotic optimality)을 달성하기 위해.
  • 학습된 제약을 다양한 작업과 환경 간에 전이 가능하게 하기 위해.
  • IRL 기반 접근법이 이러한 환경에서 안전성을 보장할 수 없다는 것을 입증하기 위해.

제안 방법

  • CoCoRL은 지도 데이터를 이용해 특징 공간 내에서 볼록 안전 집합을 구성하여, 이 집합에 속하는 모든 정책이 공통 제약을 만족하도록 보장한다.
  • 지도된 경로의 점유도 측정치에 대한 볼록 최적화 문제로 제약 추론을 수립한다.
  • 안전 정책는 제약으로 정의된 반평면의 교차부분에 위치해야 하며, 이는 볼록 다면체를 이룬다.
  • 최적에 가까운 지도 데이터에 대해서는 이론적 분석을 통해 CoCoRL이 정책의 실수 없이 진짜 안전 집합으로 수렴함을 증명하였다.
  • 환경의 전이 동역학이나 지도 데이터 제작자의 보상 함수를 알 필요가 없다.
  • 해법은 표 형태 환경과 다중 제약 조건이 있는 연속적인 주행 시뮬레이션에서 평가되었다.

실험 결과

연구 질문

  • RQ1기본 보상 함수가 알려져 있지 않은 상황에서 지도 데이터로부터 안전 제약을 신뢰성 있게 추론할 수 있는가?
  • RQ2지도 데이터가 최적화되지 않았더라도 제약 학습 방법이 안전성을 보장할 수 있는가?
  • RQ3환경 동역학이나 보상 함수에 접근할 수 없음에도 불구하고, 최적에 가까운 지도 데이터에 대해 이론적으로 최적의 성능을 달성할 수 있는가?
  • RQ4IRL 기반 기준선 대비 CoCoRL의 안전성과 성능은 어떻게 비교되는가?
  • RQ5유추된 제약은 새로운 작업과 환경으로 성공적으로 전이될 수 있는가?

주요 결과

  • CoCoRL은 유추된 볼록 안전 집합에서 유도된 모든 정책에 대해 안전성을 보장하며, 실험에서 안전하지 않은 해가 관측되지 않았다.
  • 단일 상태 CMDP에서 CoCoRL은 소수의 지도 데이터로도 높은 보상 수익을 달성하고, 지도 데이터 수가 증가함에 따라 최적 정책로 수렴한다.
  • CoCoRL의 샘플 복잡도는 정리 3에서 예측한 바와 같이 특징 차원 수에 비례하지만, 진짜 제약 수에 대해 상대적으로 민감도가 낮다.
  • 최대 엔트로피 및 최대 마진 변형을 포함한 모든 IRL 기반 기준선은 안전성을 보장하지 못하며, 그림판 월드와 주행 환경 양쪽에서 안전하지 않은 정책을 반환한다.
  • 주행 시뮬레이션에서 CoCoRL은 안전한 주행 행동을 이끌어내는 제약을 성공적으로 학습하였고, 새로운 작업과 환경으로 일반화되었으며, 반면 IRL 기준선은 제약을 위반하고 성능이 열 劣하다.
  • 진짜 보상을 알고 있는 Known Reward IRL 기준선조차도 안전성을 보장하지 못함으로써, IRL은 안전 중심 응용 분야에서 신뢰할 수 없다는 점이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.