Skip to main content
QUICK REVIEW

[논문 리뷰] Inverse Constrained Reinforcement Learning

Usman Anwar, Shehryar Malik|arXiv (Cornell University)|2020. 11. 19.
Reinforcement Learning in Robotics참고 문헌 32인용 수 7
한 줄 요약

이 논문은 연속적이고 고차원적인 환경에서 전문가 시연로부터 임의의 마르코프 제약 조건을 추론할 수 있는 모델-프리이고 샘플 기반 프레임워크를 제안한다. 중요도 샘플링과 KL 기반 조기 정지 기법을 사용하여 제약 조건 복원을 학습 문제로 공식화함으로써, 환경의 동역학을 가정하지 않고도 다른 형태나 보상 함수를 가진 신규 에이전트로 학습된 제약 조건을 성공적으로 이식할 수 있으며, 안전하고 전문가 수준의 성능을 달성할 수 있다.

ABSTRACT

In real world settings, numerous constraints are present which are hard to specify mathematically. However, for the real world deployment of reinforcement learning (RL), it is critical that RL agents are aware of these constraints, so that they can act safely. In this work, we consider the problem of learning constraints from demonstrations of a constraint-abiding agent's behavior. We experimentally validate our approach and show that our framework can successfully learn the most likely constraints that the agent respects. We further show that these learned constraints are extit{transferable} to new agents that may have different morphologies and/or reward functions. Previous works in this regard have either mainly been restricted to tabular (discrete) settings, specific types of constraints or assume the environment's transition dynamics. In contrast, our framework is able to learn arbitrary extit{Markovian} constraints in high-dimensions in a completely model-free setting. The code can be found it: \url{https://github.com/shehryar-malik/icrl}.

연구 동기 및 목표

  • 실제 세계의 제약 조건을 강화학습에서 수학적으로 기술하는 데 어려움이 있을 경우, 이를 해결하기 위해 제약 조건을 명시적으로 기술할 수 없는 경우에도 적용 가능한 방법을 제공한다.
  • 이전 연구에서의 제약 조건인 환경 전이 동역학을 사전에 알지 못하는 한계를 극복하기 위해, 알려지지 않은 환경 전이 동역학을 가정하지 않고도 전문가 시연에서 제약 조건을 추론할 수 있도록 한다.
  • 표본 기반 접근법을 통해 고차원적이고 연속적인 상태 및 행동 공간에서 임의의 마르코프 제약 조건을 학습할 수 있는 방법을 개발한다. 이는 이전의 표본 공간이나 이산 설정을 넘어서는 것이다.
  • 다른 형태나 보상 함수를 가진 새로운 에이전트로 학습된 제약 조건을 이식하여, 새로운 환경에서 안전하고 전문가 수준의 행동을 보장한다.
  • 노말 보상 함수만으로는 안전하지 않은 정책을 유도할 수 있지만, 전문가 행동에서 유추된 제약 조건을 통합함으로써 리워드 해킹 및 안전하지 않은 행동을 방지한다.

제안 방법

  • Scobee & Sastry (2020)의 목적 함수를 샘플 기반 접근법으로 근사하여, 모델-프리 학습이 가능한 역제약 강화학습을 학습 문제로 공식화한다.
  • 중요도 샘플링을 활용해 전문가 트레이젝터리를 재가중하여, 시연 자료로부터 제약 조건의 가능도를 향상된 정확도로 추정한다.
  • 과적합을 방지하기 위해 KL 기반 조기 정지 기법을 사용하여 최적화 과정에서 안정적인 수렴을 보장한다.
  • 프레임워크는 제약 조건 함수 $ c(\tau) = \prod_{t=1}^{T} c(s_t, a_t) $ 의 형태로 제약 조건을 학습하며, 이는 현재 상태-행동 쌍에만 의존하므로 마르코프 성질을 만족한다.
  • 이 방법은 완전히 엔드 투 엔드이며, 환경의 전이 동역학이나 보상 함수에 대한 사전 지식이 필요하지 않다.
  • 학습된 제약 조건을 노말 보상 함수와 통합하여, 실제 배포 환경에서 안전 제약 조건을 준수하는 에이전트를 훈련시킨다.

실험 결과

연구 질문

  • RQ1모델의 전이 동역학을 알지 못하는 연속적이고 고차원적인 환경에서, 전문가 시연 자료로부터 제약 조건을 성공적으로 추론할 수 있는가?
  • RQ2유추된 제약 조건은 형태나 보상 함수가 다른 새로운 에이전트로 일반화될 수 있는가?
  • RQ3실제 환경에서 리워드 해킹이나 제약 위반과 같은 안전하지 않은 행동을 방지하는 데에 이 방법이 얼마나 효과적인가?
  • RQ4중요도 샘플링과 조기 정지 기법이 제약 조건 복원의 안정성과 성능 향상에 어떤 역할을 하는가?
  • RQ5이 방법은 복잡한 비기하학적 또는 비凸인 제약 조건을 포함한 임의의 마르코프 제약 조건을 행동 데이터로부터 학습할 수 있는가?

주요 결과

  • 제안된 방법은 환경의 동역학이 알려지지 않은 상태에서도 전문가 에이전트가 준수하는 가장 가능성이 높은 제약 조건을 성공적으로 학습한다.
  • 학습된 제약 조건은 형태나 보상 함수가 다른 새로운 에이전트로 효과적으로 일반화되어, 새로운 환경에서 전문가 수준의 성능을 달성한다.
  • 제거 실험 결과에서 중요도 샘플링과 KL 기반 조기 정지 기법이 성능 향상에 필수적임을 입증하였으며, 둘 중 하나를 비활성화할 경우 보상 수준이 크게 떨어지고 제약 위반이 증가한다.
  • HalfCheetah 환경에서 이 방법은 최소한의 제약 위반으로 전문가 수준의 성능을 달성하였으며, 제약을 너무 강하게 적용하는 행동 복제나 이뮬레이션 기반 기준보다 뛰어난 성능을 보였다.
  • 노말 보상 함수가 그러한 행동을 유도할 수 있지만, 이 방법은 리워드 해킹을 방지하기 위해 위험한 경로(예: 사자 있는 길)를 피하는 방식으로 학습한다.
  • 이 프레임워크는 고차원 연속 제어 작업에 효과적으로 스케일링되어 실제 강화학습 배포에의 실현 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.