Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Reinforcement Learning of Control-Affine Systems with Vertex Networks

Liyuan Zheng, Yuanyuan Shi|arXiv (Cornell University)|2020. 03. 20.
Extremum Seeking Control Systems인용 수 15
한 줄 요약

이 논문은 제어-아핀 시스템에서 안전성을 보장하기 위해 상태 및 동작 제약 조건을 정 politope의 정점들의 볼록 조합을 통해 정 politope 정책 네트워크에 직접 통합하는 새로운 신경망 아키텍처인 Vertex Networks(VNs)를 제안한다. 사전에 계산된 안전 영역의 정점들의 볼록 조합으로 동작를 구성함으로써, 온라인 최적화가 필요 없이 훈련 및 추론 시 제약 조건을 만족시키며, 벤치마크 과제에서 페널티 기반 안전성 방법보다 뛰어난 성능을 발휘한다.

ABSTRACT

This paper focuses on finding reinforcement learning policies for control systems with hard state and action constraints. Despite its success in many domains, reinforcement learning is challenging to apply to problems with hard constraints, especially if both the state variables and actions are constrained. Previous works seeking to ensure constraint satisfaction, or safety, have focused on adding a projection step to a learned policy. Yet, this approach requires solving an optimization problem at every policy execution step, which can lead to significant computational costs. To tackle this problem, this paper proposes a new approach, termed Vertex Networks (VNs), with guarantees on safety during exploration and on learned control policies by incorporating the safety constraints into the policy network architecture. Leveraging the geometric property that all points within a convex set can be represented as the convex combination of its vertices, the proposed algorithm first learns the convex combination weights and then uses these weights along with the pre-calculated vertices to output an action. The output action is guaranteed to be safe by construction. Numerical examples illustrate that the proposed VN algorithm outperforms vanilla reinforcement learning in a variety of benchmark control tasks.

연구 동기 및 목표

  • 제어 시스템에서 하드한 상태 및 동작 제약 조건 하에 강화 학습 정책을 훈련하는 데 도전 과제를 해결한다.
  • 각 추론 단계에서 최적화 문제를 해결해야 하는 온라인 투영 기반 안전성 방법의 계산 부담을 완화한다.
  • 모든 훈련 및 배포 단계에서 제약 조건을 만족시키는 안전한 탐색 프레임워크를 개발한다. 기대값만을 만족시키는 것이 아니라 실제적으로 항상 안전하다.
  • 볼록 집합의 기하적 성질을 통해 안전 제약 조건을 내재적으로 준수하는 신경망 아키텍처를 설계한다.
  • 엄격한 안전 요구 조건이 있는 연속 제어 벤치마크에서 제안된 방법의 효과성을 입증한다.

제안 방법

  • 안전 영역(볼록 다면체)을 그 정점들의 볼록 폐쇄로 표현하며, 볼록 집합 내의 임의의 점이 정점들의 볼록 조합으로 표현될 수 있다는 사실을 활용한다.
  • 각 시간 단계에서 안전 영역의 정점들을 위한 볼록 조합 가중치(즉, 계수)를 출력하는 정책 네트워크를 설계한다.
  • 학습된 가중치와 사전 계산된 정점들을 사용하여 최종 동작를 볼록 조합으로 계산함으로써, 동작가 안전 영역 내에 존재하도록 보장한다.
  • 표준 정책 최적화 프레임워크(DDPG 또는 PPO 등)에 Vertex 네트워크를 통합하여, 보장된 안전성을 갖는 엔드 투 엔드 훈련을 가능하게 한다.
  • 각 시간 단계에서 안전 상태 영역과 액추에이터 제약 집합의 교차 영역의 정점을 온라인으로 계산하여 변화하는 제약 조건에 적응한다.
  • 온라인 최적화를 피하기 위해 안전성을 네트워크 아키텍처에 통합함으로써, 추론 시 투영 단계가 필요 없어진다.

실험 결과

연구 질문

  • RQ1강화 학습에서 탐색 및 배포 시 모두 제약 조건을 만족시키는 신경망 아키텍처를 설계할 수 있는가?
  • RQ2정책 네트워크 아키텍처에 직접 안전 제약 조건을 통합하는 방식이, 페널티 기반 또는 투영 기반 방법과 비교해 안전성 및 샘플 효율성 측면에서 어떻게 성능을 발휘하는가?
  • RQ3높은 차원의 제어 과제에서 하드한 제약 조건이 존재할 경우, 정점 기반 볼록 조합을 사용한 동작 생성의 성능에 어떤 영향을 미치는가?
  • RQ4환경 동역학이 복잡하거나 제약 조건이 시간에 따라 변할 경우, 제안된 방법이 여전히 안전성을 유지할 수 있는가?
  • RQ5특히 정점 수가 증가할 경우, 높은 차원의 상태 및 동작 공간을 가진 시스템에 대해 이 방법은 어떻게 스케일링되는가?

주요 결과

  • Vertex Networks(VNs)는 훈련 및 추론 중에 완벽한 제약 조건 만족도를 달성하였으며, 모든 벤치마크 과제에서 제약 위반이 관찰되지 않았다.
  • 마스스프링 시스템에서 VN은 페널티 기반 안전성 접근 방식을 사용한 표준 정책 네트워크(PN)보다 뛰어난 성능을 보였으며, 초기 훈련 단계에서 더 높은 누적 보상을 달성하고 전반적으로 안전성을 유지하였다.
  • 하이퍼크루즈 과제에서 VN은 엄격한 기울기 각도 제약($\bar{\theta} = 0.01$)을 충족하면서 목표 지점으로 성공적으로 이동하였고, 반면 PN 정책은 보상 함수에 페널티가 존재했음에도 불구하고 제약을 위반하여 큰 기울기 각도에 도달하였다.
  • 궤적 시각화 결과 VN 정책는 더 매끄럽고 안전한 조작을 생성하는 반면, PN 정책는 광범위한 훈련 후에도 여전히 위험한 행동을 보였다.
  • 이 방법은 다양한 제약 조건 한계에 대해 강건성을 보였으며, 엄격한 제한 조건 하에서도 안전성을 일관되게 유지하였다.
  • VN의 계산 비용은 온라인 최적화가 필요 없는 덕분에 투영 기반 방법보다 크게 낮았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.