Skip to main content
QUICK REVIEW

[논문 리뷰] Infinite-Horizon Reach-Avoid Zero-Sum Games via Deep Reinforcement Learning

Jingqi Li, Donggun Lee|arXiv (Cornell University)|2022. 03. 18.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 수축성 벨먼 백업을 사용하여 무한 시간 할당 도달-피하기 0-합 게임을 위한 딥 강화학습 접근법을 제안한다. 이 방법은 초위치 수준 집합이 도달-피하기 집합을 근사하는 값 함수를 정의한다. 보수적 Q-학습을 확장함으로써, 높은 차원의 시스템에서 안전한 제어 정책과 생존 가능성 커널을 신뢰성 있게 학습할 수 있으며, 차원의 극복 문제를 해결하면서도 적대적 외란 하에서 보수적인 근사치를 보장한다.

ABSTRACT

In this paper, we consider the infinite-horizon reach-avoid zero-sum game problem, where the goal is to find a set in the state space, referred to as the reach-avoid set, such that the system starting at a state therein could be controlled to reach a given target set without violating constraints under the worst-case disturbance. We address this problem by designing a new value function with a contracting Bellman backup, where the super-zero level set, i.e., the set of states where the value function is evaluated to be non-negative, recovers the reach-avoid set. Building upon this, we prove that the proposed method can be adapted to compute the viability kernel, or the set of states which could be controlled to satisfy given constraints, and the backward reachable set, or the set of states that could be driven towards a given target set. Finally, we propose to alleviate the curse of dimensionality issue in high-dimensional problems by extending Conservative Q-Learning, a deep reinforcement learning technique, to learn a value function such that the super-zero level set of the learned value function serves as a (conservative) approximation to the reach-avoid set. Our theoretical and empirical results suggest that the proposed method could learn reliably the reach-avoid set and the optimal control policy even with neural network approximation.

연구 동기 및 목표

  • 높은 차원의 시스템에서 악성 외란 하에서 무한 시간 할당 도달-피하기 0-합 게임을 해결하는 데 도전하는 것.
  • 딥 강화학습을 사용하여 해밀토니안-자브리지 도달 가능성 분석에서의 차원의 극복 문제를 극복하는 것.
  • 초위치 수준 집합이 도달-피하기 집합, 생존 가능성 커널, 후방으로 도달 가능한 집합을 복원하는 값 함수를 개발하는 것.
  • 수정된 보수적 Q-학습 프레임워크를 사용하여 안전 기반 집합의 보수적인 근사치를 확보하는 것.
  • 장기적 제약 조건과 적대적 불확실성 하에서 자율 시스템의 신뢰성 있는 정책 학습을 가능하게 하는 것.

제안 방법

  • 초위치 수준 집합이 도달-피하기 집합에 해당하는 값 함수를 정의하는 수축성 벨먼 백업을 제안한다.
  • 오차가 제한된 값을 학습하고 도달-피하기 집합의 보수적인 근사치를 보장하기 위해 수정된 보수적 Q-학습 알고리즘을 도입한다.
  • 무한 시간 할당 행동을 모델링하기 위해 감쇠된 시간 할인 값 함수를 사용하고, γ → 1로 수렴한다.
  • 벨먼 업데이트에서 제어 및 외란 입력에 대한 최소-최대 설정을 사용하여 최악의 성능를 포괄한다.
  • 값 함수에 신경망 함수 근사를 적용하여 고차원 상태 공간으로의 확장성을 확보한다.
  • 학습된 값 함수가 진짜 값 함수에 상대적으로 범위를 가지며, 이는 이론적 수렴성과 보수성 보장을 보장한다.

실험 결과

연구 질문

  • RQ1딥 강화학습 방법이 악성 외란이 존재하는 무한 시간 할당 0-합 게임에서 도달-피하기 집합을 안정적으로 근사할 수 있는가?
  • RQ2보수적 함수 근사를 사용한 딥 RL을 통해 해밀토니안-자브리지 도달 가능성 분석에서의 차원의 극복 문제를 어떻게 완화할 수 있는가?
  • RQ3제안된 방법이 도달-피하기 집합의 특수한 경우로서 생존 가능성 커널과 후방으로 도달 가능한 집합을 모두 계산할 수 있는가?
  • RQ4보수적 Q-학습과 함께 사용된 수축성 벨먼 백업이 안전 기반 집합의 보수적이고 안정적인 학습을 보장하는가?
  • RQ5높은 차원의 시스템에서 학습된 값 함수의 수렴성과 보수성에 대해 어떤 이론적 보장을 제공할 수 있는가?

주요 결과

  • 제안된 방법은 고차원 시스템에서도 딥 신경망을 사용하여 도달-피하기 집합의 보수적인 근사치를 성공적으로 학습한다.
  • 학습된 값 함수의 초위치 수준 집합은 도달-피하기 집합을 정확히 복원하며, 보수성에 대한 이론적 보장을 제공한다.
  • 보상 함수와 제약 함수를 조정함으로써 이 방법은 생존 가능성 커널과 후방으로 도달 가능한 집합을 일반화하여 계산할 수 있다.
  • 이론적 분석 결과, 학습된 값 함수는 진짜 값 함수에서 γ-가중 오차 항을 뺀 값과 진짜 값 함수에서 상수를 뺀 값 사이에 범위를 가지며, 이는 수렴성을 보장한다.
  • 실험 결과는 악성 외란 하에서도 최적의 제어 정책과 안전한 상태 집합의 안정적인 학습을 보여준다.
  • 보수적 Q-학습의 이 설정에 대한 확장은 안정적인 학습을 보장하고 값 함수 추정치의 과대평가를 방지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.