Skip to main content
QUICK REVIEW

[논문 리뷰] Hamilton-Jacobi Deep Q-Learning for Deterministic Continuous-Time Systems with Lipschitz Continuous Controls

Jeongho Kim, Jae-Uk Shin|arXiv (Cornell University)|2020. 10. 27.
Adaptive Dynamic Programming Control참고 문헌 55인용 수 15
한 줄 요약

이 논문은 립시츠 연속 제어를 갖는 결정론적 연속시간 최적 제어를 위한 모델-프리 강화학습 방법인 해밀턴-자코비 딥 Q-러닝(HJ DQN)을 제안한다. 동적 프로그래밍에서 유도된 Q-함수를 바탕으로 반산점성 해밀턴-자코비-벨만(HJB) 방정식을 수립함으로써, 시스템 동역학의 이산화 없이 데이터 기반 학습을 가능하게 하고, 립시츠 제어 조건 하에서 최적 Q-함수 수렴을 달성한다.

ABSTRACT

In this paper, we propose Q-learning algorithms for continuous-time deterministic optimal control problems with Lipschitz continuous controls. Our method is based on a new class of Hamilton-Jacobi-Bellman (HJB) equations derived from applying the dynamic programming principle to continuous-time Q-functions. A novel semi-discrete version of the HJB equation is proposed to design a Q-learning algorithm that uses data collected in discrete time without discretizing or approximating the system dynamics. We identify the condition under which the Q-function estimated by this algorithm converges to the optimal Q-function. For practical implementation, we propose the Hamilton-Jacobi DQN, which extends the idea of deep Q-networks (DQN) to our continuous control setting. This approach does not require actor networks or numerical solutions to optimization problems for greedy actions since the HJB equation provides a simple characterization of optimal controls via ordinary differential equations. We empirically demonstrate the performance of our method through benchmark tasks and high-dimensional linear-quadratic problems.

연구 동기 및 목표

  • 립시츠 연속 제어를 갖는 연속시간 결정론적 최적 제어를 위한 모델-프리 강화학습 방법의 부족을 보완한다.
  • 미세한 시간 이산화가 필요하고 불안정성과 비효율성으로 악화되는 이산시간 강화학습 방법의 한계를 극복한다.
  • 해밀턴-자코비-벨만 방정식을 상태-행동 가치 함수에 적용하여 연속시간 시스템을 위한 이론적으로 탄탄한 Q-러닝 프레임워크를 개발한다.
  • HJB 방정식이 최적 제어를 특성화함으로써 액터 네트워크나 반복 최적화를 위한 추가 단계 없이도 실용적인 구현을 가능하게 한다.
  • 고차원 선형-제곱형 문제와 MuJoCo 벤치마크에서 안정적이고 데이터 효율적인 학습 성능을 입증한다.

제안 방법

  • 동적 프로그래밍 원리를 활용해 연속시간 Q-함수를 위한 새로운 반산점성 HJB 방정식을 유도함으로써, 시스템 동역학의 명시적 이산화를 피한다.
  • 로빈스-몬로 스토하스틱 근사 기반의 모델-프리 업데이트 규칙을 수립하여, 이산시간 전이 샘플을 사용해 Q-함수를 갱신한다.
  • 해밀턴-자코비 DQN(HJ DQN) 알고리즘을 도입하여, HJB 방정식을 직접 활용해 ODE를 통해 탐욕적 행동을 정의함으로써 딥 Q-네트워크를 연속시간 제어에 확장한다.
  • 최적 제어 선택을 HJB 방정식의 특성화를 통해 보장한다: $ \dot{a} = L \frac{\nabla_{\bm{a}} Q}{|\nabla_{\bm{a}} Q|} $, 이로써 별도의 최적화나 액터 네트워크가 필요 없어진다.
  • 반산점성 HJB 수식의 정규성과 안정성을 확보하기 위해 제어에 립시츠 제약 조건($ |\bm{b}| \leq L $)을 도입한다.
  • 함수 근사에 딥 네ural 네트워크를 사용하고, 경험 재생, 타겟 네트워크, DQN 및 DDPG 벤치마크에서 일반적으로 사용되는 표준 하이퍼파ram터를 적용한다.

실험 결과

연구 질문

  • RQ1립시츠 연속 제어를 갖는 연속시간 결정론적 최적 제어 문제를 위한 모델-프리 Q-러닝 알고리즘을 개발할 수 있는가?
  • RQ2Q-함수를 위한 반산점성 HJB 방정식이 시스템 동역학의 이산화 없이 안정적이고 수렴 가능한 학습을 가능하게 하는가?
  • RQ3HJB 방정식을 사용해 최적 제어를 직접 특성화할 수 있는가? 이는 추가 최적화나 액터 네트워크가 필요로 하지 않는가?
  • RQ4제안된 HJ DQN 방법은 DDPG와 같은 기존의 딥 강화학습 베이스라인에 비해 고차원 연속 제어 작업에서 어떻게 성능을 발휘하는가?
  • RQ5학습의 안정성과 효율성에 있어 핵심적인 하이퍼파라미터(예: 샘플링 간격, 립시츠 상수)는 무엇인가?

주요 결과

  • 제어 입력이 립시츠 연속일 조건 하에서 HJ DQN 알고리즘이 최적 Q-함수로 수렴한다.
  • 각 환경에 맞게 하이퍼파라미터를 튜닝함으로써, MuJoCo 벤치마크 작업(HalfCheetah-v2, Hopper-v2, Walker2d-v2, Swimmer-v2)에서 안정적인 학습을 달성한다.
  • 고차원 선형-제곱형(LQ) 문제에서 HJ DQN은 할인 인자를 $ \gamma = -\log(0.99999)/h $로 설정하여 연속시간 동역학을 정확히 반영하는 근사 최적 정책을 성공적으로 학습한다.
  • 특히 고차원 및 연속 제어 환경에서 DDPG에 비해 샘플 효율성과 학습 안정성 면에서 HJ DQN이 뛰어난 성능을 발휘한다.
  • HJB 방정식을 직접 활용해 탐욕적 행동을 정의함으로써 액터 네트워크와 반복적 제어 최적화의 필요성을 제거한다.
  • 실험 결과, 샘플링 간격 $ h $와 립시츠 상수 $ L $의 선택이 학습 성능에 크게 영향을 미치며, 튜닝된 $ h $가 수렴을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.