[논문 리뷰] Value Iteration in Continuous Actions, States and Time
이 논문은 연속 상태와 행동 공간으로의 확장이 가능한 연속형 적합가치반복(continuous fitted value iteration, cFVI)을 소개한다. 이는 알려진 제어-아핀 동역학 모델을 활용하여 가치반복 기법을 연속 시간 및 연속 상태·행동 공간으로 확장한 동적 프rogram밍 접근법이다. 연속 시간 수식과 닫힌 형태의 최적 행동 계산을 통해 cFVI는 시뮬레이션에서 딥 강화학습과 유사한 성능을 달성하며, 도메인 랜덤화 없이도 물리 시스템에서 더 뛰어난 안정성과 sim2real 전이 성능를 보이며, 액터-크리틱 기반 모델들을 능가한다.
Classical value iteration approaches are not applicable to environments with continuous states and actions. For such environments, the states and actions are usually discretized, which leads to an exponential increase in computational complexity. In this paper, we propose continuous fitted value iteration (cFVI). This algorithm enables dynamic programming for continuous states and actions with a known dynamics model. Leveraging the continuous-time formulation, the optimal policy can be derived for non-linear control-affine dynamics. This closed-form solution enables the efficient extension of value iteration to continuous environments. We show in non-linear control experiments that the dynamic programming solution obtains the same quantitative performance as deep reinforcement learning methods in simulation but excels when transferred to the physical system. The policy obtained by cFVI is more robust to changes in the dynamics despite using only a deterministic model and without explicitly incorporating robustness in the optimization. Videos of the physical system are available at \url{https://sites.google.com/view/value-iteration}.
연구 동기 및 목표
- 이산화로 인한 제약으로 인해 고전적 가치반복 기법이 연속 상태 및 행동 공간에서 성능이 떨어지는 문제를 해결한다.
- 알려진 동역학 모델을 활용하여 연속 환경에서 동적 프로그래밍을 가능하게 한다.
- 딥 강화학습 기반 모델들과 비교해 안정성과 sim2real 전이 성능를 향상시킨다.
- 연속 시간, 제어-아phin 시스템에서 최적 제어를 위한 닫힌 형태의 해를 제공한다.
- 정책 기반 최적화 없이도 가치반복 기법을 연속 영역으로 효율적으로 확장할 수 있음을 보여준다.
제안 방법
- 할인 상수 ρ와 연속 시간 보상 r_c를 사용하여 연속 시간 기반 강화학습 문제를 수식화한다.
- 연속 시간 최적 제어의 기초로 해밀턴-자코비-벨만(Hamilton-Jacobi-Bellman, HJB) 방정식을 사용한다.
- 제어-아핀 동역학 하에서 최적 행동에 대한 닫힌 형태의 해를 유도하여 분석적 정책 계산을 가능하게 한다.
- 닫힌 형태의 행동을 사용해 가치함수 타겟을 계산함으로써 정책 네트워크 최적화 없이 가치반복을 반복 적용한다.
- 함수 근사(예: 신경망)를 사용해 가치함수를 표현함으로써 연속 영역에서의 확장 가능한 학습을 가능하게 한다.
- 연속 시간 수식을 활용해 시간 이산화 오차를 방지하고 물리 시스템 전이 시 안정성을 향상시킨다.
실험 결과
연구 질문
- RQ1이산화 또는 정책 기반 기법 없이도 가치반복 기법을 연속 상태 및 행동 공간으로 확장할 수 있는가?
- RQ2닫힌 형태의 최적 행동을 갖는 연속 시간 수식이 sim2real 전이에서 안정성 향상에 기여하는가?
- RQ3물리 시스템에서 딥 강화학습 기반 모델들과 비교해 cFVI의 성능 및 정책 품질은 어떠한가?
- RQ4명시적인 안정성 정규화 없이도 결정론적 모델이 확률적 딥 강화학습 기법보다 더 안정적인 정책을 도출할 수 있는가?
- RQ5연속 시간 수식이 비선형 제어 과제에서 더 부드럽고 대칭적인 정책 도출에 어떤 역할을 하는가?
주요 결과
- cFVI는 퓌루타 펜듈럼 및 카트폴과 같은 비선형 제어 과제에서 시뮬레이션 환경에서 딥 강화학습 기법과 유사한 성능을 달성한다.
- 물리 시스템에서 cFVI는 균일한 초기 상태 분포를 사용할 때 딥 강화학습 기반 모델들을 크게 능가하며, 특히 초기 상태 분포가 넓을 경우 두드러진 성능 향상을 보인다.
- cFVI가 학습한 정책은 대칭적이고 부드럽기 때문에, 딥 강화학습 기법에서 유도되는 비대칭 정책과 달리 펜듈럼의 양방향 스윙업을 성공적으로 수행할 수 있다.
- 불안정 평형점 근처에서 cFVI는 가치함수에 더 뚜렷한 산맥을 형성함으로써 임계 상태 근처에서 정밀한 제어를 가능하게 한다.
- cFVI에서 사용된 결정론적 모델은 도메인 랜덤화나 명시적 안정성 정규화 없이도 딥 강화학습 기반 모델보다 더 안정적인 정책을 도출한다.
- 연속 시간 수식을 통해 직접 HJB 잔차 최소화를 위한 회귀 기반 최적화보다 더 안정적이고 효율적인 최적화를 달성할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.