QUICK REVIEW
[논문 리뷰] Value and Policy Iteration in Optimal Control and Adaptive Dynamic Programming
Dimitri P. Bertsekas|arXiv (Cornell University)|2015. 07. 03.
Adaptive Dynamic Programming Control참고 문헌 15인용 수 4
한 줄 요약
이 논문은 단계 비용이 비음수일 수 있고 무한일 수 있는 이산 시간 무한 시간 최적 제어 문제에서 종료 집합 $X_s$ 가 존재할 때 벨만 방정식의 최적 비용 함수 $J^*$ 가 유일하게 가장 작은 해임을 확립하고, 일반 조건 하에서 값 반복(VI)과 정책 반복(PI)의 수렴성을 증명한다. 주요 기여는 국소적으로 안정화하는 제어기나 유계 비용 함수를 요구하지 않는 정규성 기반 분석을 통해 수렴성을 보장한다는 것이다.
ABSTRACT
In this paper, we consider discrete-time infinite horizon problems of optimal control to a terminal set of states. These are the problems that are often taken as the starting point for adaptive dynamic programming. Under very general assumptions, we establish the uniqueness of solution of Bellman's equation, and we provide convergence results for value and policy iteration.
연구 동기 및 목표
- 무한 시간 최적 제어 문제에서 종료 집합 $X_s$ 가 존재할 때, 벨만 방정식의 최적 비용 함수 $J^*$ 가 가장 작은 해로 유일하게 존재함을 확립한다.
- 비음수이자 가능하면 무한한 단계 비용을 가진 문제에서 값 반복(VI)과 정책 반복(PI) 알고리즘의 일반적인 수렴 조건을 제공한다.
- 전역적으로 안정화하는 제어기를 가정할 필요 없이, 유계 또는 미분 가능하지 않은 비용 함수를 가진 문제로의 적용 범위를 넓힐 수 있도록 한다.
- $S$-정규성의 역할을 정식화하여, $J^*$ 가 확장된 실수 값을 가질 수 있는 경우에도 VI와 PI가 최적 비용 함수 $J^*$ 로 수렴함을 보장한다.
- 적응 동적 프로그래밍의 이론적 기반을 추상 동적 프로그래밍 원리와 정규성 조건에 기반하여 확장한다.
제안 방법
- 비용 함수 $g(x,u) = 0$ 이고 전이 함수 $f(x,u) = x$ 를 만족하는 停止 집합 $X_s \subset X$ 를 정의하여, 모든 $x \in X_s$ 에 대해 $J^*(x) = 0$ 이 되도록 보장한다.
- 최적 비용 함수가 유한한 상태의 집합인 $X_f = \{x \in X \mid J^*(x) < \infty\}$ 를 정의하여, 종료 집합 $X_s$ 로 점 渐진적으로 도달할 수 있는 상태의 집합으로 정의한다.
- $S$-정규성의 개념을 도입하여, 정책-상태 쌍 $(\pi, x_0)$ 에 대해 $J_\pi(x_0)$ 가 임의의 $J \in S$ 에서 시작하는 값 반복의 극한과 일치함을 보장한다.
- 정규성 프레임워크를 적용하여, $J^*$ 가 클래스 $\{J \in S \mid J \geq J^*\}$ 내에서 벨만 방정식의 유일한 해임을 증명한다.
- 값 반복은 $J_{k+1}(x) = \inf_{u \in U(x)} \{g(x,u) + J_k(f(x,u))\}$ 으로, 정책 반복은 반복적 정책 평가와 개선을 통해 수행한다.
- 비용의 비음성과 최소화 제어기가 존재하는 조건 하에서, 미묘한 가정 하에 $J_k \to J^*$ 와 $J_{\mu^k} \to J^*$ 가 점별 수렴함을 확립한다.
실험 결과
연구 질문
- RQ1어떤 조건에서 최적 비용 함수 $J^*$ 는 제한된 함수 클래스 내에서 벨만 방정식의 유일한 해가 되는가?
- RQ2단계 비용이 가능하면 무한한 문제에서 값 반복이 최적 비용 함수 $J^*$ 로 수렴하는 조건은 무엇인가?
- RQ3정책 반복은 언제 $J^*$ 로 수렴하며, 각 단계에서 최소화 제어기가 존재함을 보장하는 조건은 무엇인가?
- RQ4전역적으로 안정화하는 제어기가 존재하지 않는 조건에서 VI와 PI의 수렴을 어떻게 보장할 수 있는가?
- RQ5$S$-정규성 조건이 $J^*$ 가 유일한 해임을 보장하고 VI가 그것으로 수렴하도록 하는 데 어떤 역할을 하는가?
주요 결과
- 최적 비용 함수 $J^*$ 는 $S$-정규성 조건을 만족하는 함수의 집합 $S$ 내에서 $\{J \in S \mid J \geq J^*\}$ 클래스 내에서 벨만 방정식의 유일한 해이다.
- 정책-상태 쌍이 $S$-정규성이고 $J^*$ 가 종료 정책에 대한 최적 비용일 때, 임의의 비음수 초기 함수 $J_0$ 에 대해 값 반복은 점별로 $J^*$ 로 수렴한다.
- 같은 정규성 조건과 최소화 제어기 존재 조건 하에서 정책 반복도 점별로 $J^*$ 로 수렴하며, $k \to \infty$ 일 때 $J_{\mu^k} \to J^*$ 가 성립한다.
- 논문은 비용 함수의 유계성이나 전역적으로 안정화하는 제어기의 존재를 요구하지 않아, 비유계 또는 비연속 비용 함수를 가진 문제로의 적용 범위를 넓혔다.
- 비할인 및 할인 문제 모두에 대해 비음수 단계 비용을 가진 문제에 대해 유효하며, 할인 요소 덕분에 할인 문제에서는 더 강력한 수렴 보장이 가능하다.
- 이론적 프레임워크는 추상 동적 프로그래밍과 정규성 이론에 기반하여, 적응 동적 프로그래밍과 강화 학습 알고리즘의 통합적 기반을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.