Skip to main content
QUICK REVIEW

[논문 리뷰] Convex Q-Learning, Part 1: Deterministic Optimal Control

Prashant G. Mehta, Sean Meyn|arXiv (Cornell University)|2020. 08. 08.
Reinforcement Learning in Robotics참고 문헌 61인용 수 4
한 줄 요약

이 논문은 결정론적 최적 제어를 위한 새로운 강화학습 알고리즘인 볼록 Q-학습을 제안한다. 이 알고리즘은 Q함수 근사 문제를 볼록 최적화 문제로 재구성하여, 과다 매개변수화와 제약 조건을 통해 벨먼 방정식을 볼록화함으로써 수렴성과 안정성을 보장한다. 이는 DQN과 유사한 경험적 행동을 보이지만 이론적 보장이 없는 비볼록 방법들에 대한 증명 가능하게 일관된 대안을 제공한다.

ABSTRACT

It is well known that the extension of Watkins' algorithm to general function approximation settings is challenging: does the projected Bellman equation have a solution? If so, is the solution useful in the sense of generating a good policy? And, if the preceding questions are answered in the affirmative, is the algorithm consistent? These questions are unanswered even in the special case of Q-function approximations that are linear in the parameter. The challenge seems paradoxical, given the long history of convex analytic approaches to dynamic programming. The paper begins with a brief survey of linear programming approaches to optimal control, leading to a particular over parameterization that lends itself to applications in reinforcement learning. The main conclusions are summarized as follows: (i) The new class of convex Q-learning algorithms is introduced based on the convex relaxation of the Bellman equation. Convergence is established under general conditions, including a linear function approximation for the Q-function. (ii) A batch implementation appears similar to the famed DQN algorithm (one engine behind AlphaZero). It is shown that in fact the algorithms are very different: while convex Q-learning solves a convex program that approximates the Bellman equation, theory for DQN is no stronger than for Watkins' algorithm with function approximation: (a) it is shown that both seek solutions to the same fixed point equation, and (b) the ODE approximations for the two algorithms coincide, and little is known about the stability of this ODE. These results are obtained for deterministic nonlinear systems with total cost criterion. Many extensions are proposed, including kernel implementation, and extension to MDP models.

연구 동기 및 목표

  • Q-학습의 함수 근사에서 이론적 일관성의 부족, 특히 비선형 시스템에서의 문제를 해결하기 위해.
  • 선형 함수 근사 하에서 투영된 벨먼 방정식이 안정적이고 유용한 해를 가지는지 여부라는 근본적 문제를 해결하기 위해.
  • 수렴성이 보장되고 명확한 최적화 목표를 가진 강화학습 알고리즘을 개발하기 위해.
  • 동적 프rogramming의 선형계획법 및 이차계획법 형태를 활용하여 볼록 해석학과 강화학습 간의 연결을 구축하기 위해.
  • 마코프 결정 과정(MDPs)과 커널 기반 함수 근사에 적용 가능한 볼록 RL 알고리즘의 기초를 다지기 위해.

제안 방법

  • Q함수를 과다 매개변수화하고 Q ≥ J를 보장하는 제약 조건을 도입함으로써, 벨먼 방정식을 볼록 프로그램으로 재구성한다. 여기서 J는 가치 함수이다.
  • 비볼록 Q-학습 문제를 볼록 최적화 문제로 변환하기 위해, 벨먼 방정식의 볼록화를 통해 비볼록성을 완화한다. 선형 및 이차 제약 조건을 포함한다.
  • 손실 함수를 평균 제곱 벨먼 오차로 정의하는 배치 학습 방식을 사용하지만, 볼록성과 안정성을 확보하기 위해 최적화를 제약 조건에 따라 제한한다.
  • Q함수와 가치 함수의 음수를 방지하기 위해 양성 페널티와 매개변수 제약 조건을 도입함으로써 물리적 및 수학적 일관성을 확보한다.
  • 경계 조건을 고려한 갈레르킨 유형의 완화를 통해 관측된 상태-행동 쌍을 기반으로, 관측된 궤적에서 벨먼 오차가 비음수가 되도록 제약한다.
  • 표준 볼록 최적화 솔버(예: MATLAB의 quadprog)를 활용하여, 수천 개의 제약 조건(예: 10^4개의 관측치)이 있는 경우에도 결과 최적화 문제를 해결한다.

실험 결과

연구 질문

  • RQ1선형 함수 근사 하에서 투영된 벨먼 방정식은 해를 가지며, 안정적이고 일관된가?
  • RQ2벨먼 방정식의 볼록화가 수렴성이 보장되고 의미 있는 정책으로 수렴하는 강화학습 알고리즘을 도출할 수 있는가?
  • RQ3이론적 안정성과 ODE 근사 역학적 특성 측면에서, 볼록 Q-학습은 DQN보다 어떻게 다를 수 있는가?
  • RQ4확률 측도의 볼록 가족을 활용하여, 랜덤화된 정책을 가진 MDPs로 볼록 형식을 확장할 수 있는가?
  • RQ5과다 매개변수화와 제약 조건 강제 적용은 Q-학습 문제의 볼록성과 안정성을 확보하는 데 어떤 역할을 하는가?

주요 결과

  • 제안된 볼록 Q-학습 알고리즘은 선형 함수 근사와 같은 일반 조건 하에서도 수렴하며, 이론적으로 일관됨이 입증된다.
  • 이 알고리즘은 DQN과 달리, 벨먼 방정식을 근사하는 볼록 프로그램을 해결함을 보여주며, DQN은 비슷한 ODE 근사에도 불구하고 이론적 보장이 없다.
  • 볼록 Q-학습과 DQN은 모두 동일한 고정점 방정식의 해를 찾고, 동일한 ODE 근사 방정식을 공유하지만, 볼록 Q-학습은 안정적인 볼록 최적화 프레임워크를 가진다.
  • 실험 결과에 따르면, 볼록 Q-학습은 특히 상태 전이 영역에서 진정한 가치 함수를 더 잘 포착함에 따라, 이차 기저 함수를 사용할 경우 기준 방법보다 뛰어난 성능을 보였다.
  • 표준 볼록 최적화 솔버를 사용하여 복잡한 제약 조건과 대규모 데이터(예: 10^4개의 관측치)를 효과적으로 처리하였으며, 소비자용 랩탑에서도 한 시간 이내에 수렴을 달성하였다.
  • 제약 조건의 완화와 관측된 궤적을 통한 경험적 제약 조건 도입으로, 모든 샘플에서 벨먼 오차가 비음수가 유지되어 안정성과 강건성이 향상됨을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.