Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Radial-Basis Value Functions for Continuous Control

Kavosh Asadi, Neev Parikh|arXiv (Cornell University)|2020. 02. 05.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 연속 제어를 위한 딥 레이디얼-베이시스 값 함수(RBF-VF)를 제안하며, 상태-행동 값 함수를 근사하기 위해 정규화된 가우시안 레이디얼 기저 함수를 사용한다. 최적의 행동이 RBF 네트워크의 앵커 포인트 집합 내에 있음을 증명하고, 오차가 부드럽게 처리하는 파rameter β에 대해 지수적으로 감소함으로써 연속 행동 공간에서 효율적이고 정확한 값 함수 최대화를 가능하게 한다.

ABSTRACT

A core operation in reinforcement learning (RL) is finding an action that is optimal with respect to a learned value function. This operation is often challenging when the learned value function takes continuous actions as input. We introduce deep radial-basis value functions (RBVFs): value functions learned using a deep network with a radial-basis function (RBF) output layer. We show that the maximum action-value with respect to a deep RBVF can be approximated easily and accurately. Moreover, deep RBVFs can represent any true value function owing to their support for universal function approximation. We extend the standard DQN algorithm to continuous control by endowing the agent with a deep RBVF. We show that the resultant agent, called RBF-DQN, significantly outperforms value-function-only baselines, and is competitive with state-of-the-art actor-critic algorithms.

연구 동기 및 목표

  • 연속 행동 공간에서 효율적이고 정확한 최대화를 가능하게 하는 연속 제어를 위한 값 함수 근사 방법을 개발하는 것.
  • 연속 행동에 대한 RBF 값 함수의 최대값이 정의된 앵커 포인트 중 하나에서 달성됨을 증명하고, 오차가 β에 대해 지수적으로 감소함을 보이는 것.
  • 부드럽고 연속적인 조건 하에서 진짜 값 함수를 근사할 때 딥 RBF 값 함수의 이론적 수렴 보장을 수립하는 것.
  • 다양한 환경에서 사용 가능한 실용적인 딥 러닝 프레임워크를 제공하며, 하이퍼파라미터 튜닝을 수행하는 것.

제안 방법

  • 각 기저 함수가 이산적 행동 앵커 $a_i$ 에 중심을 두는 정규화된 가우시안 레이디얼 기저 함수(RBF) 네트워크를 사용하여 값 함수 $\widehat{Q}_{\beta}(s,a;\theta)$ 를 매개변수화한다.
  • RBF 가중치에 소프트맥스 정규화를 적용하여 총합이 1이 되도록 하여 앵커 포인트에서의 값 예측의 볼록 조합을 형성한다.
  • 일차원 행동 공간의 경우 최대값이 앵커 포인트 중 하나에서 도달되며, 고차원에서는 진짜 최대값과 앵커 최대값 사이의 오차가 $\mathcal{O}(e^{-\beta})$ 임을 증명한다.
  • 최대값이 앵커 포인트 근처에 있음을 활용하여, 적절한 학습률과 반복 수를 설정한 경사상승법을 사용해 연속 행동 공간에서 RBF 값 함수를 최대화한다.
  • 여러 환경에서 부드러움 파rameter β, 학습률, 옵티마이저, 경사상승 반복 수 등의 하이퍼파라미터를 튜닝하기 위해 무작위 탐색과 격자 탐색을 사용한다.
  • 선형 프로그래밍과 연속성에 기반한 이론적 증명을 통해, 충분히 큰 $\beta$ 에서 값 함수가 임의의 연속적인 $Q^\pi(s,a)$ 를 $\epsilon$ 오차 내에서 균일하게 근사할 수 있음을 보인다.

실험 결과

연구 질문

  • RQ1연속 행동 공간에서 딥 RBF 값 함수의 최대값을 유한한 앵커 포인트 집합만을 사용해 효율적으로 근사할 수 있는가?
  • RQ2진짜 최대값과 앵커 포인트에서의 최대값 사이의 근사 오차가 부드러움 파arameter β에 따라 어떻게 변화하는가?
  • RQ3딥 RBF 값 함수는 임의의 정밀도로 어떤 연속적인 상태-행동 값 함수 $Q^\pi(s,a)$ 를 균일하게 근사할 수 있는가?
  • RQ4다양한 연속 제어 환경에서 최적의 성능을 내는 하이퍼파라미터 설정(예: β, 학습률, 옵티마이저)은 무엇인가?
  • RQ5표준 딥 RL 베이스라인인 DDPG 및 TD3와 비교했을 때 RBF 기반 접근법의 최종 성능는 어떻게 되는가?

주요 결과

  • 일차원 행동 공간의 경우 RBF 값 함수의 최대값은 정확히 앵커 포인트 $a_i$ 중 하나에서 도달되며, 이는 이산화로 인한 최적성 손실이 없음을 보장한다.
  • 고차원 행동 공간($\mathcal{A} = \mathbb{R}^d$)의 경우, 진짜 최대값과 앵커 포인트에서의 최대값 사이의 오차는 $\mathcal{O}(e^{-\beta})$ 로 유계이며, β에 대해 지수적으로 감소한다.
  • 이론적 분석을 통해 임의의 연속적인 $Q^\pi(s,a)$ 에 대해, 충분히 큰 $\beta$ 에서는 모든 $s$ 와 $a$ 에 대해 $\epsilon$ 오차 내에서 근사 가능함을 보였으며, 즉 $\beta \geq \beta_0 = -\frac{1}{\mu}\log(\frac{\epsilon}{8N\sup_a|Q^\pi(s,a)|})$ 를 만족할 경우에 해당된다.
  • 실증 평가 결과, 무작위 탐색과 격자 탐색을 통해 하이퍼파라미터를 튜닝한 RBF-DQN은 9개의 연속 제어 도메인에서 DDPG 및 TD3를 초월하는 최종 성능를 기록하였다.
  • 고정된 네트워크 아키텍처(1~3개의 은닉층, 128 또는 512개의 뉴런)를 사용하여 다양한 환경에서 안정적인 성능를 확보하였으며, 평균 에피소드 리워드를 기반으로 최적의 하이퍼파라미터를 선택하였다.
  • RBF 접근법은 앵커 포인트 근처에서 경사상승법을 통해 효율적이고 정확한 행동 선택을 가능하게 하여 연속 행동 공간에서의 전수 탐색이 필요 없게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.