Skip to main content
QUICK REVIEW

[논문 리뷰] Control Frequency Adaptation via Action Persistence in Batch Reinforcement Learning

Alberto Maria Metelli, Flavio Mazzolini|arXiv (Cornell University)|2020. 02. 17.
Reinforcement Learning in Robotics참고 문헌 53인용 수 6
한 줄 요약

이 논문은 배치 강화 학습에서 제어 주파수를 조절하기 위해 행동 지속성—다수의 결정 단계 동안 동일한 행동을 반복하는 것—을 도입한다. 이를 통해 다양한 지속성 수준에서 최적의 정책을 학습할 수 있는 Persistent Fitted Q-Iteration (PFQI)를 제안한다. 이론적으로 성능 손실의 상한을 도출하고, 최적의 지속성을 선택하기 위한 히우리스틱을 제안하며, CartPole 및 Mountain Car와 같은 벤치마크 환경에서 더 높은 샘플 효율성과 성능 향상을 입증한다.

ABSTRACT

The choice of the control frequency of a system has a relevant impact on the ability of reinforcement learning algorithms to learn a highly performing policy. In this paper, we introduce the notion of action persistence that consists in the repetition of an action for a fixed number of decision steps, having the effect of modifying the control frequency. We start analyzing how action persistence affects the performance of the optimal policy, and then we present a novel algorithm, Persistent Fitted Q-Iteration (PFQI), that extends FQI, with the goal of learning the optimal value function at a given persistence. After having provided a theoretical study of PFQI and a heuristic approach to identify the optimal persistence, we present an experimental campaign on benchmark domains to show the advantages of action persistence and proving the effectiveness of our persistence selection method.

연구 동기 및 목표

  • 배치 RL 환경에서 제어 주파수와 샘플 복잡도 사이의 상충 관계를 해결한다.
  • 행동 지속성—다수의 단계 동안 동일한 행동을 반복하는 것—이 정책 성능과 가치 함수 추정에 미치는 영향을 조사한다.
  • 환경 상호작용 없이도 최적의 지속성 수준을 자동으로 선택할 수 있는 방법을 개발하여, 배치 학습에서 정책 성능을 향상시킨다.
  • 기본 MDP에서 ∆t₀ 시간 단위로 수집된 데이터셋을 사용해, Fitted Q-Iteration를 확장하여 다양한 지속성 수준에서 최적의 정책을 학습할 수 있도록 한다.
  • 학습 시 높은 지속성에서 학습하고, 더 낮은 지속성에서 배포하는 것이 더 나은 성능을 낼 수 있음을 입증하며, 학습과 배포의 지속성 수준이 동일해야 한다는 기존의 가정을 도전한다.

제안 방법

  • 행동 지속성을 k개의 연속적인 결정 단계 동안 동일한 행동을 반복하는 것으로 정의하여, 제어 주파수를 k 배수로 감소시킨다.
  • 이론적 분석을 통해 지속적 벨먼 연산자가 수축성을 유지함을 보이며, 리프시츠 조건 하에서 정확한 가치 함수 수렴이 가능하다.
  • 기존 FQI를 확장하여, 기저 MDP에서 ∆t₀ 시간 단위로 수집된 데이터셋을 사용해 목표 지속성 k에 대한 최적의 Q-함수를 학습하는 Persistent Fitted Q-Iteration (PFQI)를 제안한다.
  • 가치 함수의 차이와 상태 방문 빈도를 기반으로 한 히우리스틱 지수를 도입하여, 환경 상호작용 없이도 최적의 지속성 수준을 추정한다.
  • 데이터 수집 시 샘플링 지속성 (ksampling)을 사용해 더 높은 지속성 MDP를 시뮬레이션함으로써, 낮은 주파수의 동역학에서도 데이터 효율성을 유지하면서 학습을 가능하게 한다.
  • 다양한 지속성에서 학습된 정책을 평가하고, 다양한 배포 지속성에서의 성능을 테스트하여 최적의 일반화 성능을 도출한다.

실험 결과

연구 질문

  • RQ1행동 지속성이 마코프 결정 과정에서 최적 정책의 성능에 어떤 영향을 미치는가?
  • RQ2리프시츠 연속 환경에서 행동 지속성 증가(즉, 제어 주파수 감소)로 인해 발생하는 성능 손실을 이론적으로 상한으로 제시할 수 있는가?
  • RQ3학습과 배포 주파수가 다를 때, 하나의 정책을 학습하여 다양한 배포 지속성 수준에서 잘 일반화할 수 있는가?
  • RQ4추가적인 환경 상호작용 없이도 히우리스틱 선택 방법으로 최적의 지속성 수준을 식별할 수 있는가?
  • RQ5학습 시 높은 지속성에서 학습하고, 더 낮은 지속성에서 배포하는 것이 동일한 지속성에서 학습하고 배포하는 것보다 더 나은 성능을 낼 수 있는가?

주요 결과

  • PFQI는 기저 주파수 ∆t₀에서 수집된 단일 배치 데이터셋을 사용해 다양한 지속성 수준 k에 대해 최적의 Q-함수를 성공적으로 학습한다.
  • CartPole 환경에서 k=4와 k=8로 학습한 정책는 각각 284.3±1.6과 285.9±1.1의 근사 최적 수익을 달성하여, 낮거나 높은 k 값보다 유의미하게 뛰어난 성능을 보였다.
  • 특정 지속성 k에서 학습된 정책의 성능은 더 낮은 지속성 k₁ < k에서 배포할 경우 향상되었으며, 특히 k₁가 k보다 작을 경우 최고의 성능가 관찰되어, 높은 지속성에서 학습하는 것이 더 나은 일반화 능력을 제공함을 시사한다.
  • Mountain Car 환경에서는 균일 정책이 목표에 도달하기 위해 최소 ksampling=8의 샘플링 지속성이 필요했으며, 이는 희소 보상 과제에서 지속성의 중요성을 강조한다.
  • 히우리스틱 지속성 선택 방법은 CartPole와 Mountain Car 양 환경에서 근사 최적의 k 값을 성공적으로 식별하였으며, 각각의 경우 최고 성능에 매우 가까운 성능을 달성했다.
  • k에서 학습된 정책를 다양한 k₁에서 평가한 결과, 항상 k₁ < k에서 최고의 성능가 기록되었으며, 이는 높은 지속성에서 학습하는 것이 더 높은 배포 유연성을 제공함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.