[논문 리뷰] Symbolic Regression for Constructing Analytic Models in Reinforcement Learning
이 논문은 실시간 강화학습(RL) 제어를 위한 한정된 데이터에서 자동으로 간결하고 해석 가능한 해석적 모델을 구성하기 위해 기호적 회귀(SR)를 사용하는 것을 제안한다. 상태공간 및 NARX형 입력-출력 모델에 SR을 적용함으로써, 깊은 신경망과 국소 선형 회귀보다 뛰어난 성능을 달성하였으며, 단지 100개의 데이터 샘플만으로도 실제 펜듈럼에서의 스윙업 제어를 성공적으로 수행하였다.
Reinforcement learning (RL) is a widely used approach for controlling systems with unknown or time-varying dynamics. Even though RL does not require a model of the system, it is known to be faster and safer when using models learned online. We propose to employ symbolic regression (SR) to construct parsimonious process models described by analytic equations for real-time RL control. We have tested our method with two different state-of-the-art SR algorithms which automatically search for equations that fit the measured data. In addition to the standard problem formulation in the state-space domain, we show how the method can also be applied to input-output models of the NARX (nonlinear autoregressive with exogenous input) type. We present the approach on three simulated examples with up to 14-dimensional state space: an inverted pendulum, a mobile robot, and a biped walking robot. A comparison with deep neural networks and local linear regression shows that SR in most cases outperforms these commonly used alternative methods. We demonstrate on a real pendulum system that the analytic model found enables RL to successfully perform the swing-up task, based on a model constructed from only 100 data samples.
연구 동기 및 목표
- 제한된 데이터로부터 해석 가능한 해석적 과정 모델을 구성하여 강화학습의 샘플 효율성과 안전성을 향상시키기 위해.
- 모델링이 불확실하거나 시간에 따라 변하는 행동을 보이는 시스템의 복잡한 비선형 역학을 다루기 위해.
- 계산적으로 효율적이고 해석 가능한 간결한 닫힌형 수식을 생성함으로써 실시간 RL 제어를 가능하게 하기 위해.
- 정확도, 샘플 효율성, 내구성 측면에서 기호적 회귀를 깊은 신경망과 국소 선형 회귀와 비교하기 위해.
- 고차원 상태공간을 포함한 시뮬레이션 및 실제 로봇 시스템에서 방법을 검증하기 위해.
제안 방법
- 측정된 시스템 데이터에 가장 잘 맞는 해석 수식을 찾기 위해 최신 기법인 두 가지 기호적 회귀 알고리즘을 사용한다.
- 역학적 행동을 포괄하기 위해 상태공간 및 NARX(비선형 자기회귀 모델, 외부 입력 포함) 프레임워크에서 시스템 모델링 문제를 설정한다.
- 데이터 기반의 수식 발견을 통해 시스템 역학을 표현함으로써, 단순성과 해석 가능성 보장.
- 기호 모델을 사용해 강화학습 에이전트를 훈련시켜 스윙업 및 안정화와 같은 제어 작업을 수행한다.
- 예측 정확도와 RL 제어 성공률을 다양한 모델 유형 간 비교함으로써 모델 성능을 평가한다.
- 최대 14차원 상태공간을 가진 시스템, 즉 역행 펜듈럼, 이동 로봇, 이족 보행기 등에 방법을 적용한다.
실험 결과
연구 질문
- RQ1기호적 회귀는 실시간 강화학습에 사용하기 위해 한정된 데이터에서 정확하고 간결한 해석적 모델을 생성할 수 있는가?
- RQ2기호적 회귀는 비선형 시스템 역학 모델링에서 깊은 신경망과 국소 선형 회귀보다 어떻게 비교되는가?
- RQ3단지 100개의 데이터 샘플로 유도된 기호 모델은 실제 로봇 시스템에서 성공적인 RL 제어를 가능하게 하는가?
- RQ4기본 상태공간 모델링에 비해 NARX 형식이 모델 정확도와 제어 성능을 향상시키는가?
- RQ5해석 가능한 해석적 모델은 RL 기반 제어에서 샘플 효율성과 안전성 향상에 얼마나 기여하는가?
주요 결과
- 기호적 회귀는 모든 시뮬레이션 예제에서 깊은 신경망과 국소 선형 회귀보다 높은 모델링 정확도를 지속적으로 확보하였다.
- 이 방법을 통해 단지 100개의 데이터 샘플로만 구성된 해석 모델을 사용해 실제 펜듈럼의 스윙업 제어를 성공적으로 수행하였다.
- 결과로 도출된 모델들은 단순성과 해석 가능성 모두 확보하였으며, 검은 상자 기반의 깊은 학습 모델에 비해 뚜렷한 이점이 있었다.
- 이 방법은 고차원 시스템, 특히 14차원 이족 보행 로봇과 같은 시스템에서도 효과적이었으며, 확장성의 가능성을 입증하였다.
- NARX 형식은 입력-출력 모델링을 위한 타당한 대안을 제공하였으며, 특정 동역학 영역에서 모델 적합도를 향상시켰다.
- 기호 모델의 사용으로 인해 엔드 투 엔드 신경망 학습 모델에 비해 더 빠르고 안정적인 RL 훈련이 가능하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.