Skip to main content
QUICK REVIEW

[논문 리뷰] Learning RoboCup-Keepaway with Kernels

Tobias Jung, Daniel Polani|arXiv (Cornell University)|2012. 01. 31.
Reinforcement Learning in Robotics참고 문헌 22인용 수 3
한 줄 요약

이 논문은 고차원적이고 확률적인 3vs2 RoboCup-Keepaway 문제를 해결하기 위해 부분 회귀자 집합 근사법을 사용하는 정규화 네트워크를 활용한 커널 기반 강화 학습 방법을 제안한다. 효율적인 재귀적 최소 제곱법 정책 반복과 감독 기반 기저 함수 선택을 통해 기존 타일코딩보다 뛰어난 성능을 달성하며, 동적이고 데이터 기반의 기저 함수 포함을 통해 실시간 학습을 가능하게 한다.

ABSTRACT

We apply kernel-based methods to solve the difficult reinforcement learning problem of 3vs2 keepaway in RoboCup simulated soccer. Key challenges in keepaway are the high-dimensionality of the state space (rendering conventional discretization-based function approximation like tilecoding infeasible), the stochasticity due to noise and multiple learning agents needing to cooperate (meaning that the exact dynamics of the environment are unknown) and real-time learning (meaning that an efficient online implementation is required). We employ the general framework of approximate policy iteration with least-squares-based policy evaluation. As underlying function approximator we consider the family of regularization networks with subset of regressors approximation. The core of our proposed solution is an efficient recursive implementation with automatic supervised selection of relevant basis functions. Simulation results indicate that the behavior learned through our approach clearly outperforms the best results obtained earlier with tilecoding by Stone et al. (2005).

연구 동기 및 목표

  • 기존 타일코딩이 상태 공간의 파라미터 수가 기하급수적으로 증가함에 따라 실패하는 고차원 상태 공간과 실시간 학습의 과제를 해결하기 위해.
  • 다중 에이전트 환경에서 알려지지 않은 확률적 동역학에 적응할 수 있는 모델-프리, 온라인 강화 학습 방법을 개발하기 위해.
  • 감독 기반 기준을 사용해 관련성이 있는 기저 함수만 동적으로 선택함으로써 효율적인 실시간 학습을 가능하게 하기 위해.
  • 3vs2 Keepaway 작업에서 기존 타일코딩 기반 접근법에 비해 학습 효율성과 최종 성능 측면에서 뛰어난 성능을 내기 위해.

제안 방법

  • 고차원 상태 공간에서 가치 함수를 추정하기 위해 정규화 네트워크를 기저 함수 근사기로 사용하는 최소 제곱법 정책 반복(LSPE(λ))를 사용한다.
  • 기저 함수의 감소된, 동적으로 선택된 집합을 사용하여 커널 함수를 부분 회귀자 방법으로 근사한다.
  • 학습 비용 감소에 기여하는 정도를 기준으로 우선순위를 정하는 탐욕적이고 온라인 기저 함수 선택 전략을 적용한다. 단순히 근사 오차가 아닌 기여도를 고려한다.
  • 단계별 복잡도가 선택된 기저 함수의 수에만 의존하는 효율적인 온라인 학습을 위한 재귀적 업데이트 메커니즘을 도입한다.
  • 각 후보 기저 함수의 영향을 원래 학습 비용 감소에 미치는 영향을 평가하는 감독 기반 선택 기준을 통합한다.
  • 재귀적 행렬 역행렬 및 벡터 업데이트 공식을 사용하여 온라인 훈련 및 추론 중에도 계산 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1동적 기저 함수 선택을 통한 커널 기반 함수 근사가 RoboCup-Keepaway와 같은 고차원적이고 확률적인 강화 학습 과제에서 기존 타일코딩을 능가할 수 있는가?
  • RQ2감독 기반 기저 함수 선택 기준은 성능을 유지하거나 향상시키면서도 기저 함수의 수를 얼마나 효과적으로 줄일 수 있는가?
  • RQ3재귀적 최소 제곱법 기반 정책 반복 프레임워크는 100ms당 액션 주기 환경에서 실시간 온라인 학습에 충분히 효율적으로 작동할 수 있는가?
  • RQ4상태 변수 간의 독립성에 대한 단순화 가정 없이 전체 상태 벡터(13차원)를 사용하는 것이, 상태 변수를 분리한 이전 연구에 비해 더 나은 성능을 내는가?
  • RQ5기존 격자 기반 방법에 비해 제안된 방법이 상태 공간의 방문되지 않은 영역에서 파라미터 낭비를 얼마나 줄이는가?

주요 결과

  • 제안된 커널 기반 방법은 Stone 등(2005)의 타일코딩 방법보다 유의미하게 뛰어난 성능을 보이며, 3vs2 Keepaway 작업에서 평균 에피소드 길이가 더 길다.
  • 감독 기반 기저 함수 선택 기준을 사용함으로써 필요한 기저 함수의 수가 감소하여 계산 효율성이 향상되고 단계별 복잡도가 낮아진다.
  • 재귀적 구현 덕분에 100ms 액션 사이클을 충족시키는 실시간 학습이 가능해졌다.
  • 상태 변수 간의 독립성에 대한 단순화 가정 없이도 고차원 상태 공간(13차원)을 효과적으로 처리할 수 있었다.
  • 부분 회귀자 근사 방법은 전체 커널 방법 대비 계산 오버헤드를 크게 줄이면서도 높은 정확도를 유지한다.
  • 환경의 확률적 특성과 다중 에이전트 협동 동역학에 대해 학습 성능가 강건하며, 복잡하고 알려지지 않은 환경에서도 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.