Skip to main content
QUICK REVIEW

[논문 리뷰] A Framework for Studying Reinforcement Learning and Sim-to-Real in Robot Soccer

Hansenclever F. Bassani, Renie A. Delgado|arXiv (Cornell University)|2020. 08. 18.
Reinforcement Learning in Robotics참고 문헌 30인용 수 7
한 줄 요약

이 논문은 IEEE Very Small Size Soccer (VSSS) 리그에서 시뮬레이션에서 강화학습(RL) 정책을 훈련하고 실제 로봇 축구 에이전트로 전이하는 데 사용할 수 있는 오픈소스 프레임워크인 VSSS-RL을 소개한다. 연속 제어를 위한 DDPG와 SAC를 사용함으로써, 이 프레임워크는 전체 에이전트 행동 학습을 가능하게 하였으며, 2019년 라틴 아메리카 로봇 경연대회(LARC)에서 4위를 기록하여 이 대회에서 엔드 투 엔드 RL의 첫 성공적인 적용을 이룩하였다.

ABSTRACT

This article introduces an open framework, called VSSS-RL, for studying Reinforcement Learning (RL) and sim-to-real in robot soccer, focusing on the IEEE Very Small Size Soccer (VSSS) league. We propose a simulated environment in which continuous or discrete control policies can be trained to control the complete behavior of soccer agents and a sim-to-real method based on domain adaptation to adapt the obtained policies to real robots. Our results show that the trained policies learned a broad repertoire of behaviors that are difficult to implement with handcrafted control policies. With VSSS-RL, we were able to beat human-designed policies in the 2019 Latin American Robotics Competition (LARC), achieving 4th place out of 21 teams, being the first to apply Reinforcement Learning (RL) successfully in this competition. Both environment and hardware specifications are available open-source to allow reproducibility of our results and further studies.

연구 동기 및 목표

  • 수동으로 설정한 규칙로는 구현하기 어려운 완전하고 일반적인 로봇 축구 행동을 훈련하는 데 도전하는 것.
  • 동적인 경쟁적 로봇 축구 환경에서 시뮬레이션과 실제 환경 간의 현실성 격차를 해소하는 것.
  • 다중 에이전트 및 연속 제어 시나리오에서 강화학습과 시뮬레이션에서 실제 환경으로의 연구를 위한 재현 가능한 오픈소스 벤치마크를 제공하는 것.
  • DDPG, SAC, DQN과 같은 이면 강화학습 방법이 VSSS 로봇을 위한 복잡하고 적응적인 행동을 학습하는 데 얼마나 효과적인지 평가하는 것.
  • 최소한의 실제 환경 보정을 통해 시뮬레이션에서 훈련된 정책을 실제 로봇으로 전이하는 것이 가능한지 입증하는 것.

제안 방법

  • VSSS 리그를 위한 맞춤형 OpenAI Gym 호환 환경을 개발하여 연속 행동 공간을 지원하는 시뮬레이션 및 실제 로봇 제어를 가능하게 하였다.
  • 고수준 명령을 저수준 모터 동작으로 추상화하기 위해 피드포워드 신경망을 사용한 도메인 적응 방법을 구현하여 현실성 격차를 감소시켰다.
  • 세 가지 이면 강화학습 알고리즘(DQN, DDPG, SAC)을 사용하여 정책을 훈련시켰다.
  • 공 밀기, 상대 블로킹, 벽 반사, 정밀한 슛팅과 같은 복잡한 행동을 유도하기 위해 리워드 형상화 함수를 설계하였다.
  • 3대3 팀 전에서 가장 우수한 단일 에이전트 정책(DDPG 기반)을 실제 경쟁에서 3대의 로봇에 배포하였다.
  • 시뮬레이션 환경과 저비용으로 재현 가능한 로봇의 하드웨어 사양을 공개함으로써 재현 가능성을 확보하였다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 강화학습이 시뮬레이션에서 VSSS 로봇을 위한 완전하고 일반적인 행동 정책을 훈련시켜 실제 경쟁 환경으로 일반화시킬 수 있는가?
  • RQ2다양한 이면 강화학습 알고리즘(DQN, DDPG, SAC)이 시뮬레이션 환경에서 로봇 축구를 위한 연속 제어 정책을 학습하는 데 어떻게 비교되는가?
  • RQ3피드포워드 신경망 기반의 도메인 적응 방법이 현실성 격차를 얼마나 감소시키고 성공적인 시뮬레이션에서 실제 환경으로의 전이를 가능하게 하는가?
  • RQ4강화학습으로 훈련된 정책이 실제 경쟁적 로봇 축구 대회에서 수동으로 설정한 정책을 능가할 수 있는가?
  • RQ5수동으로 제작하기 어려운 복잡하고 부동적인 행동은 어떤 것이며, 강화학습을 통해 어떤 복잡한 행동이 학습될 수 있는가?

주요 결과

  • DDPG와 SAC 알고리즘이 정밀한 속도 제어를 위한 연속 제어 출력을 생성할 수 있는 능력 덕분에 DQN보다 뛰어난 성능을 보였다.
  • 비록 최종 성능가 유사하지만, 여러 랜덤 시드에서 훈련이 더 안정적으로 이루어진 점을 감안할 때, SAC가 DDPG보다 더 높은 훈련 안정성을 보였다.
  • 훈련된 정책들은 공 밀기, 상대 블로킹, 벽 반사, 정교한 슛팅과 같은 풍부한 복잡한 행동 레퍼토리를 습득하였다.
  • 2019년 라틴 아메리카 로봇 경연대회(LARC)에서 21개 팀 중 4위를 기록하였으며, 상위 팀들과의 경기에서 결정적인 승리를 거두었으며(예: 14–4, 11–1), 다수의 승리를 거두었다.
  • 이로써 VSSS 리그 대회에서 엔드 투 엔드 강화학습을 통한 전체 에이전트 제어의 첫 성공적인 적용 사례가 되었다.
  • 프레임워크는 다양한 랜덤 초기화에서 일관된 결과를 보이며 하이퍼파라미터 선택에 대해 거의 민감하지 않아 높은 재현 가능성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.