Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Directed Locomotion in Modular Robots with Evolvable Morphologies

Gongjin Lan, Matteo De Carlo|arXiv (Cornell University)|2020. 01. 21.
Modular Robots and Swarm Intelligence참고 문헌 43인용 수 14
한 줄 요약

이 논문은 베이지안 최적화와 HyperNEAT를 사용하여 진화 가능한 형태를 가진 모듈러 로봇에서 방향성 운동을 학습하는 방법을 제안한다. 베이지안 최적화가 다양한 로봇 형태에 대해 효과적인 제어기를 학습하는 데 HyperNEAT보다 더 효율적임을 입증하였으며, 실제 실험을 통해 측정 가능한 현실 격차가 존재하더라도 충분한 궤적 추적 성능을 보였다.

ABSTRACT

We generalize the well-studied problem of gait learning in modular robots in two dimensions. Firstly, we address locomotion in a given target direction that goes beyond learning a typical undirected gait. Secondly, rather than studying one fixed robot morphology we consider a test suite of different modular robots. This study is based on our interest in evolutionary robot systems where both morphologies and controllers evolve. In such a system, newborn robots have to learn to control their own body that is a random combination of the bodies of the parents. We apply and compare two learning algorithms, Bayesian optimization and HyperNEAT. The results of the experiments in simulation show that both methods successfully learn good controllers, but Bayesian optimization is more effective and efficient. We validate the best learned controllers by constructing three robots from the test suite in the real world and observe their fitness and actual trajectories. The obtained results indicate a reality gap that depends on the controllers and the shape of the robots, but overall the trajectories are adequate and follow the target directions successfully.

연구 동기 및 목표

  • 비방향성 보행을 초월한 모듈러 로봇에서의 방향성 운동 문제를 해결하기 위해.
  • 고정된 구조가 아닌 다양한 모듈러 로봇 형태에 걸쳐 제어기 학습을 연구하기 위해.
  • 랜덤으로 조합된 로봇 형태에 대해 베이지안 최적화와 HyperNEAT의 제어기 진화 효과를 평가하기 위해.
  • 학습된 제어기를 실제 로봇에 구현하고 현실 격차를 평가하기 위해.

제안 방법

  • 연구는 사전 정의된 모듈 세트에서 무작위로 조합된 형태를 가진 모듈러 로봇의 제어기를 학습하기 위해 시뮬레이션 환경을 사용한다.
  • 두 가지 학습 알고리즘인 베이지안 최적화와 HyperNEAT를 적용하여 방향성 운동을 생성하는 신경망 제어기를 진화시킨다.
  • 적합도 함수는 로봇이 목표 방향으로 얼마나 잘 이동하는지 평가하며, 이탈과 비효율적 운동에 대해 페널티를 적용한다.
  • 강화 학습을 통해 전진 성과 및 방향 정확도 기반의 보상 신호를 사용하여 제어기를 학습시킨다.
  • 시뮬레이션 후, 가장 성능이 뛰어난 제어기는 세 대의 실제 모듈러 로봇에 배포되어 일반화 능력을 테스트한다.
  • 실제 궤적과 시뮬레이션 궤적을 비교하여 다양한 형태와 제어기 유형에 대해 현실 격차를 분석한다.

실험 결과

연구 질문

  • RQ1베이지안 최적화는 다양한 모듈러 로봇 형태에 걸쳐 방향성 운동 제어기를 효과적으로 학습시킬 수 있는가?
  • RQ2베이지안 최적화의 성능은 진화 가능한 형태에 대해 제어기를 학습하는 데 HyperNEAT와 비교해 어떻게 다른가?
  • RQ3시뮬레이션에서 학습된 제어기가 실제 모듈러 로봇에 얼마나 잘 일반화되는가?
  • RQ4로봇의 형태가 운동 성능에서 현실 격차에 어떤 영향을 미치는가?
  • RQ5제어기 설계는 실제 구현 시 궤적 정확도에 어떤 영향을 미치는가?

주요 결과

  • 테스트 세트의 모든 모듈러 로봇 형태에 걸쳐 베이지안 최적화가 샘플 효율성과 최종 성능 모두에서 HyperNEAT를 뛰어넘었다.
  • 베이지안 최적화를 통해 학습된 제어기는 시뮬레이션에서 더 높은 적합도 점수를 기록하여 더 나은 방향성 운동을 의미한다.
  • 실제 실험 결과, 최고의 제어기가 목표 방향으로 로봇을 성공적으로 이동시켰지만, 시뮬레이션과는 측정 가능한 편차가 존재했다.
  • 실제 격차는 로봇 형태와 제어기 유형에 따라 크게 달라졌으며, 일부 구성에서는 다른 것보다 더 큰 격차를 보였다.
  • 실제 격차가 존재하더라도 물리적 궤적은 충분히 적절하고 방향 정확도를 유지하여 일반화 능력을 입증했다.
  • 본 연구는 진화 가능한 형태와 효율적인 학습 알고리즘의 조합이 모듈러 로봇에서 견고한 운동 학습을 가능하게 한다고 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.