Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Locomote with Deep Neural-Network and CPG-based Control in a Soft Snake Robot

Xuan Liu, Renato Gasoto|arXiv (Cornell University)|2020. 01. 13.
Soft Robotics and Applications참고 문헌 36인용 수 4
한 줄 요약

이 논문은 소프트 스네이크 로봇을 위한 하이브리드 딥 강화학습(PPOC-CPG) 및 센트럴 패턴 제너레이터(CPG) 제어 프레임워크를 제안한다. 이는 적응형 목표 추적과 다양한 운동 방식을 가능하게 한다. PPO 기반 정책과 주파수와 진폭을 별도로 제어할 수 있는 마츠오카 온도기 CPG를 결합함으로써, 시뮬레이션 및 실제 실험에서 안정적이고 효율적이며 적응적인 운동을 달성한다. 정책은 6,400개의 학습 에피소드 후에 동적 목표로 일반화된다.

ABSTRACT

In this paper, we present a new locomotion control method for soft robot snakes. Inspired by biological snakes, our control architecture is composed of two key modules: A deep reinforcement learning (RL) module for achieving adaptive goal-tracking behaviors with changing goals, and a central pattern generator (CPG) system with Matsuoka oscillators for generating stable and diverse locomotion patterns. The two modules are interconnected into a closed-loop system: The RL module, analogizing the locomotion region located in the midbrain of vertebrate animals, regulates the input to the CPG system given state feedback from the robot. The output of the CPG system is then translated into pressure inputs to pneumatic actuators of the soft snake robot. Based on the fact that the oscillation frequency and wave amplitude of the Matsuoka oscillator can be independently controlled under different time scales, we further adapt the option-critic framework to improve the learning performance measured by optimality and data efficiency. The performance of the proposed controller is experimentally validated with both simulated and real soft snake robots.

연구 동기 및 목표

  • 복잡한 비선형 역학을 가진 소프트 스네이크 로봇이 동적인 환경에서 적응형 목표 추적 운동을 수행할 수 있도록 생물학적으로 영감을 받은 제어 프레임워크를 개발하는 것.
  • 고도의 자유도와 비선형 액추에이터 역학을 가진 소프트 로봇을 제어하기 위한 하이브리드 학습 및 진동 제어 접근법을 적용하는 것.
  • 마츠오카 온도기 파rameter(주파수 및 진폭)의 시간 스케일 분리 특성을 활용하여 강화학습의 데이터 효율성과 학습 성능을 향상시키는 것.
  • 모의 환경과 실제 소프트 스네이크 로봇 플랫폼에서 모두 컨트롤러의 강인성과 일반화 능력을 검증하는 것.

제안 방법

  • 딥 강화학습 에이전트(PPOC-CPG)는 CPG 네트워크의 두 입력을 조절하도록 훈련된다: 신경 자극(위상 및 진폭 조절용)과 주파수 비율(속도 제어용).
  • CPG 네트워크는 결합된 마츠오카 온도기로 구성되며, 진동 주파수와 파형 진폭을 별도로 제어할 수 있어 다양한 운동 패턴을 가능하게 한다.
  • 샘플 효율성과 수렴성을 향상시키기 위해 종료 함수와 동적 주파수 이득 $K_f$ 조정을 포함한 커리큘럼 학습 전략을 사용한다.
  • 모의 학습 동안 도메인 랜덤라이제이션을 적용하여, 측정된 값 주변의 분포에서 마찰 계수와 같은 물리적 파라미터를 샘플링함으로써 시뮬레이션에서 실제 환경으로의 도메인 갭을 줄인다.
  • 실시간 상태 피드백과 저지연 무선 제어를 위해 모션 캡처 시스템을 활용하여 정책을 직접 실제 소프트 스네이크 로봇으로 이식한다.
  • 정책은 정적 및 천천히 움직이는 목표를 향한 목표 도달 작업에서 평가되었으며, 고정된 목표 학습을 초월한 강인성과 적응성을 입증했다.

실험 결과

연구 질문

  • RQ1하이브리드 딥 강화학습 및 CPG 기반 제어 시스템은 복잡한 비선형 역학을 가진 소프트 스네이크 로봇에서 적응형 목표 추적을 가능하게 할 수 있는가?
  • RQ2마츠오카 온도기 주파수와 진폭의 별도 제어가 운동 다양성과 학습 효율성을 어떻게 향상시킬 수 있는가?
  • RQ3모의 환경에서 학습된 정책이 최소한의 시뮬레이션-실세계 전이 노력으로 실제 소프트 로봇의 운동에 얼마나 잘 일반화되는가?
  • RQ4커리큘럼 학습과 도메인 랜덤라이제이션은 소프트 로봇 운동 제어를 위한 학습에서 데이터 효율성과 수렴성을 어떻게 향상시킬 수 있는가?

주요 결과

  • PPOC-CPG 컨트롤러는 6,400개의 학습 에피소드 후에 근사 최적의 정책으로 수렴하였으며, 4대의 병렬 로봇을 사용해 약 12시간 동안 학습을 완료하였다.
  • 정책은 시뮬레이션 및 실제 실험에서 정적 및 천천히 움직이는 목표를 성공적으로 추적하여, 고정된 목표 학습을 초월한 일반화 능력을 입증했다.
  • 실제 로봇의 평균 속도는 0.092 m/s를 기록했으며, 조정된 마찰 계수 하에서 시뮬레이션 로봇의 평균 속도 0.083 m/s와 유사하게 나타났다.
  • 컨트롤러는 이중 단계 운동 전략을 보였는데, 목표에서 멀리 떨어져 있을 땐 낮은 주파수에서 고속 이동하고, 목표에 가까워지면 높은 주파수로 전환하여 정밀한 접근과 회전을 수행했다.
  • 도메인 랜덤라이제이션 덕분에 모의 정확도 부족에 대비한 강인성이 확보되어 실제 환경 전이 성능이 향상되었다.
  • 모의 환경과 실제 로봇 간에 상태 진화 지연이 관찰되었으며, 이는 접촉 역학 모델링의 정확도 부족 때문일 가능성이 높아, 향상된 물리 모델링 또는 적응형 피드백 메커니즘의 필요성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.