Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Tensegrity Locomotion on Rough Terrain via Reinforcement Learning

David Surovik, Kun Wang|arXiv (Cornell University)|2018. 09. 27.
Structural Analysis and Optimization참고 문헌 19인용 수 5
한 줄 요약

이 논문은 6바늘 텐스그리티 로봇을 위한 강화학습 기반 제어기를 제안하며, 개선된 가이드드 정책 검색(GPS) 프레임워크를 통해 거친 지형에서 적응형 비정기적인 이동을 가능하게 한다. 다중 모드 국소 모델링과 사후 데이터 로컬라이제이션을 도입함으로써, 동적 접촉 반응을 수반하는 복잡한 불균일한 지형을 안정적으로 통과할 수 있으며, 이는 이전의 정기적 제어 방법보다 뚜렷이 뛰어난 성능을 보인다.

ABSTRACT

The dynamical properties of tensegrity robots give them appealing ruggedness and adaptability, but present major challenges with respect to locomotion control. Due to high-dimensionality and complex contact responses, data-driven approaches are apt for producing viable feedback policies. Guided Policy Search (GPS), a sample-efficient and model-free hybrid framework for optimization and reinforcement learning, has recently been used to produce periodic locomotion for a spherical 6-bar tensegrity robot on flat or slightly varied surfaces. This work provides an extension to non-periodic locomotion and achieves rough terrain traversal, which requires more broadly varied, adaptive, and non-periodic rover behavior. The contribution alters the control optimization step of GPS, which locally fits and exploits surrogate models of the dynamics, and employs the existing supervised learning step. The proposed solution incorporates new processes to ensure effective local modeling despite the disorganized nature of sample data in rough terrain locomotion. Demonstrations in simulation reveal that the resulting controller sustains the highly adaptive behavior necessary to reliably traverse rough terrain.

연구 동기 및 목표

  • 거칠고 비정형 지형에서 비정기적이고 적응형 이동을 가능하게 하여 이전의 정기적 제어 정책의 한계를 극복하는 것.
  • 복잡한 접촉 역학을 갖는 텐스그리티 로봇을 위한 강화학습에서 발생하는 비정돈되고 고차원적인 샘플 데이터 문제를 해결하는 것.
  • 지속적인 적응형 행동을 지원하기 위해 국소 역학 모델링과 데이터 구성 개선을 통해 가이드드 정책 검색(GPS) 프레임워크를 확장하는 것.
  • 기울어진 불규칙한 지형 요소를 안정적으로 통과시킬 수 있는 피드백 정책의 견고하고 샘플 효율적인 학습을 입증하는 것.
  • 다양한 고차원성과 유연성을 갖는 다른 로봇 시스템에 적용 가능한 확장 가능한 알고리즘 기반을 제공하는 것.

제안 방법

  • 거친 지형에서 유도된 비정돈된 샘플 데이터에 더 잘 적합하기 위해, 제어 최적화 단계를 수정하여 역학의 다중 모드 국소 모델링을 통합함으로써 GPS 프레임워크를 개선하였다.
  • 클러스터링을 통한 사후 데이터 로컬라이제이션을 도입하여 유사한 상태를 그룹화함으로써, 궤도가 비정기적이고 불규칙하더라도 효과적인 국소 서브모델링이 가능하도록 하였다.
  • 차원 축소와 대칭성 활용을 통해 샘플 복잡도를 감소시키고 다양한 지형 구성에 대한 일반화 능력을 향상시켰다.
  • 정교화된 국소 역학 모델을 기반으로 감독학습을 적용하여 피드백 정책을 피팅함으로써 안정적이고 적응형 제어 정책을 확보하였다.
  • 감독학습과 국소 역학 피팅을 번갈아 적용하는 하이브리드 최적화 파이프라인을 활용하여 샘플 효율성을 유지하면서도 복잡한 행동을 가능하게 하였다.
  • 실제 물리 법칙과 지형 변화를 반영한 NTRT 환경에서 시뮬레이션을 통해 6바늘 텐스그리티 로버를 대상으로 방법을 검증하였다.

실험 결과

연구 질문

  • RQ1강화학습 기반 제어기가 텐스그리티 로봇의 거친 지형에서 비정기적이고 적응형 이동을 달성할 수 있는가?
  • RQ2복잡한 지형 상호작용으로 인한 비정돈되고 비정기적인 샘플 데이터가 존재할 경우, 국소 역학 모델링을 어떻게 향상시킬 수 있는가?
  • RQ3단일 모드 모델링 대비 다중 모드 국소 모델링이 제어 성능과 내구성에 얼마나 기여하는가?
  • RQ4GPS 프레임워크는 고차원성과 유연성을 갖는 로봇 시스템에서 정기적인 보행을 초월해 지속적인 적응형 행동을 지원할 수 있도록 확장될 수 있는가?
  • RQ5사후 데이터 로컬라이제이션은 비정기적 이동 작업에 있어 효과적인 학습을 어떻게 가능하게 하는가?

주요 결과

  • 제안된 제어기는 한 지형 요소를 통과할 때 바의 길이의 2/3 이상을 초월하는 순 높이 상승을 기록하며, 높은 적응성을 입증하였다.
  • 다중 모드 피팅은 단일 모드 피팅 대비 비용 함수를 10퍼센트 이상 감소시켰으며, 갇힘 상태의 빈도를 크게 감소시켰다.
  • 수평 및 내리막 구간에서는 부드러운 질량중심(CoM) 궤적을 유지하며 900단계(1.5분) 동안 전진 운동을 지속했고, 오르막 구간에서는 적응형 반응을 보였다.
  • 정기성에 대한 의존도를 감소시켜 모든 축 방향의 운동을 가능하게 하였으며, 좁거나 위험한 지형 구조에서의 주행 가능성을 향상시켰다.
  • 사후 데이터 로컬라이제이션과 다중 모드 모델링을 활용함으로써, 비정규적이고 비정돈된 샘플 데이터 속에서도 효과적인 국소 역학 근사가 가능했다.
  • 복잡한 접촉 기하학과 지형 변화에 대해 뛰어난 내구성을 보이며, 이전의 정기적 제어기 대비 적응성과 내구성 측면에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.