[논문 리뷰] Learning multiple gaits of quadruped robot using hierarchical reinforcement learning
이 논문은 속도 명령에 따라 여러 자세(트로트, 페이스, 번드)를 학습할 수 있는 계층적 강화학습 컨트롤러를 제안한다. 이는 중앙패턴발진기(CPG)를 통한 자세 선택과 각 관절 추적을 위한 국소 피드백 컨트롤러로 구성된 이중 수준 정책을 사용한다. 이 방법은 다양한 속도 범위에서 에너지 효율적인 이동을 달성하며, 속도에 관계없이 한 가지 자세로 고정되는 단일 정책 접근 방식보다 뛰어난 성능을 보인다.
There is a growing interest in learning a velocity command tracking controller of quadruped robot using reinforcement learning due to its robustness and scalability. However, a single policy, trained end-to-end, usually shows a single gait regardless of the command velocity. This could be a suboptimal solution considering the existence of optimal gait according to the velocity for quadruped animals. In this work, we propose a hierarchical controller for quadruped robot that could generate multiple gaits (i.e. pace, trot, bound) while tracking velocity command. Our controller is composed of two policies, each working as a central pattern generator and local feedback controller, and trained with hierarchical reinforcement learning. Experiment results show 1) the existence of optimal gait for specific velocity range 2) the efficiency of our hierarchical controller compared to a controller composed of a single policy, which usually shows a single gait. Codes are publicly available.
연구 동기 및 목표
- 단일 정책 강화학습의 한계를 해결하기 위해, 속도 명령에 관계없이 항상 한 가지 자세만 학습하는 경향이 있는 문제를 다룬다.
- 4족 로봇이 원하는 속도에 따라 자율적으로 여러 자세(트로트, 페이스, 번드)를 선택하고 전환할 수 있도록 한다.
- CPG 기반 자세 계획과 국소 피드백을 통한 계층적 제어를 활용하여 에너지 효율성 향상과 속도 추적 성능 향상을 도모한다.
- 생물학적 4족 동물에서 관찰되는 바와 같이 최적의 자세 선택이 속도에 따라 달라진다는 점을 입증한다.
- 기준 운동 데이터나 히우리스틱 보상 설계에 의존하지 않고도 확장 가능하고 견고한 다자세 이동을 위한 프레임워크를 제공한다.
제안 방법
- 컨트롤러는 고수준 CPG 정책을 통한 자세 선택 및 주기 조절, 저수준 피드백 정책을 통한 관절 토크 제어로 구성된 이중 수준 계층적 구조를 사용한다.
- 고수준 정책은 CPG 단계와 주기 신호를 출력하며, 이는 네 다리에 걸쳐 리듬적인 자세 패턴을 생성하는 데 사용된다.
- 저수준 정책은 CPG 신호와 실시간 발판 접촉/환경 피드백을 이용하여 PD 제어 및 국소 피드백을 통해 관절 토크를 계산한다.
- 훈련 중에 속도 명령 범위를 점진적으로 증가시키는 커리큘럼 학습 전략을 적용하여 정책의 일반화 능력을 향상시킨다.
- 보상 함수는 여러 비용 항목을 조합하여 구성되며, 속도 추적 오차(각속도 및 선속도), 토크 노력, 관절 속도, 발 높이, 미끄러짐, 자세, 부드러움, 다리 단계 일관성 등을 포함한다.
- CPG 신호는 단계 이동과 주기 조절을 가능하게 하여 자세 간 전환을 가능하게 하지만, 전환 중 급격한 단계 변화는 추적 성능을 떨어뜨린다.
실험 결과
연구 질문
- RQ1강화학습 컨트롤러는 다양한 속도 명령에 반응하여 트로트, 페이스, 번드와 같은 다수의 고유한 자세를 학습할 수 있는가?
- RQ2CPG 기반 고수준 정책을 갖는 계층적 제어는 단일 정책 엔드 투 엔드 접근 방식보다 더 뛰어난 에너지 효율성과 자세 적응성 제공가능한가?
- RQ3다자세 컨트롤러의 성능은 속도 추적 오차와 에너지 소비 측면에서 단일 자세 기반 베이스라인과 비교해 어떻게 되는가?
- RQ4CPG 단계와 주기는 부드러운 자세 전환과 적응형 이동을 가능하게 하는 데 어떤 역할을 하는가?
- RQ5컨트롤러는 생물학적 4족 동물의 행동을 모방하여 속도에 따라 최적의 자세 선택을 학습할 수 있는가?
주요 결과
- 제안된 계층적 컨트롤러는 다양한 속도 범위에서 트로트, 페이스, 번드와 같은 여러 자세를 성공적으로 학습하고 실행하여 적응형 자세 선택을 입증했다.
- 단일 정책 기반 베이스라인 대비 특정 속도 범위에서 더 낮은 에너지 소비를 달성하여 효율성 향상을 입증했다.
- 단일 정책 기반 베이스라인은 명령 속도에 관계없이 항상 한 가지 자세(트로트)로 수렴하여 비자연스럽고 비최적의 이동을 보였다.
- 속도 추적 오차는 급격한 CPG 단계 전환으로 인해 다자세 컨트롤러에서 더 높게 나타났으며, 이는 더 부드러운 단계 처리가 필요함을 시사한다.
- CPG 기반 컨트롤러는 접촉 간섭에 대해 뛰어난 견고성을 보이며, 다양한 자세에서 안정적인 이동을 유지했으며, 접촉 및 CPG 신호 플롯을 통해 확인되었다.
- 발 높이, 미끄러짐, 부드러움 항목을 포함한 비용 함수 설계가 안정적이고 안전한 이동을 가능하게 하였으며, 최소한의 발 미끄러짐과 최적의 높이 유지에 기여했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.