[논문 리뷰] Robust Dynamic Locomotion via Reinforcement Learning and Novel Whole Body Controller
이 논문은 강화학습(RL)과 새로운 전신 운동 제어기(WBLC)를 융합하여 인간형 로봇을 위한 견고한 동적 이동 프레임워크를 제안한다. RL 정책은 단계 공간 계획자와 역진자 모델을 사용하여 다단계 보행 패tern을 학습하며, 실시간으로 외란에 강건한 제어를 가능하게 한다. WBLC는 우선순위 기반 임무 제어와 부등식 제약 조건이 있는 2차 계획 프로그램을 통해 토크 명령을 효율적으로 계산하여 시뮬레이션에서 0.1초 간격으로 520N의 힘을 받는 상황에서도 견고성을 확보한다.
We propose a robust dynamic walking controller consisting of a dynamic locomotion planner, a reinforcement learning process for robustness, and a novel whole-body locomotion controller (WBLC). Previous approaches specify either the position or the timing of steps, however, the proposed locomotion planner simultaneously computes both of these parameters as locomotion outputs. Our locomotion strategy relies on devising a reinforcement learning (RL) approach for robust walking. The learned policy generates multi step walking patterns, and the process is quick enough to be suitable for real-time controls. For learning, we devise an RL strategy that uses a phase space planner (PSP) and a linear inverted pendulum model to make the problem tractable and very fast. Then, the learned policy is used to provide goal-based commands to the WBLC, which calculates the torque commands to be executed in full-humanoid robots. The WBLC combines multiple prioritized tasks and calculates the associated reaction forces based on practical inequality constraints. The novel formulation includes efficient calculation of the time derivatives of various Jacobians. This provides high-fidelity dynamic control of fast motions. More specifically, we compute the time derivative of the Jacobian for various tasks and the Jacobian of the centroidal momentum task by utilizing Lie group operators and operational space dynamics respectively. The integration of RL-PSP and the WBLC provides highly robust, versatile, and practical locomotion including steering while walking and handling push disturbances of up to 520 N during an interval of 0.1 sec. Theoretical and numerical results are tested through a 3D physics-based simulation of the humanoid robot Valkyrie.
연구 동기 및 목표
- 큰 갑작스러운 외부 자극을 견디는 실시간, 견고한 동적 이동 제어기를 개발하는 것.
- 이전 방법들이 보행 주기나 발자국 배치를 고정하는 한계를 극복하기 위해 강화학습을 통해 두 파ameter를 동시에 최적화하는 것.
- 계층적 임무 우선순위와 단일면 접촉 및 마찰 제약 조건을 통합한 계산 효율성이 높은 전신 제어기(WBLC)를 설계하는 것.
- 리만 군과 운동 공간 역학을 활용해 자이로스코프의 시간 도함수를 효율적으로 계산함으로써 고정밀도의 빠른 운동 제어를 가능하게 하는 것.
- 바람직한 불계획된 외부 자극 조건 하에서 Valkyrie 로봇의 3D 물리 기반 시뮬레이션에서 프레임워크를 검증하는 것.
제안 방법
- 학습은 단계 공간 계획자(PSP)와 선형 역진자 모델을 사용하여 오프라인으로 수행되며, 탐색 공간을 축소하고 학습 속도를 향상시킨다.
- RL 정책은 목표 기반의 보행 주기 및 발자국 배치 명령을 생성하여 실시간으로 다단계 계획을 수행할 수 있다.
- 새로운 전신 이동 제어기(WBLC)는 접촉 부등식 제약 조건(마찰 및 단일면 힘 포함)을 강제하는 차원 감소된 2차 계획 프로그램과 투영 기반 계층 제어를 융합한다.
- WBLC는 리만 군 연산자를 활용해 중심 운동량과 운동 공간 역학의 분석적 도함수를 효율적으로 계산하여 토크 명령을 산출한다.
- 균형, 운동량, 접촉력에 대한 우선순위를 부여하는 계층적 기반의 구조를 통해 물리적 제약 조건을 존중하면서도 임무 우선순위를 유지한다.
- 학습된 RL 정책과 WBLC를 통합하여 전체 3D 인간형 모델에서 실시간으로 견고하고 동적 보행 패턴을 실행할 수 있도록 한다.
실험 결과
연구 질문
- RQ1강화학습 정책이 인간형 로봇의 견고한 동적 보행을 위해 보행 주기와 발자국 배치를 동시에 최적화할 수 있는가?
- RQ2전신 제어기가 현실적인 단일면 접촉 및 마찰 제약 조건을 포함하면서도 우선순위 기반 임무를 효율적으로 처리할 수 있는가?
- RQ3투영 기반 속도와 QP 기반 제약 강제화를 융합한 하이브리드 제어 프레임워크의 동적 이동 성능은 어떠한가?
- RQ4시스템은 동적 보행 중 큰 충격 외력(예: 520N, 0.1초)을 어느 정도 거부할 수 있는가?
- RQ5RL과 새로운 WBLC를 통합하면 시뮬레이션에서 실시간으로 고정밀도의 빠른 동적 운동 제어를 달성할 수 있는가?
주요 결과
- RL 정책은 실시간으로 다단계 보행 패턴을 학습하여 수백 번의 보행을 즉각적으로 계획할 수 있으며, 이는 보행 주기의 시간 스케일을 크게 초월한다.
- WBLC는 접촉점의 수에만 의존하는 저차원 QP와 투영 기반 제어를 융합함으로써 높은 계산 효율성을 달성한다.
- 시스템은 0.1초 동안 520N의 외력이 작용하는 상황에서도 균형을 유지하고 안정적인 보행 패턴을 유지함을 시뮬레이션에서 입증했다.
- 리만 군 기반의 자이로스코프 도함수 계산을 통합함으로써 고정밀도의 빠른 운동 제어가 가능해졌으며, 정확성과 반응성 향상에 기여했다.
- 프레임워크는 IP 기반의 보행 계획을 전체 인간형 모델로 성공적으로 이식하였으며, 임무 우선순위와 접촉 제약 강제화를 유지했다.
- 전통적인 투영 기반 방법에 비해 불평형 제약 조건(마찰 원추형, 단일면 힘 포함)을 통합함으로써 성능을 향상시켰지만 계산 속도를 저하시키지 않았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.