Skip to main content
QUICK REVIEW

[논문 리뷰] Combining Learning-based Locomotion Policy with Model-based Manipulation for Legged Mobile Manipulators

Yuntao Ma, Farbod Farshidian|arXiv (Cornell University)|2022. 01. 11.
Robotic Locomotion and Control인용 수 5
한 줄 요약

이 논문은 다리 달린 이동형 만능 로봇을 위한 하이브리드 제어 프레임워크를 제안한다. 이 프레임워크는 학습 기반의 이동 정책와 모델 기반의 만능 제어를 융합한다. 기반 정책이 MPC를 통해 생성한 예측을 통해 향후 외부 외력(외력)을 사전에 인지하도록 훈련시킴으로써, 복잡한 지형에서도 안정적인 이동을 달성하면서도 재훈련 없이 새로운 만능 로봇 설정에 대해 제로샷 적응이 가능해진다.

ABSTRACT

Deep reinforcement learning produces robust locomotion policies for legged robots over challenging terrains. To date, few studies have leveraged model-based methods to combine these locomotion skills with the precise control of manipulators. Here, we incorporate external dynamics plans into learning-based locomotion policies for mobile manipulation. We train the base policy by applying a random wrench sequence on the robot base in simulation and adding the noisified wrench sequence prediction to the policy observations. The policy then learns to counteract the partially-known future disturbance. The random wrench sequences are replaced with the wrench prediction generated with the dynamics plans from model predictive control to enable deployment. We show zero-shot adaptation for manipulators unseen during training. On the hardware, we demonstrate stable locomotion of legged robots with the prediction of the external wrench.

연구 동기 및 목표

  • 고차원적 역학을 가지며 접촉이 빈번한 비정형 환경에서 다리 달린 이동형 만능 로봇을 제어하는 과제를 해결한다.
  • 순수 모델 기반 방법의 한계(복잡한 지형에서의 높은 계산 비용)와 순수 학습 기반 방법의 한계(로봇 설정 간 일반화 능력 부족)를 극복한다.
  • 정책 관측 공간에 미래 외력 예측을 통합하여 외부 외력에 대한 저항력을 높이고, 외부 간섭 상황에서도 안정적인 이동을 달성한다.
  • 로봇의 만능 설정이 변경되더라도 재훈련 없이도 동일한 이동 정책을 활용한 제로샷 적응을 실현한다. 이는 제어 설계의 분리 원리를 활용한다.

제안 방법

  • 기반 정책이 모델 예측 제어(MPC)를 통해 생성한 향후 외력 예측(0.0–0.8 s 후 예측)의 시퀀스를 관측하여 외부 외력에 대응하도록 강화학습(PPO) 정책을 훈련한다.
  • 시뮬레이션 훈련 중에 무작위 외력 시퀀스를 사용하여 정책이 다양한 간섭에 노출되도록 하여 내성적 안정성을 향상시킨다.
  • 기반 이동 정책을 만능 로봇의 구성 상태로부터 분리하기 위해, 정책이 외력 예측만을 관측하도록 하며, 팔의 상태나 작업 특화 동작은 고려하지 않는다.
  • 하드웨어에 시스템을 구현할 때는 MPC를 사용해 정밀한 팔 제어를 수행하며, 同시에 기반 정책가 사용할 외력 예측도 생성한다.
  • 배포 시 실시간 외력 관측 대신 MPC 예측 외력 시퀀스를 사용하여 사전 간섭 대응 능력을 향상시킨다.
  • 자기 감지 정보 기록과 정규화기를 사용하여 관측치를 안정화시키고 정책의 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1모델 기반 만능 제어기에서 생성한 미래 외력 예측을 학습 기반 이동 정책이 활용할 수 있는가?
  • RQ2예측된 외력 시퀀스를 통합함으로써, 복잡한 지형에서의 이동 중 간섭 대응 능력과 안정성이 향상되는가?
  • RQ3재훈련 없이도 하나의 이동 정책이 다양한 만능 로봇 설정에 일반화되는가?
  • RQ4자기 감지 정보에서 복원한 외력과 비교했을 때, 예측된 외력 사용이 정책 성능에 어떤 영향을 미치는가?
  • RQ5외력 관측의 예측 수준(예측 시간 간격)이 동적 간섭 상황에서 정책 성능을 유지하는 데 얼마나 중요한가?

주요 결과

  • MPC를 통해 생성된 외력 예측을 관측치로 사용함으로써, 정책의 간섭 대응 능력이 향상되었으며, 5 rad/s 주파수에서 예측 외력 사용 시 38%까지 평균 각속도 오차가 감소하였다.
  • 다이내믹한 만능 작업(5 rad/s) 조건에서, 예측 외력 사용 시 평균 4.1초 동안 안정적인 이동이 가능했고, 자기 감지 외력 복원 사용 시에는 단지 1.9초였다.
  • 재훈련 없이도 새로운 만능 로봇 설정(예: 3 kg 종단기구)에 대해 하드웨어에서 성공적으로 제로샷 적응을 시연하여 일반화 능력을 확인하였다.
  • 장애 실험 결과, 정책는 즉각적인 외력 예측(0.0–0.2 s 후 예측)에 가장 의존하는 것으로 나타났고, 평균적으로 0.8 s 예측이 가장 정보를 많이 제공하였다.
  • 관측되지 않은 외력 간섭(예: 1 kg 적재)에 노출된 정책는 동역학 불일치 상황에서도 기반 각속도 오차가 유의미하게 감소하여 안정성이 향상됨을 보였다.
  • 본 시스템은 실시간 예측 제어를 적용한 복잡한 지형에서의 다리 달린 이동형 만능 작업에 있어, 세계 최초로 하드웨어 구현을 성공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.