Skip to main content
QUICK REVIEW

[논문 리뷰] Circus ANYmal: A Quadruped Learning Dexterous Manipulation with Its Limbs

Fan Shi, Timon Homberger|arXiv (Cornell University)|2020. 11. 17.
Robotic Locomotion and Control참고 문헌 50인용 수 8
한 줄 요약

이 논문은 모델 자유형 딥 강화학습을 통해 4족 보행 로봇 ANYmal이 모든 네 개의 사지로 실생활에서의 다재다능하고 동적인 조작을 처음으로 실현한다. 랜덤라이제이션을 통한 시뮬레이션에서 훈련되어 강인성을 확보한 정책은 실제 하드웨어에 제로샷 배포가 가능하며, 최대 15°/s의 공 회전 속도를 달성하고 지속적인 조작 중 외부 교란에 대해 강인하게 복구한다.

ABSTRACT

Quadrupedal robots are skillful at locomotion tasks while lacking manipulation skills, not to mention dexterous manipulation abilities. Inspired by the animal behavior and the duality between multi-legged locomotion and multi-fingered manipulation, we showcase a circus ball challenge on a quadrupedal robot, ANYmal. We employ a model-free reinforcement learning approach to train a deep policy that enables the robot to balance and manipulate a light-weight ball robustly using its limbs without any contact measurement sensor. The policy is trained in the simulation, in which we randomize many physical properties with additive noise and inject random disturbance force during manipulation, and achieves zero-shot deployment on the real robot without any adjustment. In the hardware experiments, dynamic performance is achieved with a maximum rotation speed of 15 deg/s, and robust recovery is showcased under external poking. To our best knowledge, it is the first work that demonstrates the dexterous dynamic manipulation on a real quadrupedal robot.

연구 동기 및 목표

  • 4족 로봇이 전면 사지를 사용해 동적인 다재다능한 조작을 수행할 수 있도록 하는 것.
  • 접촉 센서나 접촉 동역학에 대한 사전 지식 없이도 전체 사지 조작을 위한 정책을 훈련하는 데 도전하는 것.
  • 시뮬레이션에서 훈련된 정책을 실제 4족 로봇에 제로샷 배포하여 실제 세계 적응 없이 강인한 성능을 유지하는 것.
  • 강화학습을 통해 보행과 조작의 이중성 탐색, 특히 보상 설계 및 제어 전략 측면에서

제안 방법

  • 접촉 동역학이나 센서 피드백에 대한 사전 지식 없이도 시뮬레이션에서 정책을 훈련하기 위해 모델 자유형 딥 강화학습 접근법을 사용한다.
  • 롤, 피치, 요 방향의 목표 각속도 추적을 강조하고 과도한 제어 노력에 대한 페널티를 포함한 보상 함수를 사용하여 정책을 훈련한다.
  • 물리적 성질(예: 질량, 마찰, 감쇠)의 랜덤라이제이션과 훈련 중 랜덤 외부 힘을 주입함으로써 시뮬레이션과 실제 세계 간 격차에 대한 강인성을 향상시킨다.
  • 외부 접촉 센서나 시각 정보를 사용하지 않고 관절 프로 prioceptive 피드백만을 사용함으로써 실제 세계 구현에 실용적인 접근을 제공한다.
  • 로봇의 기저부가 공에 닿지 않도록 하면서도 다리만을 사용해 경량 순이공을 조작하도록 정책을 훈련한다.
  • 다리 다수의 보행과 다손지 조작 사이의 본질적 이중성을 활용하여 보행 원리를 조작 제어에 재사용한다.

실험 결과

연구 질문

  • RQ1접촉 센서나 전용 조작 장치 없이도 4족 로봇이 네 개의 사지를 사용해 다재다능하고 동적인 조작을 학습할 수 있는가?
  • RQ2실제 4족 로봇에 대해 제로샷 배포가 가능한 강인한 성능을 달성하기 위해 시뮬레이션에서 딥 강화학습 정책을 어떻게 훈련할 수 있는가?
  • RQ3표준 보행 보상 함수와 비교했을 때, 동적인 조작 작업에서 효과적인 보상 형상화 전략은 무엇인가?
  • RQ4접촉 센서가 없는 상황에서 사지 조작의 정책 학습과 강인성에 어떤 영향을 미치는가?

주요 결과

  • 실제 ANYmal 로봇에 대해 실세계 조정 없이 제로샷 배포가 성공적으로 이루어져 강력한 시뮬레이션에서 실제 세계로의 일반화 능력을 입증했다.
  • 로봇은 2분 이상 지속적인 동적 조작을 수행하며 최대 15°/s의 안정된 공 회전을 유지했다.
  • 활동적인 조작 중에 뚜렷한 외부 교란(예: 찌르기)에 대해 강인하게 복구하는 능력을 보였다.
  • 목표 각속도 추적 기반의 보상 설계가 직접적인 속도 기반 보상보다 우수했으며, 특히 복잡한 접촉 상황에서 두드러졌다.
  • 보행과 조작의 이중성을 성공적으로 활용하여 공통의 제어 원칙이 전체 사지 조작에 적용될 수 있음을 보여주었다.
  • 접촉 센서가 없었음에도 불구하고 정책은 관절 프로 prioception과 학습된 접촉 동역학에만 의존하여 성능에 영향을 주지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.