Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Arm-Assisted Fall Damage Reduction and Recovery for Legged Mobile Manipulators

Yuntao Ma, Farbod Farshidian|arXiv (Cornell University)|2023. 01. 01.
Robotic Locomotion and Control인용 수 1
한 줄 요약

이 논문은 보행형 이동형 만능 로봇이 활동적으로 팔을 사용하여 넘어짐으로 인한 손상을 줄이고 자율적으로 회복할 수 있도록 하는 학습 기반 비대칭 액터-크리틱 정책을 제안한다. 시간에 따라 변하는 보상 함수를 사용해 시뮬레이션에서 훈련된 정책은 다양한 초기 넘어짐 구성에서 98.9%의 복구 성공률을 달성하며, 기준 컨트롤러에 비해 피크 기준 인ertia, 관절 힘, 가속도를 크게 감소시켰으며, ALMA 로봇에서 성공적으로 하드웨어 구현이 이루어졌다.

ABSTRACT

Adaptive falling and recovery skills greatly extend the applicability of robot deployments. In the case of legged mobile manipulators, the robot arm could adaptively stop the fall and assist the recovery. Prior works on falling and recovery strategies for legged mobile manipulators usually rely on assumptions such as inelastic collisions and falling in defined directions to enable real-time computation. This paper presents a learning-based approach to reducing fall damage and recovery. An asymmetric actor-critic training structure is used to train a time-invariant policy with time-varying reward functions. In simulated experiments, the policy recovers from 98.9\% of initial falling configurations. It reduces base contact impulse, peak joint internal forces, and base acceleration during the fall compared to the baseline methods. The trained control policy is deployed and extensively tested on the ALMA robot hardware. A video summarizing the proposed method and the hardware tests is available at https://youtu.be/avwg2HqGi8s.

연구 동기 및 목표

  • 보행형 이동형 만능 로봇이 넘어질 경우 하중 및 관절 손상에 취약한 점을 해결한다.
  • 탄성 충돌, 고정된 넘어짐 평면, 또는 매우 민첩한 사지에 의존하는 제한적인 가정을 필요로 하는 기존 방법의 한계를 극복한다.
  • 특권 상태 정보가 필요 없이도 팔을 활성적으로 활용해 충격력을 완화하고 복구를 지원하는 강력하고 일반화 가능한 제어 정책을 개발한다.
  • 최소한의 튜닝으로 실제 하드웨어에 정책을 구현할 수 있도록 하여 다양한 넘어짐 시나리오에서 일관되고 적응 가능한 행동을 보장한다.

제안 방법

  • 운동의 부드러움과 복구 속도를 균형 있게 유지하기 위해 시간 불변 정책과 시간에 따라 변하는 보상 함수를 사용하는 온정책 비대칭 액터-크리틱 강화학습 프레임워크를 활용한다.
  • 초기 넘어짐 구성의 랜덤화와 기준-지면 접촉을 방지함으로써 손상 감소 및 복구 역학에 집중하는 시뮬레이션 환경을 설계한다.
  • 자기 관찰 및 상태 관찰에만 접근 가능한 비특권 액터를 사용하고, 훈련 중에 전체 상태 정보를 사용하는 크리틱을 활용하여 샘플 효율성을 향상시킨다.
  • 한정된 시간 간격 내에서 넘어짐 동안 피크 기준 인ertia, 피크 관절 내부 힘, 기준 가속도를 최소화하고 복구 성공률을 최대화하도록 정책을 훈련시킨다.
  • 커리큘럼 학습과 초기 구성의 랜덤화를 적용하여 정책의 일반화 능력과 강건성을 향상시킨다.
  • 재훈련이나 광범위한 튜닝 없이도 훈련된 정책을 직접 하드웨어(ALMA 로봇)로 이식하여 실제 세계의 넘어짐 및 복구 시나리오에서 성능을 검증한다.

실험 결과

연구 질문

  • RQ1강화학습을 통해 훈련된 단일 시간 불변 제어 정책이 팔 보조를 통해 보행형 이동형 만능 로봇의 넘어짐 손상 감소와 복구를 효과적으로 수행할 수 있는가?
  • RQ2시간에 따라 변하는 보상 함수를 사용하는 제안된 비대칭 액터-크리틱 방법이 대칭 또는 시간에 따라 변하는 대안 대비 복구 성공률과 강건성 측면에서 어떻게 비교되는가?
  • RQ3넘어지는 동안 팔을 사용함으로써 기준 충격력과 관절 스트레스가 기준 비상 컨트롤러(예: 드라이브 정지 또는 감쇠)에 비해 얼마나 감소하는가?
  • RQ4동일한 훈련 파이프라인을 자가 복귀 또는 기립 자세에서 휴식 자세로 전환하는 등의 다른 작업에 적용할 수 있으며, 다양한 목표에 대해 얼마나 일반화되는가?
  • RQ5보상 척도 변화나 작업 정의 변경에 대해 정책은 얼마나 강건한가? 보상 가중치 변화에 따라 일관된 행동을 유지하는가?

주요 결과

  • 제안된 정책은 시뮬레이션에서 1,000개의 랜덤 초기 넘어짐 구성에 대해 98.9%의 복구 성공률을 달성했다.
  • 기준 비상 컨트롤러(드라이브 정지 또는 감쇠)에 비해 정책은 피크 기준 인ertia를 최대 45%, 피크 관절 내부 힘을 최대 30%, 기준 가속도를 최대 40% 감소시켰다.
  • 비대칭 액터-크리틱 훈련을 사용하는 시간 불변 정책는 대칭 또는 시간에 따라 변하는 버전에 비해 더 뛰어난 강건성과 일관성을 보였으며, 균일한 복구 프로파일을 보였다.
  • ALMA 로봇에 대한 하드웨어 구현을 통해 정책의 실세계에서의 효과성을 확인했으며, 관찰 가능한 팔 보조 충격 완화와 안정적인 복구 행동이 나타났다.
  • 정책은 보상 척도에 대해 강건성을 보였으며, 작업 보상 값을 3배로 증가시켜도 복구 프로파일이 변화하지 않았다. 이는 보상 하이퍼파라미터 변화에 대해 안정성을 유지함을 시사한다.
  • 동일한 훈련 파이프라인은 추가 작업—어떤 자세에서든 바닥에 누워 있는 자세로 이행하거나 넘어진 상태에서 자가 복귀하기—에 대해서도 성공적으로 정책을 생성했으며, 자연스러운 접촉 순서 적응을 보장하면서 하드웨어에서 검증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.