Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Handover: Throw and Catch with Bimanual Hands

Binghao Huang, Yuanpei Chen|arXiv (Cornell University)|2023. 09. 11.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

이 논문은 시뮬레이션에서 Sim2Real 전이를 통해 다중 에이gent 강화 학습(MARL)을 활용해 고속 던지기-잡기 작업을 수행하는 양손지부 로봇 시스템인 Dynamic Handover를 제안한다. 주요 기여는 실시간 물체 궤도 예측 모델을 통해 동적이고 닫힌 루프의 잡기 동작을 가능하게 하여, 다양한 물체에 대해 실제 실험에서 기존 기준보다 성공률을 크게 향상시킨 것이다.

ABSTRACT

Humans throw and catch objects all the time. However, such a seemingly common skill introduces a lot of challenges for robots to achieve: The robots need to operate such dynamic actions at high-speed, collaborate precisely, and interact with diverse objects. In this paper, we design a system with two multi-finger hands attached to robot arms to solve this problem. We train our system using Multi-Agent Reinforcement Learning in simulation and perform Sim2Real transfer to deploy on the real robots. To overcome the Sim2Real gap, we provide multiple novel algorithm designs including learning a trajectory prediction model for the object. Such a model can help the robot catcher has a real-time estimation of where the object will be heading, and then react accordingly. We conduct our experiments with multiple objects in the real-world system, and show significant improvements over multiple baselines. Our project page is available at \url{https://binghao-huang.github.io/dynamic_handover/}.

연구 동기 및 목표

  • 로봇에서 고속의 양손지부 조작을 위한 견고한 시스템을 제공하기 위해 동적 던지기-잡기 작업을 수행하는 것.
  • 높은 차원의 행동 공간, 다양한 물체의 역학적 특성, 그리고 시뮬레이션에서 실제 환경으로의 영역 갭을 해결하기 위해 노력하는 것.
  • 실시간 물체 궤도 예측을 통합하여 적응형 잡기 동작을 가능하게 하여 실제 환경에서의 견고성을 향상시키는 것.
  • 예상치 못한 물체와 물리적 불확실성 하에서도 일반화 능력과 안정적인 성능을 보여주는 것.
  • 엔드 투 엔드 학습과 Sim2Real 전이를 활용한 동적 양손지부 조작의 새로운 벤치마크를 설정하는 것.

제안 방법

  • 두 개의 독립된 에이전트(한 명은 던지기, 다른 한 명은 잡기)를 사용하여 고속의 양손지부 동작을 조율하는 다중 에이전트 강화 학습(MARL) 정책을 학습하는 것.
  • 마찰, 관성, 질량 중심, 접촉력 등 다양한 물리적 요소를 랜덤화하여 정책의 일반화 능력과 견고성을 향상시키는 훈련 전략을 적용하는 것.
  • 물체의 향후 위치를 실시간으로 추정하는 학습된 궤도 예측 모델을 도입하여, 포지션 기반의 닫힌 루프 방식으로 잡기 정책을 안내하는 것.
  • 각 에이전트에 부분 관측을 적용하여 정책의 견고성을 향상시키고 시뮬레이션과 실제 환경 간의 영역 갭을 줄이는 것.
  • 시뮬레이션과 실제 로봇 하드웨어 간의 PD 제어기 보정을 위해 시스템 식별을 수행하여 Sim2Real 전이를 성공적으로 수행하는 것.
  • 복잡한 동적 작업에서 정책 학습의 안정성과 수렴 성능을 향상시키기 위해 다단계 훈련 파이프라인을 활용하는 것.

실험 결과

연구 질문

  • RQ1다중 에이전트 강화 학습이 고속의 동적 던지기-잡기 작업을 수행하는 데 있어 두 개의 지능적인 손을 효과적으로 조율할 수 있는가?
  • RQ2실시간 물체 궤도 예측은 실제 환경에서 Sim2Real 전이의 견고성과 성공률을 어떻게 향상시키는가?
  • RQ3훈련 중 물리적 랜덤라이제이션은 예상치 못한 물체와 실제 환경의 역학적 특성으로의 일반화 능력을 얼마나 향상시키는가?
  • RQ4초기 쥔 상태의 품질이 동적 핸드오버에서 던지기의 반복성과 성공률에 미치는 영향은 어떠한가?
  • RQ5실제 환경에서의 전체 시스템 성능에 있어 MARL과 궤도 예측의 상대적 기여도는 어느 정도인가?

주요 결과

  • 실제 실험에서 제안된 방법은 공에서 60%, 실린더에서 53%, 삼각형에서 33%의 성공률을 기록하여 모든 아블레이션 기준선보다 뚜렷이 높은 성능을 보였다.
  • 아블레이션 연구 결과, MARL과 궤도 예측을 모두 제거할 경우 삼각형에서 성공률이 0%로 떨어지며, 두 구성 요소의 필수성을 입증하였다.
  • 제안된 방법의 타격률은 공에서 93%에 달하여 물체 궤도 예측 정확도와 수용자 정책 안내 능력의 높음을 보여주었다.
  • MARL를 제거한 아블레이션은 공에서 성공률를 40%, 실린더에서 20%로 낮추었으며, 다중 에이전트 학습의 조율 기능의 중요성을 입증하였다.
  • 궤도 예측을 제거한 아블레이션은 공에서 성공률 33%, 실린더에서 40%로 나타나 실시간 예측이 적응성과 견고성을 향상시킨다는 것을 보여주었다.
  • 초기 단단한 쥔 상태(Pose C)는 x축에서 0.024m, y축에서 0.043m의 낙하 지점 분산을 줄여 던지기의 안정성과 반복성의 우수성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.