Skip to main content
QUICK REVIEW

[논문 리뷰] Bi-Manual Manipulation and Attachment via Sim-to-Real Reinforcement Learning

Satoshi Kataoka, Seyed Kamyar Seyed Ghasemipour|arXiv (Cornell University)|2022. 03. 15.
Robot Manipulation and Learning인용 수 5
한 줄 요약

이 논문은 관절 공간 제어와 원시 관측치를 사용하여 양손 로봇 조작을 위한 시뮬레이터에서 실제 환경으로의 강화학습 접근법을 제시한다. 실제 xArm6 로봇에서 블록 집기 작업의 성공률가 100%에 도달했고, 자석 블록 결합 작업의 성공률은 65%를 기록하였다. 이 방법은 역기구학과 필터링을 제거함으로써 제어를 단순화하였고, 시뮬레이터 수정을 통해 실제 환경으로의 안정적 전이를 가능하게 하였다.

ABSTRACT

Most successes in robotic manipulation have been restricted to single-arm robots, which limits the range of solvable tasks to pick-and-place, insertion, and objects rearrangement. In contrast, dual and multi arm robot platforms unlock a rich diversity of problems that can be tackled, such as laundry folding and executing cooking skills. However, developing controllers for multi-arm robots is complexified by a number of unique challenges, such as the need for coordinated bimanual behaviors, and collision avoidance amongst robots. Given these challenges, in this work we study how to solve bi-manual tasks using reinforcement learning (RL) trained in simulation, such that the resulting policies can be executed on real robotic platforms. Our RL approach results in significant simplifications due to using real-time (4Hz) joint-space control and directly passing unfiltered observations to neural networks policies. We also extensively discuss modifications to our simulated environment which lead to effective training of RL policies. In addition to designing control algorithms, a key challenge is how to design fair evaluation tasks for bi-manual robots that stress bimanual coordination, while removing orthogonal complicating factors such as high-level perception. In this work, we design a Connect Task, where the aim is for two robot arms to pick up and attach two blocks with magnetic connection points. We validate our approach with two xArm6 robots and 3D printed blocks with magnetic attachments, and find that our system has 100% success rate at picking up blocks, and 65% success rate at the Connect Task.

연구 동기 및 목표

  • 실제 하드웨어로 효과적으로 전이되는 강력한 시뮬레이터에서 실제 환경으로의 강화학습 파이프라인을 개발한다.
  • 다중 암 시스템에서의 양손 조율, 상호 암 충돌 회피, 구동 노이즈 등의 과제를 해결한다.
  • 시각 인식 및 고정밀 제어 과제에서 분리된 양손 조율 과제를 고립시키는 최소한이면서 효과적인 평가 작업을 설계한다.
  • 역기구학 및 경로 계획기 없이도 실시간 제어를 단순화하기 위해 관절 공간 동작과 원시 센서 관측치를 사용한다.
  • 시뮬레이터 수정(예: 액추에이터 노이즈, 관측 노이즈)이 실제 로봇으로의 정책 전이에 필수적임을 보여주되, 이는 학습 속도를 저하시킨다.

제안 방법

  • 실제 로봇 모델, 자석 블록, 액추에이터 동역학을 갖춘 고유의 환경을 사용하여 물리 기반 시뮬레이션에서 딥 강화학습 정책을 훈련한다.
  • 실시간(4Hz) 관절 공간 제어를 사용하여 로봇에 직접 관절 속도를 출력함으로써 역기구학 또는 경로 계획기의 필요성을 제거한다.
  • 전처리 또는 필터링 없이도 관절 위치, 속도, 블록 상태와 같은 원시 관측치를 직접 딥 신경망 정책에 입력한다.
  • 액추에이터 노이즈, 관측 노이즈, 현실적인 관절 한계와 같은 시뮬레이터 수정 사항을 통합하여 시뮬레이터에서 실제 환경으로의 전이성을 향상시킨다.
  • 작업 완료와 조율을 강조하는 보상 형태를 사용하여 Proximal Policy Optimization (PPO)를 사용해 정책을 훈련한다.
  • 3D 프린팅된 자석 블록을 사용한 두 대의 실제 xArm6 로봇에서 인간 검증 기준(거리 및 방향)을 사용해 정책을 검증한다.

실험 결과

연구 질문

  • RQ1역기구학 또는 필터링 없이도 시뮬레이션에서 훈련된 강화학습 정책이 실제 두 대의 로봇 암을 조율하여 제어할 수 있는가?
  • RQ2액추에이터 노이즈 및 관측 노이즈와 같은 시뮬레이터 수정 사항은 실제 로봇 시스템으로의 정책 전이성에 어떤 영향을 미치는가?
  • RQ3시각 인식 및 고정밀 제어 과제에서 분리된 양손 조율 과제를 고립시키는 최소한이면서 효과적인 작업 설계는 무엇인가?
  • RQ4관절 공간 제어와 원시 관측치를 사용하면 실제 제어에서 역기구학 및 경로 계획의 필요성을 제거할 수 있는가?
  • RQ5단일 신경망 정책이 실제 양손 조작 환경에서 낙하 후 재집기와 같은 복구 능력을 갖춘 강건한 행동을 얼마나 잘 학습할 수 있는가?

주요 결과

  • 실제 xArm6 로봇에서 블록 집기 작업의 성공률이 100%에 도달하여 블록 안정적 확보 및 유지가 가능함을 입증하였다.
  • 실제 환경에서 결합 작업의 성공률은 65%였으며, 성공 기준은 자석 블록 간 거리 1mm 이내 및 정확한 방향성으로 정의되었다.
  • 액추에이터 노이즈 및 관측 노이즈와 같은 시뮬레이터 수정 사항은 실제 환경 전이에 필수적이었으며, 이는 학습 시간을 증가시켰다(예: 수정 사항이 있는 경우 Connect Task는 18억 스텝, 없는 경우 2.8억 스텝).
  • 시뮬레이터 수정 사항이 없는 정책은 실제 로봇으로 일반화되지 못했으며, 이는 시뮬레이터에서 실제 환경으로의 도메인 랜덤라이제이션의 중요성을 강조한다.
  • 관절 공간 제어를 사용함으로써 역기구학, 경로 계획기, 충돌 체크 레이어의 필요성이 제거되어 실시간 제어 스택이 단순화되었다.
  • 자석 블록 연결 작업은 양손 조율을 핵심 과제로 고립시키며, 시각 인식이나 정밀 제어 과부하 없이 양손 기술 평가에 집중할 수 있도록 성공적으로 설계되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.