[논문 리뷰] Robotic Imitation of Human Assembly Skills Using Hybrid Trajectory and Force Learning
이 논문은 히에라르키컬 목표 조건화 모방 학습(HGCIL)을 사용해 궤적 획득을 하고, 강화 학습 기반의 힘 제어를 통해 인간의 조립 기술을 모방할 수 있도록 하는 하이브리드 학습 프레임워크를 제안한다. 이 방법은 낮은 허용 오차가 있는 삽입 작업과 변동성이 있는 힘 요구 조건을 가진 실제 조립 작업에서 안정적이고 고성능의 궤적 및 힘 제어를 달성하며, 샘플 효율성과 실제 환경로 전이 가능성에서 기준 방법들을 능가한다.
Robotic assembly tasks involve complex and low-clearance insertion trajectories with varying contact forces at different stages. While the nominal motion trajectory can be easily obtained from human demonstrations through kinesthetic teaching, teleoperation, simulation, among other methods, the force profile is harder to obtain especially when a real robot is unavailable. It is difficult to obtain a realistic force profile in simulation even with physics engines. Such simulated force profiles tend to be unsuitable for the actual robotic assembly due to the reality gap and uncertainty in the assembly process. To address this problem, we present a combined learning-based framework to imitate human assembly skills through hybrid trajectory learning and force learning. The main contribution of this work is the development of a framework that combines hierarchical imitation learning, to learn the nominal motion trajectory, with a reinforcement learning-based force control scheme to learn an optimal force control policy, that can satisfy the nominal trajectory while adapting to the force requirement of the assembly task. To further improve the imitation learning part, we develop a hierarchical architecture, following the idea of goal-conditioned imitation learning, to generate the trajectory learning policy on the extit{skill} level offline. Through experimental validations, we corroborate that the proposed learning-based framework is robust to uncertainty in the assembly task, can generate high-quality trajectories, and can find suitable force control policies, which adapt to the task's force requirements more efficiently.
연구 동기 및 목표
- 시뮬레이션의 현실 격차로 인해 로봇 조립 작업에서 실제 힘 프로파일을 학습하는 데 도전하는 문제를 해결하기 위해.
- 낮은 허용 오차와 접촉이 많은 조립 작업을 위한 궤적과 힘 학습을 통합한 견고한 프레임워크를 개발하기 위해.
- 히에라르키컬 모방 학습을 사용해 궤적 정책 학습의 샘플 효율성과 일반화 능력을 향상시키기 위해.
- 최소한의 재조정으로 시뮬레이션에서 훈련된 정책을 실제 하드웨어로 전이할 수 있도록 하기 위해.
- 불확실성 하에서 작업 단계(탐색 대 삽입)에 따라 힘 제어를 동적으로 적응시키기 위해.
제안 방법
- 프레임워크는 히에라르키컬 목표 조건화 모방 학습(HGCIL)을 사용하여 궤적 실행을 위한 부분 목표를 생성하는 고수준 기술 정책을 학습함으로써 샘플 효율성과 내구성을 향상시킨다.
- 병렬 위치/힘 제어기에서는 PD 및 PI 제어를 조합한다: PD는 자세 오차 기반으로 궤적 위치를 조절하고, PI는 측정된 접촉 힘 기반으로 힘을 조정한다.
- 힘 제어 정책은 강화 학습(RL)을 통해 학습되며, 정책은 명시된 궤적을 따르면서 원하는 힘 수준을 유지하도록 훈련된다.
- 시스템은 이중 단계 훈련 과정을 사용한다: 사전 훈련된 HGCIL을 통한 궤적 정책 훈련, 이어서 이전 작업에서의 전이 학습을 통한 RL 기반의 힘 정책 훈련.
- 제어기는 작업 단계에 따라 이득 $K_p^p$ 및 $K_p^f$ 를 동적으로 조정한다 — 삽입 단계에서는 안정성을 확보하기 위해 $K_p^p$ 를 증가시키고, 힘 오버슈트를 방지하기 위해 $K_p^f$ 를 감소시킨다.
- 데모 데이터는 운동학적 가르침 또는 시뮬레이션을 통해 수집되며, 힘 정책은 유사 작업에서 사전 훈련된 정책을 사용해 수렴 속도를 가속화한다.
실험 결과
연구 질문
- RQ1히에라르키컬 모방 학습 접근 방식은 샘플 효율성이 향상된 상태에서 인간 데모로부터 복잡한 낮은 허용 오차 삽입 궤적을 효과적으로 학습할 수 있는가?
- RQ2강화 학습 기반의 힘 제어 정책은 조립 작업의 다양한 단계에서 변동성이 있는 힘 요구 조건에 어떻게 적응할 수 있는가?
- RQ3시뮬레이션에서 훈련된 정책이 광범위한 재조정 없이 실제 로봇 하드웨어로 성공적으로 전이될 수 있는가?
- RQ4이 하이브리드 궤적-힘 학습 프레임워크는 실제 조립 과정에서 궤적과 힘의 불확실성에 어떻게 대응하는가?
- RQ5제안된 프레임워크는 작업 성공률과 샘플 효율성 측면에서 표준 행동 복제 및 목표 조건화 행동 복제(재라벨링 포함)보다 뛰어나게 성능을 발휘할 수 있는가?
주요 결과
- HGCIL 방법은 시뮬레이션에서 기존의 행동 복제 및 GCBC-relabeling 기준 방법 대비 더 높은 수준의 궤적 모방 성능과 더 나은 샘플 효율성을 달성했다.
- 시뮬레이션에서 훈련된 정책(P-14 모델)은 재훈련 없이 실제 UR3e 로봇에 성공적으로 전이되어 L-삽입 작업을 33.3분의 훈련 시간에 완료했다.
- 장애물과 마찰력이 존재하는 HDMI 삽입 작업에서, 학습된 정책는 16.3초(326단계) 내로 작업을 완료했고, 초기 정책는 25초 이내에 실패했다.
- 제어기는 실행 중에 $K_p^p$ 및 $K_p^f$ 를 동적으로 조정했다: 삽입 단계에서는 궤적 준수를 위해 $K_p^p$ 를 증가시키고, 힘 오버슈트를 방지하기 위해 $K_p^f$ 를 감소시켰다.
- 프레임워크는 궤적 불확실성과 힘 불확실성에 대해 견고성을 보였으며, 다양한 삽입 단계에서 안정적인 접촉 힘을 유지했다.
- L-삽입 작업에서 사전 훈련된 힘 정책를 사용한 전이 학습은 후속 작업인 컨denser 및 HDMI 조립 작업의 훈련 시간을 크게 단축시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.