[논문 리뷰] Transferable Force-Torque Dynamics Model for Peg-in-hole Task
이 논문은 다중 자세 힘-토크 상태 표현과 오프라인 데이터 생성을 활용하여 이식 가능한 힘-토크 역학 모델을 제안하며, 이는 샘플 효율적인 학습과 미리 보지 못한 펜치-홀 기하 구조에 대한 빠른 적응을 가능하게 한다. 모델 예측 제어 및 모델 기반 강화 학습을 통해 전체 학습 데이터의 2%만을 사용해 미세조정함으로써 80% 이상의 삽입 성공률를 달성하여 강력한 일반화 능력과 샘플 효율성을 입증한다.
We present a learning-based force-torque dynamics to achieve model-based control for contact-rich peg-in-hole task using force-only inputs. Learning the force-torque dynamics is challenging because of the ambiguity of the low-dimensional 6-d force signal and the requirement of excessive training data. To tackle these problems, we propose a multi-pose force-torque state representation, based on which a dynamics model is learned with the data generated in a sample-efficient offline fashion. In addition, by training the dynamics model with peg-and-holes of various shapes, scales, and elasticities, the model could quickly transfer to new peg-and-holes after a small number of trials. Extensive experiments show that our dynamics model could adapt to unseen peg-and-holes with 70% fewer samples required compared to learning from scratch. Along with the learned dynamics, model predictive control and model-based reinforcement learning policies achieve over 80% insertion success rate. Our video is available at https://youtu.be/ZAqldpVZgm4.
연구 동기 및 목표
- 제한된 실세계 데이터를 바탕으로 접촉이 풍부한 힘-토크 역학을 학습하는 데 도전한다.
- 접촉 위치를 정확히 파악하기 어려운 단일 6차원 힘-토크 신호의 모호함을 해결한다.
- 다양한 형태, 척도, 탄성도를 가진 새로운 펜치-홀 구성을 신속하게 적응시킬 수 있는 역학 모델을 가능하게 한다.
- 비용이 많이 드는 실시간 로봇 데이터 수집에 의존도를 줄이는 샘플 효율적인 훈련 파이프라인을 개발한다.
- 학습된 역학 모델을 모델 기반 제어 정책에 통합하여 고정밀 삽입을 달성한다.
제안 방법
- 다양한 종단기구 자세에서 각 접촉 위치에서 힘-토크 피드백을 수집함으로써 접촉 위치를 명확히 하기 위한 다중 자세 힘-토크 상태 표현 방식을 도입한다.
- 소규모 격자 샘플링된 힘-토크 측정치에서 수많은 궤적을 합성하는 새로운 오프라인 데이터 생성 방법을 제안하여 효율적인 지도 학습을 가능하게 한다.
- 다양한 형태, 척도, 탄성도를 가진 펜치와 홀의 다각도 있는 데이터셋을 기반으로 모델을 훈련시어 이식 가능성을 확보한다.
- 새로운, 보지 못한 펜치-홀 쌍에 적응하기 위해 실세계 샘플(예: 전체 데이터의 2%)이 몇 개만으로도 모델을 미세조정한다.
- 학습된 역학 모델을 기반으로 모델 예측 제어(MPC)와 모델 기반 강화 학습(RL)을 적용하여 삽입을 유도한다.
- 시각 또는 프로피어세프에 의존하지 않고 종단기구의 힘-토크 피드백을 유일한 입력으로 사용한다.
실험 결과
연구 질문
- RQ1힘 전용 입력만을 사용하여 펜치-홀 작업의 상태 전이를 정확히 예측할 수 있는 힘-토크 역학 모델을 학습할 수 있는가?
- RQ26차원 힘-토크 신호의 모호함을 어떻게 해결하여 삽입 중에 신뢰할 수 있는 접촉 위치를 파악할 수 있는가?
- RQ3다양한 펜치-홀 구성에서 훈련된 역학 모델이 최소한의 미세조정으로 새로운 기하 구조에 얼마나 잘 일반화되는가?
- RQ4오프라인 데이터 생성이 실시간 로봇 데이터 수집의 필요성을 어떻게 크게 줄일 수 있는가?
- RQ5학습된 역학 모델이 성공률 및 샘플 효율성 측면에서 제어 정책 성능을 향상시키는가?
주요 결과
- 모델 예측 제어 또는 모델 기반 강화 학습과 결합했을 때, 역학 모델은 80% 이상의 삽입 성공률를 달성한다.
- 전체 데이터셋의 2%만(홀당 평균 1.6개 샘플)으로 미세조정한 사전 훈련된 역학 모델은 예측 오차가 0.1 N·m 이하로 낮아 높은 정확도를 보인다.
- 학습을 처음부터 시작하는 것에 비해 필요한 샘플 수를 70% 감소시켜 강력한 샘플 효율성을 입증한다.
- 전체 데이터의 20%만으로도 미세조정된 역학 모델이 전체 데이터 100%로 학습된 모델보다 더 뛰어난 성능을 내는 것을 확인했다.
- 미세조정된 역학 모델을 기반으로 한 모델 기반 강화 학습은 실세계 샘플 16개만으로도 90% 이상의 성공률를 달성했으며, 이는 온라인 정책 학습에 12,000개의 샘플이 필요로 했던 것과 비교된다.
- 모델은 경직된 원형 홀(지름 15 mm)과 같은 새로운 펜치-홀 구성에도 최소한의 미세조정으로도 성공적으로 이식되어 적용되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.