[논문 리뷰] Learning compositional models of robot skills for task and motion planning
이 논문은 활성 학습과 가우시안 프로세스를 사용하여 복합적인 로봇 기술 모델을 학습하는 프레임워크를 제안함으로써, 다양한 실제 환경과 시뮬레이션 환경에서 유연하고 일반화 가능한 작업 및 운동 계획을 가능하게 한다. 소수의 실제 환경에서의 시연로부터 기술의 사전 조건과 영향을 모델링하고, 이를 연속 공간 계획기와 통합함으로써, 커피를 만들기 같은 복잡하고 장기적인 조작 작업을 안정적으로 수행할 수 있다.
The objective of this work is to augment the basic abilities of a robot by learning to use sensorimotor primitives to solve complex long-horizon manipulation problems. This requires flexible generative planning that can combine primitive abilities in novel combinations and thus generalize across a wide variety of problems. In order to plan with primitive actions, we must have models of the actions: under what circumstances will executing this primitive successfully achieve some particular effect in the world? We use, and develop novel improvements on, state-of-the-art methods for active learning and sampling. We use Gaussian process methods for learning the constraints on skill effectiveness from small numbers of expensive-to-collect training examples. Additionally, we develop efficient adaptive sampling methods for generating a comprehensive and diverse sequence of continuous candidate control parameter values (such as pouring waypoints for a cup) during planning. These values become end-effector goals for traditional motion planners that then solve for a full robot motion that performs the skill. By using learning and planning methods in conjunction, we take advantage of the strengths of each and plan for a wide variety of complex dynamic manipulation tasks. We demonstrate our approach in an integrated system, combining traditional robotics primitives with our newly learned models using an efficient robot task and motion planner. We evaluate our approach both in simulation and in the real world through measuring the quality of the selected primitive actions. Finally, we apply our integrated system to a variety of long-horizon simulated and real-world manipulation problems.
연구 동기 및 목표
- 소수의 실제 환경 시험에서 데이터 수집 비용을 최소화하면서 로봇이 새로운 센서모터 기술을 효율적으로 학습할 수 있도록 한다.
- 연속적인 제어 파라미터에 대한 기술의 사전 조건과 영향을 확률적 함수로 포괄하는 모델을 개발한다.
- 학습된 기술 모델을 작업 및 운동 계획 프레임워크에 통합하여 새로운 효과적인 동작 시퀀스를 구성한다.
- 고정밀 시뮬레이션을 요구하지 않고도 환경의 변화, 예를 들어 물체의 배치나 가림 현상 등에 대해 강건성을 확보한다.
- 학습된 기술을 기존의 로봇 프리미티브와 통합하여 통합된 계획 파이프라인에서 다양한 작업 인스턴스에 대해 일반화를 달성한다.
제안 방법
- 소수의 비용이 많이 드는 실제 환경 시범 시연를 기반으로, 연속적인 제어 파라미터(예: 부어넣기 웨이포인트)에 대한 기술 성공 가능성 모델링을 위해 가우시안 프로세스 회귀를 사용한다.
- 탐색과 이용의 균형을 고려하여 계획 성공률을 극대화하는 적응형 샘플링 전략인 diverse-lk 및 diverse-gk를 구현하여 활성 학습을 수행한다.
- 샘플러 성능 평가를 위해 할인된 계획 보상 지표 $ J_k( heta) = \textstyle\textstyle\sum_{n=1}^\infty s(\theta,n)\gamma^n $ 를 적용한다. 여기서 $ s(\theta,n) $ 는 $ n $-번째 샘플이 계획 생성에 기여했는지를 나타낸다.
- 이산적 작업 계획과 연속적 파라미터 최적화를 통합하는 PDDL 스트림 기반 계획기와 학습된 기술 모델을 통합한다.
- 샘플링된 종단 효과기 목표로부터 충돌 없는 로봇 경로를 생성하기 위해 운동 계획기를 활용한다.
- 커널 기반의 적응형 샘플링을 활용하여 관측된 다양성과 계획 피드백에 기반해 탐색 영역을 동적으로 조정함으로써, 효과적인 제어 정책으로의 수렴을 향상시킨다.
실험 결과
연구 질문
- RQ1소수의 실제 환경 시험에서 기술을 효율적으로 학습하면서도, 효과적인 제어 파라미터 값의 전체 범위를 포괄할 수 있는 방법은 무엇인가?
- RQ2복잡한 환경에서 기술 실행을 위한 연속적 제어 파라미터의 효과적인 탐색을 가능하게 하는 샘플링 전략은 무엇인가?
- RQ3학습된 기술 모델을 기존의 로봇 프리미티브와 조합하여 다양한 환경과 교란 조건이 존재하는 장기적이고 고수준의 조작 작업을 해결할 수 있는가?
- RQ4균일하거나 고정 샘플링 전략에 비해 적응형이고 다양성 기반 샘플링 전략은 계획 성공률과 샘플 효율성 측면에서 어떻게 비교되는가?
- RQ5실제 로봇이 고정밀 시뮬레이션에 의존하지 않고도 새로운 물체 배치에 대해 얼마나 잘 일반화할 수 있는가?
주요 결과
- 모든 평가된 작업, 즉 밀기, 부어넣기, 복잡한 커피 제조 시나리오에서 diverse-lk 샘플링 전략이 기준선 방법들보다 더 높은 계획 보상과 더 낮은 분산을 달성했다.
- 작업 I(테이블에서 밀기)에서 diverse-lk는 몇 차례 반복 후 최적의 샘플링 전략(좌우 측면 샘플링)으로 수렴했으며, 고정 커널 기반 기준선보다 뛰어난 성능을 보였다.
- 작업 II(벽 근처에 있는 컵으로 부어넣기)에서 diverse-lk는 복잡한 장애물 구성 조건에서도 안정된 성공률과 낮은 분산을 달성했으며, 다른 샘플러들보다 뛰어난 성능을 보였다.
- 작업 III(정확한 그립이 필요한 홀더에 놓인 컵)에서 diverse-lk는 고차원적 제약 조건에 대해 강건성을 보였으며, 이는 메서드가 복잡한 사전 조건을 처리할 수 있음을 보여주었다.
- 통합된 시스템은 다양한 물체 배치 상황에서 커피 제조 작업을 20~40초 내로 해결하여 실시간 실행 가능성과 시뮬레이션 및 실제 환경 실행 모두에서의 일반화 능력을 입증했다.
- 재학습 없이도 상당한 물체의 교란을 성공적으로 처리했으며, 이는 학습된 모델이 환경 변화에 대해 강건함을 확인시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.