Skip to main content
QUICK REVIEW

[논문 리뷰] Active model learning and diverse action sampling for task and motion planning

Zi Wang, Caelan Reed Garrett|arXiv (Cornell University)|2018. 03. 02.
Gaussian Processes and Bayesian Inference참고 문헌 24인용 수 5
한 줄 요약

이 논문은 가우시안 프로세스 회귀를 사용하여 최소한의 실제 세계 시도로 행동 타당성을 모델링함으로써,倒기 및 혼합과 같은 센서모터 프리미티브를 효율적으로 학습할 수 있도록 하는 주동적 모델 학습 및 다양한 행동 샘플링 프레임워크를 제안한다. 이는 적응형 샘플링과 연속 공간 작업 및 운동 계획을 통합하여 기준 방법에 비해 장기적인 시간 범위 작업에서 계획 효율성과 성공률을 크게 향상시킨다.

ABSTRACT

The objective of this work is to augment the basic abilities of a robot by learning to use new sensorimotor primitives to enable the solution of complex long-horizon problems. Solving long-horizon problems in complex domains requires flexible generative planning that can combine primitive abilities in novel combinations to solve problems as they arise in the world. In order to plan to combine primitive actions, we must have models of the preconditions and effects of those actions: under what circumstances will executing this primitive achieve some particular effect in the world? We use, and develop novel improvements on, state-of-the-art methods for active learning and sampling. We use Gaussian process methods for learning the conditions of operator effectiveness from small numbers of expensive training examples collected by experimentation on a robot. We develop adaptive sampling methods for generating diverse elements of continuous sets (such as robot configurations and object poses) during planning for solving a new task, so that planning is as efficient as possible. We demonstrate these methods in an integrated system, combining newly learned models with an efficient continuous-space robot task and motion planner to learn to solve long horizon problems more efficiently than was previously possible.

연구 동기 및 목표

  • 비용이 많이 드는 실제 세계 시도를 최소화하여 로봇이 새로운 센서모터 프리미티브를 효율적으로 학습할 수 있도록 하는 것.
  • 주동적 학습을 활용하여 가우시안 프로세스로 프리미티브 행동의 사전 조건과 영향을 모델링하는 것.
  • 복잡한 고차원 환경에서 계획 성공률을 향상시키기 위해 다양하고 고도로 커버리지가 높은 행동 샘플을 생성하는 것.
  • 학습된 모델을 연속 공간 작업 및 운동 계획기로 통합하여 장기적인 시간 범위 작업을 해결하는 것.
  • 시뮬레이션된 로봇 조작 작업에서 계획 효율성과 강건성을 향상시키는 것을 입증하는 것.

제안 방법

  • 주어진 행동 구성에 대한 성공 가능성 예측을 위한 점수 함수를 모델링하기 위해 가우시안 프로세스 회귀를 사용한다.
  • 학습에 가장 정보가 많은 행동 구성 선택을 위해 주동적 학습을 활용하여 실제 세계 시도 수를 최소화한다.
  • 맥락적 파라미터에 조건화된 다양한 타당한 행동 인스턴스를 생성하기 위한 적응형 샘플링 전략을 개발한다.
  • 로봇과 물체 자세 간의 기능적 관계와 같은 차원 감소 제약 조건을 고려하는 조건부 샘플러를 도입한다.
  • 가우시안 프로세스의 불확실성 추정치를 활용하여 학습 기간 동안 정보 수집과 계획 기간 동안 성공 확률 추정을 모두 안내한다.
  • 학습된 모델을 연속 공간 작업 및 운동 계획기인 STRIPStream에 통합한다.

실험 결과

연구 질문

  • RQ1센서모터 프리미티브의 타당성을 학습하기 위해 필요한 실제 세계 시도 횟수를 최소화하는 방법은 무엇인가?
  • RQ2고차원 구성 공간에서 타당한 행동의 공간을 커버하는 다양한 그러나 효과적인 행동 샘플을 생성하는 방법은 무엇인가?
  • RQ3성공 확률과 다양성을 균형 잡은 적응형 샘플링 전략이 장기적인 시간 범위 계획에서 균일하거나 무작위 샘플링보다 우월한가?
  • RQ4가우시안 프로세스를 활용한 주동적 학습이 로봇 조작 작업에서 모델 정확성과 계획 효율성을 어떻게 향상시키는가?
  • RQ5학습된 프리미티브 사전 조건 및 영향 모델이 복잡한 실제 세계 시나리오에서 강건하고 일반적인 계획을 가능하게 하는 데까지 어느 정도 기여하는가?

주요 결과

  • 다양한-lk 샘플링 방법은 Task I의 1000개의 장애물 배치에서 일관된 향상을 보이며, 95% 신뢰구간에서 기준 방법 및 diverse-gk보다 높은 계획 보상 수준을 달성했다.
  • Task II(벽에 가까운 장소에서倒기)에서 diverse-lk는 계획 성공률에서 다른 방법들을 능가했으며, 훈련 후 변동성이 낮아 안정성이 높다는 것을 보여주었다.
  • Task III(홀더에서 컵을 집기)에서 복잡도가 증가했음에도 불구하고 diverse-lk는 다른 샘플링 전략보다 뛰어난 성능을 보였으며, 더 높은 계획 성공률을 달성했다.
  • Task II와 III의 학습 곡선은 급격한 전환점이 나타났는데, 이는 커널 길이 척도에 대한 높은 페널티와 테스트 세트 크기의 제한(50개 작업)으로 인해 하이퍼파ram터 조정에 민감할 수 있음을 시사한다.
  • 통합된 시스템은 기존에 존재하는 7개의 작업과 두 가지 새로 학습된 프리미티브(倒기, 숟가락으로 떠 담기)를 포함한 복잡한 커피 제공 작업을 성공적으로 해결했으며, 다양한 물체 배치 상황에서 20~40초 내로 완료되었다.
  • 시스템은 물체의 상당한 변형에도 불구하고 강건하게 대처하여 실제 세계 유사 조건에서 일반화 및 적응 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.