Skip to main content
QUICK REVIEW

[논문 리뷰] Search-Based Task Planning with Learned Skill Effect Models for Lifelong Robotic Manipulation

Jacky Liang, Mohit Sharma|arXiv (Cornell University)|2021. 09. 17.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 새로운 스킬과 작업을 통합할 수 있도록 학습된 스킬 효과 모델(Semantic Effect Models, SEMs)을 사용하는 검색 기반 작업 계획 프레임워크를 제안한다. 반복적인 시뮬레이션 데이터 수집과 그래프 신경망 기반 SEMs를 통한 스킬 결과 및 비용 예측을 통해, 최적화된 계획을 실세계 환경에서 미세조정 없이 효율적으로 수행함으로써, 새로운 작업과 물체 변형에 대해 낮은 비용의 계획과 높은 성공률을 달성한다.

ABSTRACT

Robots deployed in many real-world settings need to be able to acquire new skills and solve new tasks over time. Prior works on planning with skills often make assumptions on the structure of skills and tasks, such as subgoal skills, shared skill implementations, or task-specific plan skeletons, which limit adaptation to new skills and tasks. By contrast, we propose doing task planning by jointly searching in the space of parameterized skills using high-level skill effect models learned in simulation. We use an iterative training procedure to efficiently generate relevant data to train such models. Our approach allows flexible skill parameterizations and task specifications to facilitate lifelong learning in general-purpose domains. Experiments demonstrate the ability of our planner to integrate new skills in a lifelong manner, finding new task strategies with lower costs in both train and test tasks. We additionally show that our method can transfer to the real world without further fine-tuning.

연구 동기 및 목표

  • 전체 시스템을 다시 훈련하지 않고도 새로운 스킬과 작업을 점진적으로 통합할 수 있는 수명 주기적 로봇 조작을 가능하게 하기 위해.
  • 고정된 스킬 구조, 공유 임bedding, 또는 하위목표 기반 계획과 같은 이전의 가정을 완화하여 적응성을 향상시키기 위해.
  • 다양한 매개변수, 물체 특징, 작업 구성에 대해 일반화할 수 있는 스케일러블하고 데이터 효율적인 스킬 효과 모델 학습 방법을 개발하기 위해.
  • 시뮬레이션에서 실제 환경으로의 전이를 활용하여, 추가적인 미세조정 없이도 학습된 계획기의 실세계 적용을 가능하게 하기 위해.

제안 방법

  • 각 스킬이 학습된 스킬 효과 모델(SEM)과 연결된 파라미터화된 스킬 튜플에 기반한 검색 기반 계획을 수행한다. SEM은 종료 상태와 실행 비용을 예측한다.
  • SEMs는 상태 및 스킬 파라미터 입력을 처리하여 결과를 예측하기 위해 그래프 신경망(GNN) 아키텍처를 사용한다.
  • 현재 SEMs를 사용하여 훈련 작업에서 계획기를 실행함으로써 관련된 스킬 실행 데이터를 수집하는 반복적 데이터 수집 루프를 운영한다.
  • 새로운 스킬은 수집된 데이터를 기반으로 새로운 SEMs를 훈련시켜 통합하며, 새로운 데이터가 제공될 경우 기존 SEMs도 미세조정한다.
  • 계획기는 SEMs를 사용하여 검색을 안내하며, 실시간 시뮬레이션이나 하드코딩된 모델을 피함으로써 비용을 절감한다.
  • 고정된 목표 상태나 임베딩가 아닌 목표 조건 함수를 사용하여 태스크 사양을 유연하게 지원함으로써, 새로운 태스크로의 일반화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1새로운 스킬을 전체 시스템을 다시 훈련하지 않고도 라이프사이클 학습 프레임워크에 효율적으로 통합할 수 있는가?
  • RQ2학습 중에 볼 수 없었던 다양한 물체 크기와 수량에 대해 학습된 스킬 효과 모델이 얼마나 잘 일반화되는가?
  • RQ3도메인 특화적인 미세조정 없이도 실제 환경에서 낮은 비용, 높은 성공률의 계획을 달성할 수 있는가?
  • RQ4SEM과 함께 학습된 전제 조건 모델이 계획 성공률을 얼마나 향상시키는가?
  • RQ5반복적인 데이터 수집 방식이 시간이 지남에 따라 샘플 효율성과 모델 성능을 얼마나 향상시키는가?

주요 결과

  • 랜덤 계획기보다 평균 비용이 유의미하게 낮게 나타났으며, 테스트 작업에서 계획 시간이 10배 빨라졌다.
  • 미세조정 없이도 실세계로 성공적으로 전이되었으며, 예상치 못한 작업과 물체 구성에 대해 강건한 일반화 능력을 입증했다.
  • Task B(빨간 블록을 바구니에 옮기기)에서, Pick-Place + Tray Slide 조합은 학습된 전제 조건 모델을 사용할 경우 평균 비용 4.35, 성공률 90%를 달성했다.
  • SEM 모델은 다양한 물체 크기에 대해 잘 일반화되었으며, 2cm, 3cm, 4cm 블록의 평균 비용이 각각 6.56 이내로 유지되어 성능 저하가 최소화되었다.
  • 물체 수가 다른 경우에도 일반화되었으며, 예를 들어 1개 또는 2개의 빨간 블록에 대해 Pick-Place 전용으로 평균 비용이 각각 1.91과 4.33이었다.
  • 학습된 전제 조건 모델은 Pick-Place에 대해 96%의 성공률, Pick-Place + Tray Slide에 대해 90%의 성공률을 기록하여 신뢰할 수 있는 스킬 실행 예측 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.