Skip to main content
QUICK REVIEW

[논문 리뷰] DiffSkill: Skill Abstraction from Differentiable Physics for Deformable Object Manipulations with Tools

Xingyu Lin, Zhiao Huang|arXiv (Cornell University)|2022. 03. 31.
Robot Manipulation and Learning인용 수 14
한 줄 요약

DiffSkill는 기계적 물리 시뮬레이터를 활용하여 도구를 사용한 탄성 물체의 장기적 조작에서 재사용 가능한 스킬을 자동으로 추상화하는 프레임워크를 제안한다. 기울기 기반 최적화에서 유도된 시연 트레이젝터리에 기반해 신경망 스킬 추상화 모델을 훈련시키고, RGB-D 관측치를 기반으로 이러한 추상화된 스킬을 계획함으로써, 복잡한 testdough 조작 작업에서 모델리스 강화학습 및 단독 트레이젝터리 최적화보다 뛰어난 성능을 달성한다.

ABSTRACT

We consider the problem of sequential robotic manipulation of deformable objects using tools. Previous works have shown that differentiable physics simulators provide gradients to the environment state and help trajectory optimization to converge orders of magnitude faster than model-free reinforcement learning algorithms for deformable object manipulation. However, such gradient-based trajectory optimization typically requires access to the full simulator states and can only solve short-horizon, single-skill tasks due to local optima. In this work, we propose a novel framework, named DiffSkill, that uses a differentiable physics simulator for skill abstraction to solve long-horizon deformable object manipulation tasks from sensory observations. In particular, we first obtain short-horizon skills using individual tools from a gradient-based optimizer, using the full state information in a differentiable simulator; we then learn a neural skill abstractor from the demonstration trajectories which takes RGBD images as input. Finally, we plan over the skills by finding the intermediate goals and then solve long-horizon tasks. We show the advantages of our method in a new set of sequential deformable object manipulation tasks compared to previous reinforcement learning algorithms and compared to the trajectory optimizer.

연구 동기 및 목표

  • 기울기 기반 최적화기의 局부 최적화 문제로 인해 국한된 지역 최적화 문제로 인해 도구를 사용한 탄성 물체의 장기적, 다단계 조작에 도전하는 것.
  • 전체 상태 정보가 필요하고 짧은 시간 범위 작업에 국한되는 기울기 기반 물리 시뮬레이터의 한계를 극복하는 것.
  • 전체 시뮬레이터 상태에 의존하지 않고 RGB-D 관측치로부터 직접 스킬 추상화를 학습함으로써 실제 환경에의 일반화를 가능하게 하는 것.
  • 들기, 펴기, 모으기, 운반하기, 자르기, 재배열하기 등의 복잡한 순차적 작업을 위한 추상화된 스킬의 조합을 개발하는 것.
  • 기울기 기반 최적화의 높은 샘플 효율성과 장기적 조작에서의 계층적 계획 필요성 간 격차를 메우는 것.

제안 방법

  • 기울기 기반 트레이젝터리 최적화기와 기울기 기반 물리 시뮬레이터를 사용하여 전체 시뮬레이터 상태를 기반으로 한 짧은 시간 범위, 단일 스킬 작업에 대한 전문가 시연 트레이젝터리 생성.
  • RGB-D 이미지를 스킬 임베딩으로 매핑하는 목표 조건부 정책으로서의 신경망 스킬 추상화 모델을 훈련시키며, 이는 시연 트레이젝터리를 모방한다.
  • 스킬 임베딩의 잠재 공간에서 중간 목표를 계획하여 장기적 시간 범위 작업을 스킬의 시퀀스로 분해한다.
  • 두 잠재 상태 간 전이가 스킬을 통해 달성 가능한지 평가하는 타당성 예측기로 중간 목표를 최적화한다.
  • 스킬의 추상화된 시퀀스에 대해 이산적 계획을 수행함으로써 작업 완료로 이어지는 목표 시퀀스를 탐색함으로써 계층적 제어를 가능하게 한다.
  • 훈련 중에는 기울기 기반 시뮬레이터를 활용하여 다양한 고품질의 시연 데이터를 생성하고, 추론 시에는 시각적 관측치만을 사용한다.

실험 결과

연구 질문

  • RQ1기울기 기반 물리 시뮬레이터를 사용하여 복잡한 장기적 시간 범위의 탄성 물체 조작에서 재사용 가능한 스킬을 자동으로 발견할 수 있는가?
  • RQ2기울기 기반 물리학에서의 스킬 추상화를 어떻게 시각 관측치(RGB-D)와 호환시켜 실제 환경에서의 일반화를 향상시킬 수 있는가?
  • RQ3추상화된 스킬에 대한 계획 수립이 장기적 시간 범위 작업에서 종단 간 강화학습과 직접적인 트레이젝터리 최적화보다 뚜렷이 뛰어난 성능을 내는가?
  • RQ4기울기 기반 최적화를 통한 스킬 획득과 잠재 공간에서의 계획 수립의 조합이 탄성 물체 조작에서 샘플 효율성과 작업 성공률을 어떻게 향상시키는가?
  • RQ5시뮬레이션 데이터에서 훈련된 신경망 스킬 추상화 모델이 새로운 시나리오나 실제 환경 배포에 일반화할 때의 한계는 무엇인가?

주요 결과

  • DiffSkill는 도구를 사용한 탄성 반죽에 대해 세 가지 도전적인 장기적 시간 범위 순차 조작 작업—LiftSpread, GatherTransport, CutRearrange—를 성공적으로 해결한다.
  • 모든 평가된 작업에서 모델리스 강화학습 기반 모델보다 뛰어난 샘플 효율성과 성공률을 기록하며, 우수한 성능을 보였다.
  • DiffSkill는 장기적 시간 범위 설정에서 局부 최적화 문제로 실패하는 단독 기울기 기반 트레이젝터리 최적화기보다 높은 작업 성공률을 달성했다.
  • 신경망 스킬 추상화 모델은 RGB-D 관측치로부터 잘 일반화되어 있으며, 전체 시뮬레이터 상태에 접근할 수 없더라도 계획을 수행할 수 있도록 한다.
  • 타당성 예측기는 잠재 공간에서 스킬 동역학을 암묵적으로 모델링함으로써 스킬 시퀀스에 대한 효과적인 이산적 계획 수립을 가능하게 한다.
  • 실험 결과, 기울기 기반 물리학을 통한 스킬 생성과 계층적 계획의 조합이 복잡한 탄성 재료의 견고하고 확장 가능한 조작을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.