Skip to main content
QUICK REVIEW

[논문 리뷰] Diffusion-EDFs: Bi-equivariant Denoising Generative Modeling on SE(3) for Visual Robotic Manipulation

Hyunwoo Ryu, Jiwoo Kim|arXiv (Cornell University)|2023. 09. 06.
Generative Adversarial Networks and Image SynthesisComputer Science인용 수 3
한 줄 요약

이 논문은 5~10개의 인간 시범만으로 1시간 이내에 종단간 훈련을 수행하는 새로운 SE(3)-동치성 확산 생성 모델인 Diffusion-EDFs를 소개한다. 이는 이중 동치성과 계층적 아키텍처를 활용하여 데이터 효율적이고 일반화 가능한 정책 학습을 가능하게 하며, 새로운 물체 구성에 대해서도 뛰어난 내구성과 실제 환경 적용 능력을 확보한다.

ABSTRACT

Diffusion generative modeling has become a promising approach for learning robotic manipulation tasks from stochastic human demonstrations. In this paper, we present Diffusion-EDFs, a novel SE(3)-equivariant diffusion-based approach for visual robotic manipulation tasks. We show that our proposed method achieves remarkable data efficiency, requiring only 5 to 10 human demonstrations for effective end-to-end training in less than an hour. Furthermore, our benchmark experiments demonstrate that our approach has superior generalizability and robustness compared to state-of-the-art methods. Lastly, we validate our methods with real hardware experiments. Project Website: https://sites.google.com/view/diffusion-edfs/home

연구 동기 및 목표

  • 기존의 확산 모델이 큰 시범 집합이 필요로 하며, 분포 외 구성에 대해 일반화 능력이 떨어지는 데서 비롯되는 한계를 해결하기 위해.
  • 로봇 조작의 회전 및 이동 대칭성을 유지하는 SE(3) 기반의 이중 동치성 확산 모델을 개발하여 데이터 효율성과 내구성을 향상시키기 위해.
  • 기존의 에너지 기반 모델(예: EDFs)과 비교해 훈련 시간을 크게 단축시키면서도 종단간 훈련 가능성과 일반화 능력을 유지하기 위해.
  • 점군 관측에서 장거리 의존성을 포착하는 계층적 아키텍처를 통해 시나리오 수준의 맥락 이해를 가능하게 하기 위해.
  • 다양한 조작 작업에 대해 종합적인 시뮬레이션 및 실제 로봇 실험을 통해 방법의 유효성을 검증하기 위해.

제안 방법

  • 3차원 점군 관측에 조건부로 작동하는 확산 기반 점수 기반 생성 모델을 사용하며, SE(3) 변환에 대해 이중 동치성을 가지는 학습된 점수 함수를 적용한다.
  • 지역적 및 전역적 특징 표현을 조합하는 계층적 아키텍처를 사용하여 점군 입력에서 세부 사항과 시나리오 수준의 맥락을 모두 포착한다.
  • 끝효율기 자세가 점차 손상되고, SE(3) 다양체 상에서 점수 기반 확산 과정을 통해 재구성되는 노이즈 제거 과정을 통해 훈련한다.
  • 무결성의 표현(스핀-0에서 스플린-l까지) 기반의 SO(3)-동치성 메시지 전파 레이어를 사용하여, 로테이션과 이동에 대해 일관된 변환 행동을 보장한다.
  • 다중 해상도 노이즈 제거 헤드를 사용하여 고해상도 자세 생성을 수행하며, 취급 및 배치 하위 작업 각각에 대해 별도의 모델을 훈련한다.
  • 샘플링 이후 에너지 기반의 비평가를 활용하여 다수의 확산 샘플 중 품질이 높은 팔걸이 자세를 순위 매기고 선택한다.
Figure 1 : Overview of Diffusion-EDFs. (a) The target end-effector pose $g_{0}$ is bi-equivariantly diffused for the training of Diffusion-EDFs. (b) The end-effector pose is sampled from the policy by denoising with learned bi-equivariant score function. Due to the bi-equivariance, the trained polic
Figure 1 : Overview of Diffusion-EDFs. (a) The target end-effector pose $g_{0}$ is bi-equivariantly diffused for the training of Diffusion-EDFs. (b) The end-effector pose is sampled from the policy by denoising with learned bi-equivariant score function. Due to the bi-equivariance, the trained polic

실험 결과

연구 질문

  • RQ1확산 기반 생성 모델이 오직 5~10개의 인간 시범만으로도 6-DoF 로봇 조작 정책의 데이터 효율적이고 종단간 학습을 달성할 수 있는가?
  • RQ2확산 모델에서의 SE(3)-이중 동치성이 이전에 보지 않은 물체 자세와 구성에 대한 일반화 능력을 어떻게 향상시키는가?
  • RQ3제안된 방법이 EDFs와 같은 기존 에너지 기반 모델에 비해 훈련 시간을 크게 단축시키면서도 성능을 유지할 수 있는가?
  • RQ4계층적 아키텍처가 점군 관측에서 시나리오 수준 맥락을 이해하는 데 모델의 능력을 얼마나 향상시키는가?
  • RQ5이 방법이 새로운 물체 인스턴스, 적대적 방해 요소, 비표준 물체 방향을 포함한 실제 환경 시나리오에 얼마나 잘 일반화되는가?

주요 결과

  • Diffusion-EDFs는 오직 5~10개의 인간 시범만으로 1시간 이내에 효과적인 종단간 훈련을 달성하며, 이는 이전의 EDF 방법 대비 15배 빠른 속도 향상이다.
  • 이 방법은 분포 외 구성, 예를 들어 기울어진 자세나 새로운 물체 인스턴스 등에 대해 뛰어난 일반화 능력을 보이며, 인간 평가에서 성공률가 90% 이상을 기록한다.
  • 머그컵-행거, Bowls-on-Dishes, botte-on-Shelf 작업에 대한 실제 로봇 실험을 통해 원시 점군 관측에서 최소한의 감독으로 유효한 팔걸이 자세를 생성할 수 있음을 확인했다.
  • 샘플링 시간은 시나리오 복잡도에 따라 20개의 팔걸이 자세에 대해 5~10초, 10개의 배치 자세에 대해 9~17초로 다양하다. 특히 Bowls-on-Dishes와 같은 고점군 시나리오에서는 더 긴 추론 시간이 소요된다.
  • RTX 3090 GPU로 훈련할 경우 머그컵 취급은 24분 이내, 머그컵 배치는 36분 이내, 병 취급은 27분 이내, 그릇 배치는 최대 1.3시간 이내이며, 하위 작업 모델을 병렬로 훈련함으로써 총 훈련 시간을 3개의 GPU로 1시간 이내로 단축시킬 수 있다.
  • 계층적 아키텍처는 시나리오 수준 맥락을 구분할 수 있도록 하여, 혼잡한 환경에서 물체 중심 접근 방식보다 성능 향상을 이룬다.
Figure 2 : Architecture of multiscale EDF. Our multiscale EDF model is composed of a feature extracting part and a field model part. See Fig. 7 in Supp. D.3 for details on each module in the architecture. (a) The feature extractor encodes the input point cloud into multiscale featured point clouds.
Figure 2 : Architecture of multiscale EDF. Our multiscale EDF model is composed of a feature extracting part and a field model part. See Fig. 7 in Supp. D.3 for details on each module in the architecture. (a) The feature extractor encodes the input point cloud into multiscale featured point clouds.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.