Skip to main content
QUICK REVIEW

[논문 리뷰] Equivariant Descriptor Fields: SE(3)-Equivariant Energy-Based Models for End-to-End Visual Robotic Manipulation Learning

Hyunwoo Ryu, Jeong Hoon Lee|arXiv (Cornell University)|2022. 06. 16.
Multimodal Machine Learning Applications인용 수 11
한 줄 요약

이 논문은 점군을 사용한 엔드 투 엔드 시각적 로봇 조작을 위한 새로운 SE(3)-등변 에너지 기반 모델인 등변 서술자 필드(EDFs)를 제안한다. 표현 이론을 활용해 등변 서술자를 구성하고 학습 가능한 에너지 함수를 적용함으로써, EDFs는 높은 샘플 효율성을 달성한다—단지 5~10개의 시연만으로도 가능하며, 사전 훈련, 분할 또는 자세 추정 파ipeline 없이도 예측되지 않은 물체 자세, 인스턴스, 그리고 간섭 물체에 일반화된다.

ABSTRACT

End-to-end learning for visual robotic manipulation is known to suffer from sample inefficiency, requiring large numbers of demonstrations. The spatial roto-translation equivariance, or the SE(3)-equivariance can be exploited to improve the sample efficiency for learning robotic manipulation. In this paper, we present SE(3)-equivariant models for visual robotic manipulation from point clouds that can be trained fully end-to-end. By utilizing the representation theory of the Lie group, we construct novel SE(3)-equivariant energy-based models that allow highly sample efficient end-to-end learning. We show that our models can learn from scratch without prior knowledge and yet are highly sample efficient (5~10 demonstrations are enough). Furthermore, we show that our models can generalize to tasks with (i) previously unseen target object poses, (ii) previously unseen target object instances of the category, and (iii) previously unseen visual distractors. We experiment with 6-DoF robotic manipulation tasks to validate our models' sample efficiency and generalizability. Codes are available at: https://github.com/tomato1mule/edf

연구 동기 및 목표

  • 공간적 회전-이동(Se(3)) 등변성을 활용하여 엔드 투 엔드 시각적 로봇 조작의 샘플 비효율성을 해결한다.
  • Transporter Networks(SE(2) 전용) 및 신경 서술자 필드(비엔드 투 엔드, 분할에 의존)와 같은 이전 방법의 한계를 극복한다.
  • 사전 훈련, 물체 키포인트 주석, 또는 분할 파이프라인 없이도 완전히 엔드 투 엔드 훈련을 가능하게 한다.
  • 이전에 볼 수 없었던 목표 물체 자세, 같은 카테고리의 새로운 인스턴스, 그리고 새로운 시각적 간섭 물체에 일반화한다.
  • 데이터가 부족한 조건과 실제 세계 조건에서도 높은 성능을 유지하는 기울기 가능한 SE(3)-등변 프레임워크를 개발한다.

제안 방법

  • 신경 서술자 필드(NDFs)의 에너지 최소화를 SE(3) 다양체 위에서 에너지 기반 모델을 사용한 확률적 학습 프레임워크로 재구성한다.
  • NDFs의 불변 서술자를 표현 이론 기반의 등변 서술자로 일반화하여 방향에 민감하고 SE(3)-등변성을 가지도록 한다.
  • 목표 물체와 배치 타겟 변환을 동시에 모델링하는 새로운 SE(3)-등변 에너지 함수를 제안한다.
  • 비국소 메커니즘에 의존하지 않고 SE(3) 등변성을 유지하는 엔드 투 엔드 훈련 가능한 쿼리 포인트 네트워크를 설계한다.
  • 보조적 사전 훈련이나 분할 없이 단지 5~10개의 전문가 시범만을 사용해 모델을 엔드 투 엔드로 훈련한다.
  • 에너지 기반 모델의 정규화 상수가 비가역적이므로, MCMC 기반 기울기 추정을 사용해 훈련한다.

실험 결과

연구 질문

  • RQ1원시 점군에서 사전 훈련이나 분할 없이 SE(3)-등변 모델을 엔드 투 엔드로 훈련할 수 있는가?
  • RQ2엔드 투 엔드 SE(3)-등변 모델은 얼마나 예측되지 않은 물체 자세와 인스턴스에 일반화할 수 있는가?
  • RQ3훈련 중에 볼 수 없었던 새로운 시각적 간섭 물체가 존재할 경우, 제안된 방법의 성능은 어떠한가?
  • RQ4다양한 테스트 조건에서 일반화를 달성하면서도 높은 샘플 효율성(5~10개의 시범)을 유지할 수 있는가?
  • RQ5등변 서술자와 불변 서술자 간의 비교에서, 어떤 것이 더 강건하고 일반화 능력이 뛰어나게 되는가?

주요 결과

  • EDFs는 5~10개의 시범만으로도 예측되지 않은 자세, 인스턴스, 간섭 물체에 대해 컵의 픽앤플레이스 작업에서 100% 성공률을 달성한다.
  • EDFs는 예측되지 않은 병 인스턴스에 대해 총 성공률 95%로 일반화되며, 예측되지 않은 컵과 Bowls 인스턴스에 대해서는 모든 설정에서 95~100% 성공률을 기록한다.
  • EDFs는 타입-0 서술자만을 사용하는 아블레이트드 모델보다도 성능이 뛰어나며, 아블레이트드 모델이 3배 더 많은 쿼리 포인트를 사용하고도 유의미하게 더 긴 추론 시간(예: 병의 경우 23.0초 대비 16.7초)을 가지는 것으로 확인되었다.
  • EDFs는 예측되지 않은 자세와 간섭 물체에서도 100% 성공률을 유지하는 반면, 기준 모델인 SE(3)-TNs는 총 성공률가 91~92%로 떨어져 더 뛰어난 강건성을 보였다.
  • EDFs는 다중 모달 시범(예: 가장자리와 손잡이 잡기)에도 99% 총 성공률을 달성하며, 반면 SE(3)-TNs는 고분산 시범에서는 실패한다.
  • 반대로, NDFs는 분할되지 않은 입력에서 완전히 실패한다(컵의 경우 0% 성공률), 이는 NDFs에 대해 분할이 필수적임을 확인하지만 EDFs에선 그렇지 않음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.