Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Diffuser Actor: Policy Diffusion with 3D Scene Representations

Tsung-Wei Ke, Nikolaos Gkanatsios|arXiv (Cornell University)|2024. 02. 16.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

3D Diffuser Actor는 3D 환경 표현과 3D 상대적 어텐션을 활용하여 반복적으로 노이즈 제거하는 확산 기반 로봇 정책을 도입하여, RLBench에서 다중 시점 기준 18.1%의 절대적 성능 향상, 단일 시점 기준 13.1% 향상, CALVIN에서 0% 초과 일반화 성능 7% 상대적 향상을 달성함. 이는 소수의 실제 세계 시연로부터도 효과적인 일반화를 가능하게 함.

ABSTRACT

Diffusion policies are conditional diffusion models that learn robot action distributions conditioned on the robot and environment state. They have recently shown to outperform both deterministic and alternative action distribution learning formulations. 3D robot policies use 3D scene feature representations aggregated from a single or multiple camera views using sensed depth. They have shown to generalize better than their 2D counterparts across camera viewpoints. We unify these two lines of work and present 3D Diffuser Actor, a neural policy equipped with a novel 3D denoising transformer that fuses information from the 3D visual scene, a language instruction and proprioception to predict the noise in noised 3D robot pose trajectories. 3D Diffuser Actor sets a new state-of-the-art on RLBench with an absolute performance gain of 18.1% over the current SOTA on a multi-view setup and an absolute gain of 13.1% on a single-view setup. On the CALVIN benchmark, it improves over the current SOTA by a 9% relative increase. It also learns to control a robot manipulator in the real world from a handful of demonstrations. Through thorough comparisons with the current SOTA policies and ablations of our model, we show 3D Diffuser Actor's design choices dramatically outperform 2D representations, regression and classification objectives, absolute attentions, and holistic non-tokenized 3D scene embeddings.

연구 동기 및 목표

  • 3D 확산 정책와 3D 환경 표현을 융합하여 다중 작업 3D 로봇 조작의 일반화 능력과 성능을 향상시키기.
  • 2D 기반 정책와 결정적 행동 헤드의 한계를 극복하기 위해 다중 모odal 조건부 확산 모델링을 활용하여 행동 분포를 모델링하기.
  • 3D 환경 특징 학습과 3D 상대적 어텐션을 통해 카메라 시점과 예측 불가능한 환경에서도 0-샷 일반화를 가능하게 하기.
  • 3D 인식 기반 반복적 노이즈 제거 정책을 통해 소수의 인간 시연로부터 강력한 실제 세계로의 전이 성능 확보하기.
  • 3D 토큰화와 3D 상대적 어텐션 등의 아키텍처 구성 요소가 일반화 및 성능에 미치는 영향을 아블레이션 연구를 통해 검증하기.

제안 방법

  • 모델은 시각 인코더를 사용하여 다중 시점 RGB-D 관측치를 2D 이미지 특징 토큰으로 인코딩함.
  • 깊이 정보를 활용해 2D 특징 토큰을 3D 공간으로 상승시켜 환경과 로봇 종단기구를 나타내는 3D 환경 토큰을 형성함.
  • 3D 상대적 위치 어텐션 트랜스포머는 3D 환경 토큰, 언어 지시어 임베딩, 노이즈가 섞인 자세 예측치를 처리하여 3D 이동 및 회전 오차를 예측함.
  • 정책은 반복적 노이즈 제거를 사용함: 노이즈가 섞인 자세에서 시작하여 확산 과정에서 노이즈 예측을 반복적으로 활용해 종단기구 궤적을 정밀하게 개선함.
  • 모델은 언어 지시어에 조건을 두고 종단기구 자세의 짧은 역사 정보를 유지하여 장기 환경, 다단계 작업 실행을 지원함.
  • 예측된 자세는 희소하게 생성됨(핵심자세), 이는 효율적인 추론과 BiRRT와 같은 운동 계획기와의 호환성을 보장함.

실험 결과

연구 질문

  • RQ13D 환경 표현과 확산 기반 행동 모델링을 융합하면 다중 작업 3D 로봇 조작에서 0-샷 일반화 성능 향상에 기여하는가?
  • RQ22D 또는 비상대적 어텐션과 비교해 3D 상대적 어텐션은 시각 운동 정책 학습에서 공간적 추론과 등변성에 어떻게 기여하는가?
  • RQ33D 환경 특징화는 카메라 시점과 새로운 환경 간의 일반화 능력을 어느 정도 향상시키는가?
  • RQ43D 환경 표현에 기반한 확산 정책은 소수의 실제 세계 시연로부터 효과적으로 일반화할 수 있는가?
  • RQ53D 토큰화나 반복적 노이즈 제거와 같은 아키텍처 구성 요소 중 성능 및 내구성 향상에 가장 기여하는 요소는 무엇인가?

주요 결과

  • RLBench에서 다중 시점 설정에서는 이전 SOTA 대비 18.1% 절대적 성능 향상을 달성하였고, 단일 시점 설정에서는 13.1% 향상됨.
  • CALVIN 벤치마크에서 0-샷 예측 불가 환경 일반화 성능이 향상되어 평균적으로 0.2개 더 많은 작업을 성공적으로 완료함으로써 이전 SOTA 대비 7% 상대적 향상 달성.
  • 모델은 실제 세계 작업에 효과적으로 일반화되어, 각 작업당 15개의 시범만으로도 12개의 다양한 조작 작업에서 높은 성공률 기록함.
  • 아블레이션 연구 결과 3D 환경 특징화와 3D 상대적 어텐션은 성능 향상에 필수적이며, 둘 다 일반화 능력을 크게 향상시킴.
  • 모델은 단일 GPU에서 추론 시 600ms 내외로 실행되어 희소 핵심자세 예측 덕분에 효율적인 추론을 보이며, 평균적으로 3.27개의 작업을 연속적으로 성공적으로 완료함.
  • 언어 지시어에 대한 강력한 조건부 처리가 성능 향상에 크게 기여함. 특히 장기 환경, 다중 작업 설정에서 뚜렷한 향상이 관찰됨.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.