[논문 리뷰] Point Cloud Matters: Rethinking the Impact of Different Observation Spaces on Robot Learning
이 논문은 접촉이 풍부한 조작 작업에서 RGB, RGB-D, 3D 포인트 클라우드와 같은 다양한 관측 모odalities가 로봇 학습에 미치는 영향을 조사한다. ManiSkill2와 RLBench의 17개 작업에서 표준화된 Action Chunking Transformer 정책을 사용하여, 포인트 클라우드 관측이 RGB 및 RGB-D보다 일관되게 뛰어나며, 시점, 조명, 노이즈, 배경 변화와 같은 다양한 조건에서 가장 높은 성공률과 뛰어난 zero-shot 일반화 성능을 보임을 입증한다.
In robot learning, the observation space is crucial due to the distinct characteristics of different modalities, which can potentially become a bottleneck alongside policy design. In this study, we explore the influence of various observation spaces on robot learning, focusing on three predominant modalities: RGB, RGB-D, and point cloud. We introduce OBSBench, a benchmark comprising two simulators and 125 tasks, along with standardized pipelines for various encoders and policy baselines. Extensive experiments on diverse contact-rich manipulation tasks reveal a notable trend: point cloud-based methods, even those with the simplest designs, frequently outperform their RGB and RGB-D counterparts. This trend persists in both scenarios: training from scratch and utilizing pre-training. Furthermore, our findings demonstrate that point cloud observations often yield better policy performance and significantly stronger generalization capabilities across various geometric and visual conditions. These outcomes suggest that the 3D point cloud is a valuable observation modality for intricate robotic tasks. We also suggest that incorporating both appearance and coordinate information can enhance the performance of point cloud methods. We hope our work provides valuable insights and guidance for designing more generalizable and robust robotic models. Codes are available at https://github.com/HaoyiZhu/PointCloudMatters.
연구 동기 및 목표
- 로봇 학습에서 RGB, RGB-D, 3D 포인트 클라우드 관측 모달리티의 상대적 효과성을 평가하기 위해.
- 시점 변화, 조명, 노이즈, 배경 변화와 같은 시각적 및 기하학적 교란 조건 하에서 포인트 클라우드가 더 나은 zero-shot 일반화 능력을 제공하는지 조사하기 위해.
- 다양한 모달리티에서 최신의 사전 훈련된 시각적 표현(PVRs)을 사용한 성능 향상 정도를 평가하기 위해.
- 도메인 특화 또는 복잡한 아키텍처 기법 없이 공정하고 통합된 비교 프레임워크를 수립하기 위해.
- 3D 공간 정보를 담고 있는 포인트 클라우드가 복잡한 조작 작업에 있어 2D 외관 기반 관측보다 더 견고하고 효과적임을 경험적으로 입증하기 위해.
제안 방법
- 모든 관측 모달리티에서 일관된 정책 아키텍처를 확보하기 위해, 모든 모달리티에 동일한 Action Chunking Transformer (ACT) 정책 네트워크를 사용한다.
- 각 모달리티에 대해 단순하고 널리 사용되는 인코더를 사용: ResNet50, ViT-B, MultiViT-B, SpUNet34, 그리고 R3M, VC-1, MultiMAE, PonderV2와 같은 PVRs.
- 두 개의 시뮬레이터를 사용하여 복잡성에 대한 강건성을 확보하기 위해, ManiSkill2와 RLBench에서 17개의 접촉이 풍부한 작업에서 성능을 평가한다.
- 샘플 효율성과 일반화 능력을 평가하기 위해, 훈련에서부터 시작한 모델과 사전 훈련된 모델을 비교한다.
- 카메라 시점, 조명 강도, 렌더링 노이즈 수준, 배경 색상 변화 등 다양한 조건에서 zero-shot 일반화 능력을 측정한다.
- 모든 평가에서 주요 지표로 평균 성공률과 평균 순위를 사용한다.

실험 결과
연구 질문
- RQ1접촉이 풍부한 복잡한 로봇 조작 작업에서 3D 포인트 클라우드 관측 모달리티가 RGB 및 RGB-D보다 높은 성능을 내는가?
- RQ2카메라 시점, 조명, 배경 외관 변화에 따른 변화에서 포인트 클라우드 기반 정책의 zero-shot 일반화 능력이 RGB 및 RGB-D와 비교해 어떻게 되는가?
- RQ3사전 훈련된 시각적 표현(PVRs)이 다양한 관측 모달리티에서 성능 향상과 일반화 능력 향상에 얼마나 기여하는가?
- RQ4포인트 클라우드의 성능 우월성이 훈련에서부터 시작한 설정과 사전 훈련 설정 모두에서 일관되게 유지되는가?
- RQ5제한된 데이터로 정책을 훈련할 때, 다양한 관측 모달리티 간의 샘플 효율성은 어떻게 달라지는가?
주요 결과
- 포인트 클라우드 기반 방법은 17개 작업 전반에서 평균 성공률(29%)과 평균 순위(1.22)가 가장 높으며, 훈련에서부터 시작한 설정과 사전 훈련 설정 모두에서 RGB 및 RGB-D를 능가한다.
- 포인트 클라우드 정책은 예측되지 않은 카메라 시점에 효과적으로 일반화되어, zero-shot 평가에서 29%의 성공률을 기록했으며, RGB는 18%, RGB-D는 23%였다.
- 다양한 조명 조건 하에서 포인트 클라우드 모델은 최대 25.3%의 성공률(예: 조도 강도 3.00)을 기록했으며, 극단적인 조명 조건에서 RGB(0.00%)와 RGB-D(0.00%)보다 뚜렷하게 뛰어나다.
- 노이즈 내성 테스트에서는 포인트 클라우드 모델이 높은 노이즈 수준(64)에서도 21.0%의 성공률 유지를 기록했고, RGB 및 RGB-D 모델은 0.00% 또는 근처의 0.00%로 급격히 감소했다.
- 배경 색상 변화 조건에서는 포인트 클라우드 모델이 36.8%의 성공률(R1.0, G1.0)을 기록했으며, 동일 조건에서 RGB(0.00%)와 RGB-D(0.00%)보다 훨씬 뛰어나다.
- 훈련 데이터의 10%만으로도 포인트 클라우드 모델은 평균 성공률 1.3%(PonderV2)를 유지했고, RGB 및 RGB-D 모델은 0.00% 또는 근처의 0.00%로 급격히 떨어져, 뛰어난 샘플 효율성을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.