Skip to main content
QUICK REVIEW

[논문 리뷰] SCONE: Surface Coverage Optimization in Unknown Environments by Volumetric Integration

Antoine Guédon, Pascal Monasse|arXiv (Cornell University)|2022. 08. 22.
Advanced Vision and Imaging인용 수 4
한 줄 요약

SCONE은 볼륨 메트릭 예측과 가시성 점수의 몬테카를로 적분을 결합하여, 자유로운 6자유도 카메라 운동을 허용하는 대규모 미지의 3D 환경에서 다음 최적 시야(NBV) 예측을 위한 딥러닝 방법을 제안한다. 신경망을 통해 점유도 확률과 가시성을 자기주의(self-attention)를 통해 예측함으로써, 정확한 표면 커버리지 최적화가 가능하며, 기존 방법들보다 객체 수준 및 대규모 시점 재구성 작업에서 뛰어난 성능을 보인다.

ABSTRACT

Next Best View computation (NBV) is a long-standing problem in robotics, and consists in identifying the next most informative sensor position(s) for reconstructing a 3D object or scene efficiently and accurately. Like most current methods, we consider NBV prediction from a depth sensor like Lidar systems. Learning-based methods relying on a volumetric representation of the scene are suitable for path planning, but have lower accuracy than methods using a surface-based representation. However, the latter do not scale well with the size of the scene and constrain the camera to a small number of poses. To obtain the advantages of both representations, we show that we can maximize surface metrics by Monte Carlo integration over a volumetric representation. In particular, we propose an approach, SCONE, that relies on two neural modules: The first module predicts occupancy probability in the entire volume of the scene. Given any new camera pose, the second module samples points in the scene based on their occupancy probability and leverages a self-attention mechanism to predict the visibility of the samples. Finally, we integrate the visibility to evaluate the gain in surface coverage for the new camera pose. NBV is selected as the pose that maximizes the gain in total surface coverage. Our method scales to large scenes and handles free camera motion: It takes as input an arbitrarily large point cloud gathered by a depth sensor as well as camera poses to predict NBV. We demonstrate our approach on a novel dataset made of large and complex 3D scenes.

연구 동기 및 목표

  • 기존 NBV 방법들이 표면 기반 접근 방식은 확장성 부족, 볼륨 기반 접근 방식은 정확도 부족으로 인해 대규모이고 복잡한 3D 환경에서 성능이 떨어지는 문제를 해결하기 위해.
  • 구체적인 물체 주변의 구름이 아닌 자유로운 6자유도 카메라 운동을 허용하는 미지의 환경에서 효과적인 경로 계획 및 3D 재구성 가능하도록 하기 위해.
  • 볼륨 표현의 확장성과 표면 기반 메트릭의 정확성을 결합하기 위해 볼륨 점유도 필드에 대한 몬테카를로 적분을 사용하기 위해.
  • 딥 인식 함수와 자기주의를 사용하여 어떤 카메라 자세에 대해서도 표면 커버리지 증가를 예측할 수 있는 학습 가능하고 미분 가능한 프레임워크 개발하기 위해.
  • 자유 카메라 운동을 허용하는 대규모 복잡한 3D 시점 데이터셋을 CC 라이선스 하에 제작하여 NBV 방법 평가 기준 제공하기 위해.

제안 방법

  • 입력 포인트 클러스터로부터 3D 시점 볼륨 내 점유도 확률을 예측하는 딥 인식 네트워크를 사용하여 고해상도이고 확장 가능한 기하 구조 추정이 가능하다.
  • 두 번째 신경 모듈은 점유도 확률과 카메라 이력 정보를 기반으로, 모든 방향으로 샘플링된 3D 점의 가시성 가능성 예측에 자기주의를 사용한다.
  • 모든 후보 카메라 자세에 대해 볼륨 점유도 필드에 대한 몬테카를로 적분을 적용하여 표면 커버리지 증가량을 추정한다.
  • NBV는 총 가시 표면 영역의 증가량을 최대화하는 자세로 선택된다.
  • 전역 임bedding 대신 국소 포인트 클러스터의 격자 구조를 사용하여 대규모 시점에 효율적으로 스케일링된다.
  • 점유도 및 가시성 예측 모듈을 훈련하기 위해 연속 IoU 지표와 쿨백-라이블러 발산 손실을 사용한다.

실험 결과

연구 질문

  • RQ1볼륨 기반 딥러닝 접근 방식이 대규모 3D 시점에서 표면 커버리지 추정에 대해 높은 정확도를 달성하면서도 확장성 확보가 가능한가?
  • RQ2볼륨 점유도 필드에 대한 몬테카를로 적분이 NBV 선택을 위한 표면 커버리지 증가 최적화에 효과적으로 작용하는가?
  • RQ3카메라 이력 정보를 통합하면 자유 6자유도 운동 환경에서 NBV 선택 성능이 향상되는가?
  • RQ4단일 물체 데이터셋에서 훈련된 모델이 자유 카메라 운동 환경에서 복잡한 대규모 3D 시점으로 일반화 가능한가?
  • RQ5제안된 방법은 표면 커버리지 및 재구성 품질 측면에서 최신 기술(SOTA) NBV 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • SCONE은 ShapeNet 데이터셋에서 최신 기술(SOTA) 방법을 능가하여 테스트 세트에서 평균 표면 커버리지 0.625를 달성했다.
  • 에펠 타워 및 후시미 성과 같은 대규모 시점에서 SCONE은 각각 평균 표면 커버리지 0.741과 0.802를 기록하여 강력한 일반화 능력을 입증했다.
  • 제거 실험 결과, 이웃 특징이 점유도 예측에 핵심적임을 확인하였으며, 이를 포함할 경우 MSE가 0.0816에서 0.0397로 감소했다.
  • 점유도 및 가시성 모듈을 모두 포함한 전체 모델은 기준 모델 대비 30% 감소한 쿨백-라이블러 발산 손실을 기록하여 커버리지 증가의 분포 추정이 더 정확함을 시사한다.
  • 카메라 이력 특징은 NBV 선택 정확도를 약간 향상시키며, 특히 최대 증가량을 식별하는 데 유리하지만, 전체 커버리지 분포에 큰 영향을 주지는 않는다.
  • 제안된 방법은 훈련 도메인을 초월한 복잡한 시점에서도 잘 일반화됨을, CC 라이선스 하에 제공된 새로운 대규모 3D 시점 데이터셋을 통해 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.