[논문 리뷰] OccuSeg: Occupancy-aware 3D Instance Segmentation
OccuSeg는 각 인스턴스당 밴델 수인 '3D 밴델 크기'를 도입하여 점유도 인식 감독을 활용하는 새로운 3D 인스턴스 세분화 프레임워크를 제안한다. 이는 정확도와 클러스터링 정확도를 향상시키는 데 기여한다. 다중 작업 학습을 통해 공간 임베딩과 점유 신호를 동시에 학습함으로써, ScanNetV2, S3DIS 및 SceneNN에서 최고 성능을 기록하며 높은 효율성을 확보한다.
3D instance segmentation, with a variety of applications in robotics and augmented reality, is in large demands these days. Unlike 2D images that are projective observations of the environment, 3D models provide metric reconstruction of the scenes without occlusion or scale ambiguity. In this paper, we define "3D occupancy size", as the number of voxels occupied by each instance. It owns advantages of robustness in prediction, on which basis, OccuSeg, an occupancy-aware 3D instance segmentation scheme is proposed. Our multi-task learning produces both occupancy signal and embedding representations, where the training of spatial and feature embeddings varies with their difference in scale-aware. Our clustering scheme benefits from the reliable comparison between the predicted occupancy size and the clustered occupancy size, which encourages hard samples being correctly clustered and avoids over segmentation. The proposed approach achieves state-of-the-art performance on 3 real-world datasets, i.e. ScanNetV2, S3DIS and SceneNN, while maintaining high efficiency.
연구 동기 및 목표
- 로봇 및 AR/VR에서 흔히 발생하는 복잡하고 교착된 환경에서의 강건한 3D 인스턴스 세분화 문제를 해결하기 위해.
- 인스턴스 수준의 점유 크기를 감독 신호로 통합하여 클러스터링 신뢰도를 향상시키기 위해.
- 스케일 인식 공간 및 특징 임베딩을 활용하여 효율적인 추론을 통해 높은 성능을 달성하기 위해.
- 점유 크기 감독을 통해 과다 세분화를 줄이고 어려운 인스턴스의 클러스터링을 향상시키기 위해.
- 스케일 또는 교착성의 모호성이 없는 메트릭 3D 재구성 기반으로 새로운 3D 인스턴스 세분화 기준을 설정하기 위해.
제안 방법
- 이 방법은 각 3D 점 또는 밴델에 대해 공간 임베딩과 점유 신호를 동시에 예측하는 다중 작업 학습 프레임워크를 도입한다.
- 점유 크기는 단일 인스턴스가 점유하는 밴델 수로, 클러스터링에 강력한 감독 신호로 기능한다.
- 스케일 인식 감독을 통해 공간 및 특징 임베딩을 학습하여 다양한 스케일에서 인스턴스 기하학을 더 잘 포착하도록 한다.
- 예측된 점유 크기를 기반으로 클러스터링된 인스턴스 크기와 비교하여 올바른 그룹화를 유도하고 과다 세분화를 줄이는 클러스터링 기법을 사용한다.
- 3D 컨볼루션 레이어를 통합하고 원시 포인트 클라우드 또는 밴델 격자에서 엔드 투 엔드 표현을 학습하는 네트워크 아키텍처를 사용한다.
- 예측된 점유 크기와 클러스터링된 점유 크기 간 일관성을 장려하는 미분 가능 클러스터링 손실을 사용한다.
실험 결과
연구 질문
- RQ1점유 크기가 3D 인스턴스 세분화 성능 향상에 신뢰할 수 있는 감독 신호로 기능할 수 있는가?
- RQ2스케일 인식 임베딩 학습은 3D 인스턴스의 클러스터링 정확도를 어떻게 향상시키는가?
- RQ3점유도 인식 감독은 특히 어려운 또는 작은 인스턴스에서 과다 세분화를 줄일 수 있는가?
- RQ4제안된 방법은 고성능을 달성하면서도 높은 추론 효율성을 유지하는가?
- RQ5ScanNetV2, S3DIS 및 SceneNN와 같은 다양한 실세계 3D 데이터셋 간에 이 방법은 어떻게 일반화되는가?
주요 결과
- OccuSeg는 ScanNetV2 데이터셋에서 최고 성능을 기록하며, 이전 방법들보다 인스턴스 세분화 정확도에서 뛰어난 성능을 보였다.
- S3DIS 및 SceneNN를 포함한 여러 벤치마크에서 강력한 일반화 능력을 보이며 도메인 이동에 대한 강건성을 확인했다.
- 점유 크기를 활용함으로써 과다 세분화를 줄이고 어려운, 작은, 또는 교착된 인스턴스의 클러스터링을 향상시켰다.
- 점유 크기 감독을 통합한 다중 작업 학습 프레임워크는 더 신뢰성 있고 일관된 인스턴스 예측을 이끌어냈다.
- 높은 추론 효율성을 유지하여 로봇 및 AR/VR 분야의 실시간 응용에 적합하다.
- 제거 분석을 통해 점유 크기 감독이 클러스터링 성능과 모델의 강건성에 상당한 기여를 한다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.