[논문 리뷰] Zero-shot point cloud segmentation by transferring geometric primitives
이 논문은 보이는 클래스와 보이지 않는 클래스 간의 공통된 기하학적 원소를 학습하고, 세분화된 미지 클래스 인식을 위한 대비 손실을 통해 언어와 정렬함으로써, 전환형 제로샷 3D 포인트 클라우드 의미 분할을 위한 새로운 프레임워크를 제안한다. 각 점의 특징을 학습 가능한 기하학적 원형으로부터의 유사도 벡터로 모델링하고, 다중 커널 의미 임베딩을 사용함으로써, 이 방법은 최첨단 성능을 달성하며, S3DIS, ScanNet, SemanticKITTI 및 nuScenes에서 조화 평균 mIoU를 17.8% 향상시켜 30.4%까지 개선한다.
We investigate transductive zero-shot point cloud semantic segmentation, where the network is trained on seen objects and able to segment unseen objects. The 3D geometric elements are essential cues to imply a novel 3D object type. However, previous methods neglect the fine-grained relationship between the language and the 3D geometric elements. To this end, we propose a novel framework to learn the geometric primitives shared in seen and unseen categories' objects and employ a fine-grained alignment between language and the learned geometric primitives. Therefore, guided by language, the network recognizes the novel objects represented with geometric primitives. Specifically, we formulate a novel point visual representation, the similarity vector of the point's feature to the learnable prototypes, where the prototypes automatically encode geometric primitives via back-propagation. Besides, we propose a novel Unknown-aware InfoNCE Loss to fine-grained align the visual representation with language. Extensive experiments show that our method significantly outperforms other state-of-the-art methods in the harmonic mean-intersection-over-union (hIoU), with the improvement of 17.8\%, 30.4\%, 9.2\% and 7.9\% on S3DIS, ScanNet, SemanticKITTI and nuScenes datasets, respectively. Codes are available (https://github.com/runnanchen/Zero-Shot-Point-Cloud-Segmentation)
연구 동기 및 목표
- 학습 데이터에 레이블이 없는 새로운 객체 카테고리도 인식할 수 있도록 하는 제로샷 3D 포인트 클라우드 의미 분할 문제에 대응한다.
- 기존 방법들이 언어 의미와 3D 기하학적 원소 간의 세분화된 관계를 모델링하지 못하는 한계를 극복한다.
- 보이는 클래스에 대한 편향을 줄이기 위해, 미지 클래스를 명시적으로 고려한 InfoNCE 손실을 도입함으로써 전환형 제로샷 학습에서의 일반화 능력을 향상시킨다.
- 보이는 클래스와 보이지 않는 클래스 간에 공유되는 분리된 기하학적 원소를 학습함으로써, 새로운 객체에 대한 견고한 분할을 가능하게 한다.
제안 방법
- 각 점의 특징과 학습 가능한 기하학적 원형 간의 유사도 벡터를 새로운 시각적 표현으로 도입하여, 역전파를 통해 기하학적 원소를 암묵적으로 인코딩한다.
- 다양한 커널을 사용한 혼합 분포 임베딩을 활용해 언어 의미를 모델링함으로써, 3D 객체가 일반적으로 여러 기하학적 원소로 구성됨을 반영한다.
- 미지 클래스(보이지 않는 클래스)를 명시적으로 고려한 Unknown-aware InfoNCE 손실을 제안하여, 시각적 표현과 의미적 표현 간의 대비 정렬을 수행하고, 보이지 않는 클래스의 잘못된 분류를 명시적으로 방지한다.
- 전환형 설정에서 학습하여, 보이지 않는 클래스의 레이블이 없는 특징을 학습 중에 활용함으로써 제로샷 일반화 성능을 향상시킨다.
- 기본 네트워크(예: PointNet++)를 사용해 초기 점 특징을 추출한 후, 원형 기반 표현 학습과 대비 정렬을 수행한다.
- 보이는 클래스에 대한 지도 학습 손실과, 보이는 클래스 및 보이지 않는 클래스의 점에 대해 제안된 Unknown-aware InfoNCE 손실을 조합하여 모델을 종합적으로 최적화한다.
실험 결과
연구 질문
- RQ1보이는 클래스와 보이지 않는 클래스 간에 효과적으로 기하학적 원소를 학습하고 공유함으로써 제로샷 일반화를 가능하게 할 수 있는가?
- RQ2언어 의미와 기하학적 원소 간의 세분화된 정렬이 제로샷 분할 성능에 미치는 영향은 무엇인가?
- RQ3명시적으로 미지 클래스를 고려한 대비 손실이 일반화 능력을 향상시키고 보이는 클래스에 대한 편향을 줄이는 데 기여하는가?
- RQ4다양한 커널의 혼합으로 표현된 의미 표현이 복합적인 기하학적 구조를 나타내는 시각적 특징과의 정렬을 어떻게 향상시키는가?
주요 결과
- 제안된 방법은 S3DIS 데이터셋에서 이전 최첨단 성능 대비 조화 평균 mIoU를 17.8% 향상시켜 30.4%까지 개선한다.
- ScanNet에서, 강력한 기준 모델 대비 조화 평균 mIoU가 30.4% 향상되어, 복잡한 실내 환경으로의 일반화 능력이 뛰어나다는 것을 입증한다.
- SemanticKITTI와 nuScenes에서 각각 조화 평균 mIoU가 9.2%와 7.9% 향상되어, 다양한 3D 인식 기준 데이터셋에서의 강건성을 입증한다.
- 제거 분석 결과, 기하학적 원소 기반의 시각적 표현은 기준 특징 대비 보이지 않는 클래스의 mIoU를 약 5% 향상시키며, 128개의 원형에서 최적 성능을 달성한다.
- K=16인 다중 커널 의미 표현이 가장 뛰어난 성능을 보이며, 단일 커널 및 다른 커널 수치 대비 최대 7%까지 mIoU에서 우수성을 보였다.
- Unknown-aware InfoNCE 손실은 가짜 레이블링과 자기 일관성 기반의 자기지도 학습 손실보다 뚜렷이 우수하며, 불확실성을 명시적으로 모델링함으로써 보이지 않는 클래스의 잘못된 분류를 줄였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.