[논문 리뷰] OVO: Open-Vocabulary Occupancy
OVO는 3D 애너테이션을 훈련 중에 필요로 하지 않는 새로운 모델에 종속되지 않는 프레임워크를 제안한다. 이는 사전 훈련된 2D 오픈-보기어드 세그멘테이션 모델에서 지식 정복을 활용하고, 픽셀-보크셀 필터링을 적용하여 고품질의 보크셀을 선택함으로써 NYUv2와 SemanticKITTI에서 경쟁적인 성능을 달성한다. 이는 임의의 텍스트 쿼리로 새로운 객체 카테고리에 대한 제로샷 예측을 가능하게 한다.
Semantic occupancy prediction aims to infer dense geometry and semantics of surroundings for an autonomous agent to operate safely in the 3D environment. Existing occupancy prediction methods are almost entirely trained on human-annotated volumetric data. Although of high quality, the generation of such 3D annotations is laborious and costly, restricting them to a few specific object categories in the training dataset. To address this limitation, this paper proposes Open Vocabulary Occupancy (OVO), a novel approach that allows semantic occupancy prediction of arbitrary classes but without the need for 3D annotations during training. Keys to our approach are (1) knowledge distillation from a pre-trained 2D open-vocabulary segmentation model to the 3D occupancy network, and (2) pixel-voxel filtering for high-quality training data generation. The resulting framework is simple, compact, and compatible with most state-of-the-art semantic occupancy prediction models. On NYUv2 and SemanticKITTI datasets, OVO achieves competitive performance compared to supervised semantic occupancy prediction approaches. Furthermore, we conduct extensive analyses and ablation studies to offer insights into the design of the proposed framework. Our code is publicly available at https://github.com/dzcgaara/OVO.
연구 동기 및 목표
- 기존 3D 세그멘테이션 오브젝티브 모델이 고비용의 사전 정의된 3D 애너테이션에 의존하여 고정된 객체 클래스 세트에만 적용되는 확장성의 한계를 해결하기 위해.
- 훈련 중에 볼 수 없었던 임의의 시맨틱 클래스를 제로샷으로 예측할 수 있도록 하여 현재 오브젝티브 네트워크에서 발생하는 레이블 세트의 제약을 극복하기 위해.
- 기존 최신 기술 수준의 오브젝티브 예측 모델과 재훈련 없이도 호환 가능한 단순하고 컴act하며 호환 가능한 프레임워크를 개발하기 위해.
- 제로샷 일반화를 위해 2D 오픈-보기어드 모델에서 3D 오브젝티브 네트워크로 지식 정복의 효과성을 조사하기 위해.
- 훈련 데이터 품질, 특히 보크셀 필터링과 특징 정렬을 통한 성능에 미치는 영향을 분석하기 위해.
제안 방법
- 사전 훈련된 2D 오픈-보기어드 세그멘테이션 모델(LSeg)에서 3D 오브젝티브 네트워크로 지식 정복을 적용하여 3D 공간으로 시맨틱 이해를 전달한다.
- 보크셀-픽셀, 보크셀-텍스트, 픽셀-픽셀 정렬을 포함한 3단계 특징 정렬 프로세스를 도입하여 2D 이미지 특징과 3D 보크셀 특징, 텍스트 임bedding을 정렬한다.
- 보크셀-픽셀 정렬 중에 2D 모델의 잡음이 많거나 신뢰도가 낮은 예측을 낮게 가중치를 조정함으로써 훈련의 안정성과 성능을 향상시킨다.
- 다단계 보크셀 필터링 메커니즘을 사용하여 이미지 외부, 가림, 다중 시야에서 일관성이 없는 보크셀을 제거함으로써 고품질의 훈련 보크셀을 선택한다.
- 이 프레임워크는 모델에 종속되지 않게 설계되어, MonoScene와 같은 기존 오브젝티브 네트워크와 호환되며, 소량의 아키텍처 수정만 필요로 한다.
- 인퍼런스 시점에 텍스트 쿼리를 사용하여 어떤 시맨틱 클래스에 대해서도 오브젝티브를 예측할 수 있도록 하여, 훈련 레이블 세트를 초월한 제로샷 일반화를 가능하게 한다.

실험 결과
연구 질문
- RQ1사전 훈련된 2D 오픈-보기어드 모델에서 지식 정복을 통해 3D 오브젝티브 예측에 시맨틱 이해를 효과적으로 전달할 수 있는가? 이때 3D 애너테이션이 필요하지 않다.
- RQ2훈련 보크셀의 품질이 제로샷 3D 세그멘테이션 오브젝티브 예측 성능에 어떤 영향을 미치는가?
- RQ3제안된 특징 정렬 모듈(보크셀-픽셀, 보크셀-텍스트, 픽셀-픽셀)의 각 구성 요소가 최종 성능에 기여하는 정도는 어떠한가?
- RQ4잡음이 많은 예측에 대한 재가중치 조정이 정복 과정과 모델 일반화에 얼마나 기여하는가?
- RQ5제안된 프레임워크는 훈련 데이터에 존재하지 않는 새로운 객체 카테고리, 특히 모호하거나 희귀한 설명을 가진 것들에도 일반화 가능한가?
주요 결과
- OVO는 NYUv2 데이터셋에서 새로운 클래스에 대해 평균 교차율(mIoU) 20.15%를 달성하여, 3D 애너테이션이 없는 기존 베이스라인 방법보다 뚜렷이 뛰어난 성능을 보였다.
- 제거 분석 결과, 보크셀-픽셀 정렬에서 재가중치를 적용함으로써 mIoU가 2.49% 향상되었으며, 이는 잡음 감소에 있어 그 중요성을 입증한다.
- 모든 세 가지 보크셀 필터링 메커니즘(이미지 외부, 가림, 일관성 없음)을 적용하면 훈련 보크셀 수가 270만에서 36만으로 감소하지만, mIoU는 5.78점 향상되어 품질이 수량을 압도함을 입증한다.
- OVO 모듈을 추가함으로써 기본 MonoScene 모델 대비 계산 비용이 오직 14% 증가하여 높은 효율성을 보였다.
- 정성적 결과에서 OVO는 '침대', '의자', '자동차', '도로'와 같은 새로운 클래스를 저조도 또는 시야 외부 상황에서도 성공적으로 예측하였다.
- 모델은 '물체' 또는 '가구'와 같은 오픈-보기어드 쿼리에도 효과적으로 일반화되어 강력한 제로샷 능력을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.