Skip to main content
QUICK REVIEW

[논문 리뷰] PLA: Language-Driven Open-Vocabulary 3D Scene Understanding

Runyu Ding, Jihan Yang|arXiv (Cornell University)|2022. 11. 29.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 시각-언어 기반 모델을 활용해 3D 장면의 다중 시점 이미지에서 의미적인 캡션을 생성함으로써 개방형 어휘(open-vocabulary) 3D 장면 이해를 위한 언어 기반 프레임워크 PLA를 제안한다. 계층적인 포인트-캡션 쌍을 구성하고 대비 학습을 사용함으로써 PLA는 미학습된 카테고리의 0-샷 로컬라이제이션 및 인식을 가능하게 하여, ScanNet 및 S3IDS 데이터셋에서 기존 방법 대비 hIoU가 25.8%~44.7% 높고, hAP50가 14.5%~50.4% 높은 성능을 달성한다.

ABSTRACT

Open-vocabulary scene understanding aims to localize and recognize unseen categories beyond the annotated label space. The recent breakthrough of 2D open-vocabulary perception is largely driven by Internet-scale paired image-text data with rich vocabulary concepts. However, this success cannot be directly transferred to 3D scenarios due to the inaccessibility of large-scale 3D-text pairs. To this end, we propose to distill knowledge encoded in pre-trained vision-language (VL) foundation models through captioning multi-view images from 3D, which allows explicitly associating 3D and semantic-rich captions. Further, to foster coarse-to-fine visual-semantic representation learning from captions, we design hierarchical 3D-caption pairs, leveraging geometric constraints between 3D scenes and multi-view images. Finally, by employing contrastive learning, the model learns language-aware embeddings that connect 3D and text for open-vocabulary tasks. Our method not only remarkably outperforms baseline methods by 25.8% $\sim$ 44.7% hIoU and 14.5% $\sim$ 50.4% hAP$_{50}$ in open-vocabulary semantic and instance segmentation, but also shows robust transferability on challenging zero-shot domain transfer tasks. See the project website at https://dingry.github.io/projects/PLA.

연구 동기 및 목표

  • 학습 레이블 공간 외의 새로운 의미적 카테고리를 인식할 수 있어야 하는 개방형 어휘 3D 장면 이해의 과제를 해결한다.
  • 2D 시각-언어 사전 학습 모델의 3D로의 직접 전이를 방해하는 대규모 3D-텍스트 쌍의 부족 문제를 해결한다.
  • 실제 3D 장면에서 신규 카테고리, 동의어, 추상적 개념, 레이블이 없는 물체 등에 대해 0-샷 일반화를 가능하게 한다.
  • 사전 학습된 시각-언어 모델을 활용해 3D 이해 모델에 풍부한 의미 지식을 통합하는 일반적이고 확장 가능한 프레임워크를 개발한다.
  • 특수 작업용 아키텍처 수정 없이도 도메인 내 및 도메인 외 0-샷 전이 벤치마크에서 견고한 성능을 달성한다.

제안 방법

  • GPT-ViT2, OFA 등 사전 학습된 시각-언어 기반 모델을 사용해 3D 포인트 클라우드에서 투영된 다중 시점 이미지로부터 의미적인 캡션을 생성한다.
  • 3D 장면과 그 2D 투영 간 기하학적 제약 조건을 활용해 계층적인 포인트-캡션 쌍(장면 수준, 시점 수준, 엔티티 수준)을 구성한다.
  • 대비 학습을 활용해 3D 포인트 특징과 해당 캡션 임베딩을 정렬함으로써 언어 인식 시각 표현을 학습한다.
  • 시각적 의미를 더 잘 포착하는 더 강력한 텍스트 임베딩을 얻기 위해 CLIP 등 사전 학습된 시각-언어 텍스트 인코더를 활용한다.
  • 신경 렌더링 또는 기존 3D 데이터 파이프라인을 사용해 3D 포인트 클라우드와 정렬된 다중 시점 RGB 이미지를 확보하여 캡션 생성에 활용한다.
  • 계층적인 포인트-캡션 쌍에 대해 대비 손실을 사용해 3D 모델을 엔드 투 엔드로 훈련함으로써 0-샷 일반화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1직접적인 3D-텍스트 감독 없이도 사전 학습된 시각-언어 모델을 효과적으로 활용해 3D 장면에 대한 의미적인 캡션을 생성할 수 있는가?
  • RQ23D 기하학에 기반한 계층적인 포인트-캡션 쌍은 3D에서의 군집-부터-세밀한 시각-의미 표현 학습을 어떻게 향상시킬 수 있는가?
  • RQ33D-언어 쌍에 대한 대비 학습을 통해 3D 장면 이해에서 새로운 카테고리의 0-샷 인식은 어느 정도 가능해지는가?
  • RQ4제안된 프레임워크는 분포 및 카테고리 이동이 있는 도메인 외부 데이터셋에도 일반화 가능한가?
  • RQ5기초 모델이 생성한 캡션의 품질이 인간 레이블링 또는 코딩된 캡션과 비교해 후행 3D 이해 성능에 어떤 영향을 미치는가?

주요 결과

  • PLA는 ScanNet 및 S3IDS 데이터셋에서 기존 방법 대비 개방형 어휘 의미 분할에서 hIoU가 25.8%~44.7% 높게 기록한다.
  • 인스턴스 분할에서 PLA는 기존 방법 대비 hAP50를 14.5%~50.4% 향상시켜 새로운 인스턴스에 대한 강력한 일반화 능력을 입증한다.
  • 모델은 0-샷 도메인 전이에 효과적으로 일반화되어, 데이터 분포 및 카테고리 이동이 있는 S3IDS에서 ScanNet으로 훈련된 후에도 잘 작동한다.
  • 텍스트 인코더로 CLIP를 사용할 경우 BERT나 GPT2보다 신규 카테고리에서 mIoU_N가 7% 이상 높게 나타나, 시각 인식 텍스트 인코딩의 유용성을 확인한다.
  • OFA와 같은 기초 모델은 GPT-ViT2보다 캡션 성능이 뛰어나 hIoU를 최대 0.3점 향상시키며, 더 나은 캡션 모델일수록 확장성이 뛰어남을 보여준다.
  • 고품질 마스크를 통해 동의어 클래스(예: 'sofa'에 대한 'couch'), 추상적 개념(예: 'bathroom', 'kitchen'), 그리고 레이블이 없는 물체(예: 'monitor', 'blackboard')를 성공적으로 인식한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.