Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Concept Grounding on Neural Fields

Yining Hong, Yilun Du|arXiv (Cornell University)|2022. 07. 13.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 질문-답변 지도를 통해 의미적 및 인스턴스 세분화를 동시에 학습함으로써 3D 개념 기반을 수행하는 새로운 프레임워크인 3D-CG를 제안한다. 3D 좌표 기반 기술자와 언어 개념 임베딩 간의 벡터 유사도를 계산함으로써, 이 방법은 엔드 투 엔드로 미분 가능한 세분화 및 추론을 가능하게 하며, 기존의 비지도 및 언어 매개 모델에 비해 세분화 및 시각적 추론 과제에서 모두 뛰어난 성능을 보이며, 새로운 형태와 실존 스캔에 대해 잘 일반화된다.

ABSTRACT

In this paper, we address the challenging problem of 3D concept grounding (i.e. segmenting and learning visual concepts) by looking at RGBD images and reasoning about paired questions and answers. Existing visual reasoning approaches typically utilize supervised methods to extract 2D segmentation masks on which concepts are grounded. In contrast, humans are capable of grounding concepts on the underlying 3D representation of images. However, traditionally inferred 3D representations (e.g., point clouds, voxelgrids, and meshes) cannot capture continuous 3D features flexibly, thus making it challenging to ground concepts to 3D regions based on the language description of the object being referred to. To address both issues, we propose to leverage the continuous, differentiable nature of neural fields to segment and learn concepts. Specifically, each 3D coordinate in a scene is represented as a high-dimensional descriptor. Concept grounding can then be performed by computing the similarity between the descriptor vector of a 3D coordinate and the vector embedding of a language concept, which enables segmentations and concept learning to be jointly learned on neural fields in a differentiable fashion. As a result, both 3D semantic and instance segmentations can emerge directly from question answering supervision using a set of defined neural operators on top of neural fields (e.g., filtering and counting). Experimental results show that our proposed framework outperforms unsupervised/language-mediated segmentation models on semantic and instance segmentation tasks, as well as outperforms existing models on the challenging 3D aware visual reasoning tasks. Furthermore, our framework can generalize well to unseen shape categories and real scans.

연구 동기 및 목표

  • 2D 세분화 기반 시각적 추론의 한계를 해결하기 위해, 특히 가림을 견디지 못하고 새로운 개념으로 일반화하지 못하는 문제를 해결한다.
  • 점군이나 메쉬와 같은 이산적인 3D 구조가 아닌 연속적이고 미분 가능한 3D 표현에 개념을 기반으로 함으로써 더 인간에 가까운 3D 시각적 추론을 가능하게 한다.
  • 사전에 정의된 세분화 마스크가 필요 없이 질문-답변 지도만으로 3D 의미적 및 인스턴스 세분화가 자연스럽게 유도되는 프레임워크를 개발한다.
  • 신경 필드 상에서 필터링, 질의, 세기 측정 등의 신경 연산자를 설계하여 강력한 시각적 추론과 개념 기반을 지원한다.

제안 방법

  • 프레임워크는 각 3D 좌표를 고차원 연속 기술자 벡터로 표현하기 위해 신경 기술자 필드(NDFs)를 사용한다.
  • 개념 기반은 3D 좌표의 기술자와 언어 개념의 임베딩 벡터 간의 미분 가능한 벡터 유사도를 통해 수행된다.
  • NDFs 위에 다음과 같은 신경 연산자를 정의한다: 존재 여부 검출을 위한 필터 연산자, 속성 추론을 위한 질의 연산자, 인스턴스 수를 세는 신경 카운팅 연산자.
  • 질문-답변 지도를 통한 엔드 투 엔드로 미분 가능한 훈련을 통해 세분화 및 추론을 공동 최적화한다.
  • 이 방법은 애초에 애너테이션된 2D 마스크나 사전 정의된 개념 카테고리에 의존하지 않고, 자기 주도적으로 3D 표현을 학습한다.
  • 신경 필드 표현의 연속성과 미분 가능성 덕분에, 새로운 형태 카테고리와 실존 스캔에 대해 제로샷 일반화가 가능해진다.

실험 결과

연구 질문

  • RQ1미분 가능한 연속적인 3D 표현을 통해 세분화와 추론의 공동 학습을 지원하는 3D 개념 기반을 달성할 수 있는가?
  • RQ2사전에 트레이닝된 모델을 미세조정 없이도 새로운 형태 카테고리와 실제 세계 스캔에 얼마나 잘 일반화할 수 있는가?
  • RQ3마스크에 대한 명시적 지도 없이 질문-답변 지도만으로 의미적 및 인스턴스 수준의 3D 세분화가 자연스럽게 유도될 수 있는가?
  • RQ42D 세분화 기반 방법에 비해 신경 기술자 필드에 기반한 기반 방식이 가림에 대해 얼마나 더 강건한가?
  • RQ5필터링, 질의, 세기 측정과 같은 신경 연산자가 신경 필드 상에서 효과적으로 정의되고 훈련될 수 있는가?

주요 결과

  • 3D-CG는 벤치마크에서 평균 의미 세분화 IoU 69.4를 달성하여, CVX(61.7), CVX+L(65.2), BAE(58.6), BAE+L(61.3) 등의 베이스라인 모델을 크게 앞서간다.
  • 인스턴스 세분화에서는 평균 IoU 56.9를 기록하여, BAE+L(42.0)과 CVX+L(38.9)을 포함한 모든 베이스라인을 앞서며 뛰어난 성능을 보였다.
  • 학습 데이터에 포함되지 않은 카테고리에 대해서도 효과적으로 일반화된다: 카트로 학습한 후 자전거의 바퀴를 정확히 식별하고 세며, 침대의 다리를 모두 탐지할 수 있었다.
  • RedWood 데이터셋의 실존 스캔에서 3D-CG는 부분적이고 단일 시야 스캔에서도 객체를 정확히 세분화하고 추론할 수 있었으며, 실제 데이터 품질에 대한 강건성을 입증했다.
  • 실제 환경에 대한 제로샷 전이가 가능하며, 훈련 데이터에 포함되지 않은 형태(예: 바퀴, 다리 등)도 정확히 탐지할 수 있었다.
  • 질문-답변 지도만으로도 3D 세분화가 자연스럽게 유도된다는 점은, 이 방법이 명시적인 세분화 지도 없이도 의미 있고 분리된 3D 표현을 학습하고 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.