Skip to main content
QUICK REVIEW

[논문 리뷰] SAT: 2D Semantics Assisted Training for 3D Visual Grounding

Zhengyuan Yang, Songyang Zhang|arXiv (Cornell University)|2021. 05. 24.
Multimodal Machine Learning Applications참고 문헌 51인용 수 7
한 줄 요약

이 논문은 추론 시 2D 입력이 필요하지 않은 3D 시각적 기반 성능 향상을 위해 훈련 중에 풍부한 2D 이미지 의미 정보—예를 들어 객체 레이블, 특징, 기하적 신호—를 활용하는 2D 세미틱스 보조 훈련(SAT)을 제안한다. 2D와 3D 객체 간의 보조 정렬 손실을 도입하고, 2D 정보 泄漏를 방지하기 위해 트랜스포머 기반의 어텐션 마스크를 사용함으로써, SAT는 Nr3D에서 정확도를 37.7%에서 49.2%로 향상시켜 여러 벤치마크에서 새로운 최고 성능을 달성한다.

ABSTRACT

3D visual grounding aims at grounding a natural language description about a 3D scene, usually represented in the form of 3D point clouds, to the targeted object region. Point clouds are sparse, noisy, and contain limited semantic information compared with 2D images. These inherent limitations make the 3D visual grounding problem more challenging. In this study, we propose 2D Semantics Assisted Training (SAT) that utilizes 2D image semantics in the training stage to ease point-cloud-language joint representation learning and assist 3D visual grounding. The main idea is to learn auxiliary alignments between rich, clean 2D object representations and the corresponding objects or mentioned entities in 3D scenes. SAT takes 2D object semantics, i.e., object label, image feature, and 2D geometric feature, as the extra input in training but does not require such inputs during inference. By effectively utilizing 2D semantics in training, our approach boosts the accuracy on the Nr3D dataset from 37.7% to 49.2%, which significantly surpasses the non-SAT baseline with the identical network architecture and inference input. Our approach outperforms the state of the art by large margins on multiple 3D visual grounding datasets, i.e., +10.4% absolute accuracy on Nr3D, +9.9% on Sr3D, and +5.6% on ScanRef.

연구 동기 및 목표

  • 3D 포인트 클라우드가 희소하고 노이즈가 많을 때, 훈련 중에 더 풍부한 2D 이미지 의미 정보를 활용하여 시각적 기반 성능을 향상시키는 것.
  • 추론 시 2D 입력이 필요하지 않도록 연합된 3D 시각-언어 표현 학습을 향상시키는 것.
  • 깨끗한 2D 객체 표현을 3D 모델에 흡수하는 훈련 전략을 설계하면서도, 2D 입력의 泄漏를 방지하는 것.
  • 동일한 추론 입력과 네트워크 아키텍처를 사용할 때 기존 방법들을 초월하는 성능을 달성하는 것.

제안 방법

  • 훈련 중에만 사용 가능한 2D 객체 레이블, 이미지 특징, 2D 기하 특징을 보조 입력으로 사용하는 새로운 훈련 철학인 2D 세미틱스 보조 훈련(SAT)을 도입한다.
  • 2D 객체 표현을 해당 3D 제안과 언어 쿼리에 정렬하기 위해 트리플릿 손실 기반의 객체 대응 손실을 제안한다.
  • 고품질의 2D 세미틱스 특징을 생성하고 2D 입력이 최종 출력 모듈에 영향을 주지 않도록 트랜스포머 어텐션 마스크를 활용한다.
  • 주 3D 시각적 기반 손실과 보조 2D-3D 정렬 손실을 조합한 손실을 사용하여 3D 기반 트랜스포머 모델을 훈련시킨다.
  • 3D 포인트 클라우드 특징과 언어 쿼리를 융합하는 다중 모odal 트랜스포머 아키텍처를 사용하며, 2D 세미틱스는 훈련 중에만 통합된다.
  • 추론 시 2D 입력을 전혀 사용하지 않아 실세계 구현 환경과의 호환성을 유지한다.

실험 결과

연구 질문

  • RQ12D 이미지 의미 정보를 훈련 중에만 사용할 경우 3D 시각적 기반 성능 향상에 기여할 수 있는가?
  • RQ22D 의미 정보를 추론 시 정보 泄漏 없이 3D 시각적 기반 훈련에 효과적으로 통합할 수 있는가?
  • RQ32D와 3D 객체 간의 보조 정렬이 3D 포인트 클라우드에서 더 나은 연합 표현 학습을 이끌 수 있는가?
  • RQ4SAT는 추론 시 2D 입력이 필요 없이 3D 시각적 기반 벤치마크에서 최고 성능을 달성할 수 있는가?
  • RQ5SAT는 객체 클래스, 공간 관계, 색상 및 형태와 같은 속성 이해에 어떤 정성적 이점을 제공하는가?

주요 결과

  • SAT는 동일한 네트워크와 추론 입력을 사용하는 비-SAT 기반 모델과 비교해 Nr3D 데이터셋에서 정확도를 37.7%에서 49.2%로 향상시켰다.
  • SAT는 Nr3D에서 +10.4%p, Sr3D에서 +9.9%p, ScanRef에서 +5.6%p의 절대 정확도 향상을 기록했으며, 이는 이전 최고 성능 기준이다.
  • 2D 입력을 훈련 및 추론 모두에서 사용하는 방법(예: 50.3% 대비 49.2%)과 유사한 성능을 달성했지만, 추론 시 2D 입력이 필요하지 않아도 된다.
  • 정성적 분석 결과, SAT는 객체 인식, 공간 관계 이해(예: '벽에 붙어 있는') 및 속성 이해(예: '흰색과 초록색')를 향상시켰다.
  • 실패 케이스 분석 결과, SAT는 '벽을 향해 있는'과 같은 시야 의존적 쿼리나 '의자' 대비 '오피스 체어'와 같은 애매한 용어에 여전히 어려움을 겪는다.
  • 이 방법은 2D 세미틱스를 3D 표현으로 효과적으로 흡수하여, 복잡한 환경에서 더 나은 일반화 및 강인성을 확보한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.