Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes

Alexandros Delitzas, Maria Parelli|arXiv (Cornell University)|2023. 06. 04.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 3D 시점 포인트 클라우드를 해당 CLIP로 인코딩된 텍스트 및 다중 시점 이미지 임베딩과 정렬함으로써 3D 시각질문응답(3D-VQA) 및 3D 위치 기반 질문응답(3D-SQA)을 향상시키는 대비 시각언어 사전학습 방법인 Multi-CLIP을 제안한다. CLIP의 사전학습된 시각언어 표현을 대비 목적함수를 통해 활용함으로써 Multi-CLIP는 ScanQA 및 SQA3D 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 3D 시점 특징의 의미적 군집화 및 이식 가능성 향상을 입증하였다.

ABSTRACT

Training models to apply common-sense linguistic knowledge and visual concepts from 2D images to 3D scene understanding is a promising direction that researchers have only recently started to explore. However, it still remains understudied whether 2D distilled knowledge can provide useful representations for downstream 3D vision-language tasks such as 3D question answering. In this paper, we propose a novel 3D pre-training Vision-Language method, namely Multi-CLIP, that enables a model to learn language-grounded and transferable 3D scene point cloud representations. We leverage the representational power of the CLIP model by maximizing the agreement between the encoded 3D scene features and the corresponding 2D multi-view image and text embeddings in the CLIP space via a contrastive objective. To validate our approach, we consider the challenging downstream tasks of 3D Visual Question Answering (3D-VQA) and 3D Situated Question Answering (3D-SQA). To this end, we develop novel multi-modal transformer-based architectures and we demonstrate how our pre-training method can benefit their performance. Quantitative and qualitative experimental results show that Multi-CLIP outperforms state-of-the-art works across the downstream tasks of 3D-VQA and 3D-SQA and leads to a well-structured 3D scene feature space.

연구 동기 및 목표

  • CLIP와 같은 2D 시각언어 모델에서 유도된 지식이 3D 시점 이해를 향상시키는 데 효과적으로 전이될 수 있는지 조사하는 것.
  • 공간적, 시각적, 언어적 정보를 통합하는 이식 가능하고 의미적으로 유의미한 3D 시점 표현을 학습하는 데 도전하는 것.
  • 공유된 CLIP 임베딩 공간에서 3D 포인트 클라우드 특징을 2D 다중 시점 이미지 및 텍스트 기술과 정렬하는 사전학습 방법을 개발하는 것.
  • 새로운 다중모달 트랜스포머 기반 아키텍처와 대비 사전학습을 통해 최종 3D-VQA 및 3D-SQA 작업 성능을 향상시키는 것.

제안 방법

  • 3D 스캔 내 객체 특징 간의 공간적 관계를 모델링하기 위해 트랜스포머 아키텍처 기반의 다중모달 3D 시점 인코더를 제안한다.
  • 동일한 3D 시점을 위한 다중 시점 이미지 및 텍스트 기술을 CLIP를 사용해 공유된 임베딩 공간으로 인코딩한다.
  • 3D 시점 표현을 CLIP로 인코딩된 이미지 및 텍스트 임베딩과 정렬하기 위해 대비 학습 목적함수를 적용한다.
  • 양의 쌍(3D 시점과 해당되는 이미지 및 텍스트)이 음의 쌍보다 임베딩 공간에서 더 가까워지도록 유도하는 대비 손실 함수를 활용한다.
  • 더 풍부한 시각적 감독을 위해 3D 시점을 위한 5개의 서로 다른 2D 시점을 생성하는 다중 시점 렌더링 전략을 도입한다.
  • 사전학습된 3D 인코더 가중치를 최종 3D-VLA 모델에 전이하고, 3D-VQA 및 3D-SQA 데이터셋에서 엔드 투 엔드로 미세조정한다.

실험 결과

연구 질문

  • RQ1CLIP와 같은 2D 시각언어 모델에서 유도된 지식이 시각언어 작업에서 3D 시점 이해를 향상시키는 데 효과적으로 전이될 수 있는가?
  • RQ2CLIP 공간에서 3D 시점 표현을 2D 다중 시점 이미지 및 텍스트와 정렬하는 것이 3D-VQA 및 3D-SQA에서의 일반화 및 성능 향상에 기여하는가?
  • RQ33D 시점의 여러 시점은 학습된 3D 표현의 강건성과 품질에 어떤 기여를 하는가?
  • RQ4이러한 3D 시각언어 사전학습 설정에서 대비 학습이 코사인 유사도와 같은 대체 정렬 목적함수보다 더 효과적인가?
  • RQ5다중지점 대비 손실의 구성 요소 중에서(텍스트, 이미지, 3D-3D) 어떤 것이 최종 성능에 가장 중요한가?

주요 결과

  • 기존 SOTA 방법 대비 ScanQA 벤치마크에서 Acc@0.25에서 3.03%p, Acc@0.50에서 2.83%p의 절대적 향상을 달성하였다.
  • 학습에서부터 시작하는 것과 기준선을 초월하여 사전학습 전략의 효과성을 입증하였다.
  • SQA3D 벤치마크에서 EM@1 점수 48.02%를 기록하여, 학습에서부터 시작하는 것과 아블레이션 변형보다 뚜렷한 성능 향상을 보였다.
  • 아블레이션 연구 결과, 다중 시점 사용이 성능 향상에 기여하며, 단일 시점 학습 대비 0.18%p 향상되었다.
  • 텍스트 또는 이미지 대비 손실 항목을 제거하면 성능이 떨어지므로, 양방향 모odal의 공동 감독이 중요하다는 점을 확인하였다.
  • T-SNE 시각화 결과, 사전학습된 3D 시점 특징이 의미적으로 일관된 군집을 형성함을 보여주어 체계적이고 의미 있는 특징 학습이 이루어졌음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.