Skip to main content
QUICK REVIEW

[논문 리뷰] Toward Explainable and Fine-Grained 3D Grounding through Referring Textual Phrases

Zhihao Yuan, Yan Xu|arXiv (Cornell University)|2022. 07. 05.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 자연어 기술문서에서 참조된 대상 객체와 비대상 객체를 모두 국소화하는 세밀한 3D 시각적 기반 작업인 3D 프레이즈 인식 기반 기반(3DPAG)을 소개한다. 문장-객체 정렬 최적화 및 프레이즈별 사전학습 기법을 제안하고, 약 227만 건의 프레이즈 수준 애너테이션을 포함한 새로운 데이터셋을 공개함으로써, 표준 벤치마크에서 최신 기술 성능을 3.9%에서 4.6% 향상시켰다.

ABSTRACT

Recent progress in 3D scene understanding has explored visual grounding (3DVG) to localize a target object through a language description. However, existing methods only consider the dependency between the entire sentence and the target object, ignoring fine-grained relationships between contexts and non-target ones. In this paper, we extend 3DVG to a more fine-grained and interpretable task, called 3D Phrase Aware Grounding (3DPAG). The 3DPAG task aims to localize the target objects in a 3D scene by explicitly identifying all phrase-related objects and then conducting the reasoning according to contextual phrases. To tackle this problem, we manually labeled about 227K phrase-level annotations using a self-developed platform, from 88K sentences of widely used 3DVG datasets, i.e., Nr3D, Sr3D and ScanRefer. By tapping on our datasets, we can extend previous 3DVG methods to the fine-grained phrase-aware scenario. It is achieved through the proposed novel phrase-object alignment optimization and phrase-specific pre-training, boosting conventional 3DVG performance as well. Extensive results confirm significant improvements, i.e., previous state-of-the-art method achieves 3.9%, 3.5% and 4.6% overall accuracy gains on Nr3D, Sr3D and ScanRefer respectively.

연구 동기 및 목표

  • 기존 3D 시각적 기반(3DVG) 기법이 대상 객체에만 집중하고 비대상 객체와의 세밀한 관계를 忽略하는 한계를 해결하기 위해.
  • 3D 시나리오에 있는 모든 문장 기반 참조 객체를 명시적으로 국소화함으로써 더 해석 가능하고 설명 가능한 3D 기반을 가능하게 하기 위해.
  • Nr3D, Sr3D, ScanRefer에서 유래한 약 88만 개 문장에 걸쳐 약 227만 건의 수동으로 애너테이션된 프레이즈 수준 참조를 포함한 새로운 벤치마크를 개발하기 위해.
  • 기존 3DVG 모델이 3DPAG 작업을 수행할 수 있도록 도와주는 플러그 앤 플레이 기법인 프레이즈-객체 정렬 최적화 및 프레이즈별 사전학습 기법을 제안하기 위해.
  • 3DPAG가 다양한 표준 데이터셋에서 3DVG 성능을 상당히 향상시킨다는 것을 입증하기 위해.

제안 방법

  • 기존 3DVG 데이터셋(Nr3D, Sr3D, ScanRefer)에서 유래한 88만 개 문장을 프레이즈 수준 참조 애너테이션을 약 227만 건으로 추가하여, 새롭게 Sr3D++, Nr3D++, ScanRefer++ 세 가지 데이터셋을 생성한다.
  • 언어 프레이즈와 해당 3D 객체 간의 정확한 대응을 위해 교차 어텐션 특징을 개선하는 새로운 프레이즈-객체 정렬(POA) 맵 최적화 기법을 도입한다.
  • 학습 중에 타겟 객체를 다른 프레이즈 기반 참조 객체로 번갈아가며 사용하는 합성 마스크를 활용한 프레이즈별 사전학습 전략을 설계한다.
  • POA 최적화 및 프레이즈별 사전학습을 통합하여 기존 3DVG 모델(SAT, MVT 등)을 개선함으로써 3DPAG를 수행할 수 있도록 한다.
  • 학습 시에 타겟 객체 애너테이션만 사용하고 평가 시에는 전체 프레이즈 애너테이션을 사용하는 규칙 기반 프레이즈 검출 기반의 약한 지도 학습 설정을 통해 3DPAG를 가능하게 한다.
  • 표준 지표인 $Acc_{ ext{VG}}$ 및 $Acc_{ ext{PG}}$ 를 사용하여 3DVG 및 3DPAG 작업 모두의 성능을 평가한다.

실험 결과

연구 질문

  • RQ1모든 문장 기반 참조 객체(단지 대상 객체만이 아니라)를 국소화하는 세밀한 3D 시각적 기반은 더 정확하고 해석 가능한 3D 시나리오 이해를 이끌 수 있는가?
  • RQ2프레이즈별 사전학습은 3D 기반에서 비대상 객체에 대한 모델 일반화 능력을 향상시키는 데 얼마나 효과적인가?
  • RQ3프레이즈-객체 정렬 맵 최적화가 복잡한 3D 시나리오에서 국소화 정확도 향상에 얼마나 기여하는가?
  • RQ4기존 3DVG 애너테이션에서 유래한 약한 지도 학습만으로도 기존 3DVG 모델이 3DPAG 작업에 효과적으로 적응할 수 있는가?
  • RQ5문장-객체 관계를 명시적으로 모델링하면 표준 3DVG 벤치마크에서 성능 향상이 측정 가능한가?

주요 결과

  • 제안된 3DPAG 작업은 3DVG 성능을 크게 향상시키며, 최신 기술인 MVT 모델이 Nr3D에서 59.0%의 정확도를 기록하여 기준 모델 대비 3.9% 향상되었다.
  • Sr3D에서는 동일한 모델이 68.0%의 정확도를 기록하여 이전 최고 기술 대비 3.5% 향상되었고, ScanRefer에서는 59.9%의 정확도를 기록하여 4.6% 향상되었다.
  • 절단 실험 결과, 프레이즈별 사전학습과 POA 최적화 모두 성능 향상에 기여하는 것으로 확인되었으며, SAT와 MVT에 대해 각각 Nr3D에서 기준 모델 대비 5.2%와 3.9% 향상된 성능을 기록했다.
  • 약한 지도 학습 설정에서 타겟 객체 애너테이션만 사용함에도 불구하고 의미 있는 성능(예: ScanRefer++에서 43.6%)을 기록하여 제안된 구성 요소의 강건성을 입증했다.
  • BUTD-DETR 모델은 제안된 구성 요소를 통합함으로써 ScanRefer++에서 $Acc_{PG}@0.5$ 가 22.6%에서 32.3%로 향상되었으며, 이는 명시적 프레이즈-객체 지도 학습의 필요성을 확인한다.
  • 시각화 결과는 3DPAG가 각 프레이즈에 대해 색상 기반으로 정렬된 세밀한 예측을 생성함으로써 모델 결정의 내재적 해석 가능성과 설명 가능성을 제공함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.