Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Point-Language Hierarchical Alignment for 3D Visual Grounding

Jiaming Chen, Weixin Luo|arXiv (Cornell University)|2022. 10. 22.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 3D 시각적 기반을 위한 계층적 정렬 모델(HAM)을 제안하며, 다중 해상도 포인트 추상화를 통해 어휘 수준 및 문장 수준의 언어 임베딩을 시각적 표현과 계층적으로 정렬하는 새로운 포인트-언어 정렬 메커니즘(PLACM)을 사용한다. HAM는 동적이고 맥락 인지 기반의 시각-언어 표현 학습을 통해 두 개의 공개 데이터셋에서 기존 방법들을 크게 능가하며 SOTA 성능을 달성하였고, ECCV 2022 ScanRefer 챌린지에서 우수한 성과를 거두었다.

ABSTRACT

This paper presents a novel hierarchical alignment model (HAM) that learns multi-granularity visual and linguistic representations in an end-to-end manner. We extract key points and proposal points to model 3D contexts and instances, and propose point-language alignment with context modulation (PLACM) mechanism, which learns to gradually align word-level and sentence-level linguistic embeddings with visual representations, while the modulation with the visual context captures latent informative relationships. To further capture both global and local relationships, we propose a spatially multi-granular modeling scheme that applies PLACM to both global and local fields. Experimental results demonstrate the superiority of HAM, with visualized results showing that it can dynamically model fine-grained visual and linguistic representations. HAM outperforms existing methods by a significant margin and achieves state-of-the-art performance on two publicly available datasets, and won the championship in ECCV 2022 ScanRefer challenge. Code is available at~\url{https://github.com/PPjmchen/HAM}.

연구 동기 및 목표

  • 3D 시각적 기반에서 군집화된 주의 메커니즘의 한계를 해결하여 복잡한 언어와 공간 관계를 더 잘 이해할 수 있도록 한다.
  • 다중 해상도 표현 학습을 통해 3D 포인트 클라우드에서 복잡한 공간 관계와 장문의 복잡한 언어 쿼리를 더 잘 모델링한다.
  • 맥락 조절과 공간적으로 다중 해상도 모델링을 통합하여 전역적이고 국소적인 장면 이해를 위한 시각-언어 정렬을 향상시킨다.
  • 3D 시각적 기반에 체계적인 프롬프트 엔지니어링 전략을 통합하여 학습 효율성과 모델의 강인성을 향상시킨다.
  • 정확한 객체 정위를 위해 동적으로 분류 가능한 시각적 및 언어적 표현을 학습하는 엔드 투 엔드 프레임워크를 개발한다.

제안 방법

  • 학습 가능한 포인트 추상화를 사용하여 원시 포인트 클라우드를 핵심 포인트와 제안 포인트로 다운샘플링함으로써 3D 맥락과 개체의 다중 해상도 모델링을 가능하게 한다.
  • 포인트-언어 정렬에 맥락 조절 기능을 통합한 PLACM 메커니즘을 도입하여, 제안 포인트를 쿼리로 사용해 언어 임베딩(어휘 및 문장 수준)과 시각적 표현 간의 계층적 교차 주의를 적용한다.
  • PLACM는 핵심 포인트 특징과 언어 임베딩을 융합하여 잠재적인 공간적 및 의미적 관계를 포착하기 위해 시각적 맥락 조절을 구현한다.
  • 공간적으로 다중 해상도 모델링(SMGM) 기법은 공간을 분할하고 핵심 포인트를 지역적으로 군집화하여 전역 및 국소 공간 분야에 모두 PLACM를 적용한다.
  • 세 가지 프롬프트 엔지니어링 전략(입력 쿼리 재구성 등)을 통합하여 훈련 데이터의 다양성을 높이고 일반화 및 효율성을 향상시킨다.
  • 모델는 교차 주의 메커니즘을 사용해 엔드 투 엔드로 훈련되며, 주의 가중치의 시각화를 통해 동적이고 맥락 인지 기반의 표현 학습을 입증한다.

실험 결과

연구 질문

  • RQ1언어와 포인트 클라우드 표현 간의 계층적이고 다중 해상도의 정렬이 3D 시각적 기반 성능을 향상시키는가?
  • RQ2시각-언어 주의에서 맥락 조절이 복잡한 공간 관계를 포착하는 데 모델의 능력을 어떻게 향상시키는가?
  • RQ3공간적으로 다중 해상도 모델링은 전역 및 국소 장면 맥락을 얼마나 잘 모델링하는가?
  • RQ4체계적인 프롬프트 엔지니어링 전략은 3D 시각적 기반 모델의 강인성과 효율성을 얼마나 향상시키는가?
  • RQ5제안된 HAM 프레임워크는 3D 시각적 기반의 벤치마크 데이터셋에서 SOTA 성능을 달성하는가?

주요 결과

  • HAM는 두 개의 공개 3D 시각적 기반 벤치마크에서 SOTA 성능을 달성하였으며, 기존 방법들을 크게 능가하였다.
  • 모델는 ECCV 2022 ScanRefer 챌린지에서 1등을 차지하여 검증 및 테스트 세트에서 뛰어난 일반화 능력과 강인성을 입증하였다.
  • 제거 실험 결과 PLACM 메커니즘과 SMGM 기법이 성능 향상에 필수적임을 확인하였으며, 각 구성 요소가 정위 정확도 향상에 기여하였다.
  • 시각화 결과는 HAM가 언어적 조절에 따라 제안 포인트에 동적으로 주의 가중치를 할당하며, 관련 영역에 높은 가중치를 할당하고 분류 가능한 표현 학습을 수행함을 보여주었다.
  • 프롬프트 엔지니어링 전략의 통합은 데이터셋 간 일관된 성능 향상을 통해 학습 효율성과 일반화 능력을 향상시켰다.
  • 모델는 '싱크 위에 있는' 또는 '손잡이에 Towel이 있는 오른쪽에 있는'과 같은 복잡한 언어와 공간 관계를 포함한 복잡한 장면에서도 목표를 효과적으로 정위할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.