[논문 리뷰] 3D-SPS: Single-Stage 3D Visual Grounding via Referred Point Progressive Selection
3D-SPS는 언어 유도 키포인트를 점진적으로 선택하여 3D 포인트 클라우드에서 직접 참조 객체를 국소화하는 단일 단계 3D 시각적 기반 방법을 제안한다. Description-aware Keypoint Sampling (DKS)와 Target-oriented Progressive Mining (TPM)를 결합함으로써, 검출과 매칭을 분리하는 기존 이단계 방법들보다 우수한 성능을 달성하며, 끝에서 끝까지 점진적인 정밀 조정을 통해 관련 포인트를 개선한다. ScanRefer 및 Nr3D/Sr3D에서 최신 기준 성능(SOTA)을 달성한다.
3D visual grounding aims to locate the referred target object in 3D point cloud scenes according to a free-form language description. Previous methods mostly follow a two-stage paradigm, i.e., language-irrelevant detection and cross-modal matching, which is limited by the isolated architecture. In such a paradigm, the detector needs to sample keypoints from raw point clouds due to the inherent properties of 3D point clouds (irregular and large-scale), to generate the corresponding object proposal for each keypoint. However, sparse proposals may leave out the target in detection, while dense proposals may confuse the matching model. Moreover, the language-irrelevant detection stage can only sample a small proportion of keypoints on the target, deteriorating the target prediction. In this paper, we propose a 3D Single-Stage Referred Point Progressive Selection (3D-SPS) method, which progressively selects keypoints with the guidance of language and directly locates the target. Specifically, we propose a Description-aware Keypoint Sampling (DKS) module to coarsely focus on the points of language-relevant objects, which are significant clues for grounding. Besides, we devise a Target-oriented Progressive Mining (TPM) module to finely concentrate on the points of the target, which is enabled by progressive intra-modal relation modeling and inter-modal target mining. 3D-SPS bridges the gap between detection and matching in the 3D visual grounding task, localizing the target at a single stage. Experiments demonstrate that 3D-SPS achieves state-of-the-art performance on both ScanRefer and Nr3D/Sr3D datasets.
연구 동기 및 목표
- 검출과 매칭을 분리하는 이단계 3D 시각적 기반 파ipeline의 한계를 해결하여 희박하거나 조밀한 후보 제안 문제를 해결한다.
- 3D 검출기에서 언어에 무관한 키포인트 샘플링 문제를 해결하여 후보 제안에서 목표 객체가 부족하게 표현되는 문제를 개선한다.
- 언어 기술과 다중 모odal 주의를 기반으로 한 점진적 키포인트 선택 정밀 조정을 통해 국소화 정확도를 향상시킨다.
- 검출과 매칭을 하나의 통합된 단계로 통합하여 인간의 군중에서 정밀한 추론 방식을 모방한다.
제안 방법
- 객체 신뢰도와 기술 관련성 점수를 사용하여 언어와 관련된 객체의 포인트에 초점을 맞추기 위해 Description-aware Keypoint Sampling (DKS)을 도입한다.
- 자기 주의 및 교차 주의를 통해 내모odal 및 다중 모달 관계를 모델링함으로써 반복적으로 키포인트 선택을 정밀 조정하는 Target-oriented Progressive Mining (TPM)을 활용한다.
- 언어-포인트 교차 주의 맵을 사용하여 언어 기술이 집중하는 포인트를 동적으로 선택함으로써 점차적으로 목표에 집중한다.
- 키포인트 특징과 글로벌 포인트 특징을 융합하여 시나리오 수준의 맥락을 유지하고 국소화 인식을 향상시킨다.
- 다중 레이어 점진적 정밀 조정을 적용하여 각 레이어에서 관련 없는 키포인트를 제거하고 목표 관련 특징을 강화한다.
- 결합된, 목표에 집중된 키포인트 집합에서 직접 끝에서 끝까지 경계 상자 회귀를 수행함으로써 별도의 매칭 단계가 필요 없도록 한다.
실험 결과
연구 질문
- RQ1검출과 매칭 간의 고립을 제거함으로써 기존 이단계 방법보다 우수한 성능을 내는 단일 단계 3D 시각적 기반 프레임워크가 가능한가?
- RQ2희박한 3D 포인트 클라우드에서 목표 표현을 향상시키기 위해 키포인트 샘플링을 어떻게 언어 인식형으로 만들 수 있는가?
- RQ3정적 키포인트 선택에 비해 점진적 키포인트 정밀 조정이 국소화 정확도 향상에 얼마나 기여하는가?
- RQ4교차 주의 기반 점진적 마이닝이 유사한 객체들 사이에서 정확한 목표를 식별하는 데 모델의 능력을 향상시키는가?
- RQ5정련된 키포인트와 글로벌 포인트 특징을 융합함으로써 국소화 성능에 어떤 영향을 미치는가?
주요 결과
- 3D-SPS는 ScanRefer 데이터셋에서 최신 기준 성능(SOTA)을 달성하며, 기존 이단계 방법들보다 뚜렷하게 뛰어난 성능을 보였다.
- Nr3D/Sr3D 벤치마크에서 3D-SPS는 새로운 최신 기준 성능(SOTA)을 달성하여 다양한 3D 기반 시나리오에서 강력한 일반화 능력을 입증했다.
- 제거 분석 결과 DKS와 TPM 모두 필수적임을 확인하였으며, 객체 신뢰도와 기술 관련성 점수를 함께 사용할 경우 최고의 키포인트 선택 성능을 달성했다.
- TPM에서의 점진적 키포인트 선택은 일관된 성능 향상을 이끌었으며, 4개의 레이어에서 정확도와 강건성 간 최적의 균형을 달성했다.
- 선택 제거 분석 결과 성능은 키포인트 수가 증가함에 따라 정점에 도달한 후 감소하는 경향을 보였으며, 이는 점진적 필터링의 필요성을 입증했다.
- 정성적 결과는 3D-SPS가 '책상 위에 있는' 또는 '침대 아래에 있는'과 같은 다양한 기술에 따라 키포인트 선택을 다이나믹하게 적응시킴으로써 언어 적응형 추론을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.