Skip to main content
QUICK REVIEW

[논문 리뷰] Look Around and Refer: 2D Synthetic Semantics Knowledge Distillation for 3D Visual Grounding

Eslam Mohamed Bakr, Yasmeen Alsaedy|arXiv (Cornell University)|2022. 11. 25.
Multimodal Machine Learning Applications인용 수 13
한 줄 요약

이 논문은 Look Around and Refer (LAR)를 제안하며, 실제 2D 입력이 필요 없이 3D 포인트 클라우드에서 다중 시점 2D 이미지 생성기를 통해 2D 의미적 힌트를 합성함으로써 3D 표현 학습을 향상시키는 새로운 3D 시각적 지정 프레임워크이다. LAR는 Nr3D, Sr3D, ScanRefer에서 기존 방법보다 최대 5.0% 향상된 최신 기술 수준의 성능을 달성하였으며, 추가적인 2D 데이터 없이도 실제 2D 이미지를 사용하는 모델조차도 11.7% 초월하여 뛰어난 성능을 보였다.

ABSTRACT

The 3D visual grounding task has been explored with visual and language streams comprehending referential language to identify target objects in 3D scenes. However, most existing methods devote the visual stream to capturing the 3D visual clues using off-the-shelf point clouds encoders. The main question we address in this paper is "can we consolidate the 3D visual stream by 2D clues synthesized from point clouds and efficiently utilize them in training and testing?". The main idea is to assist the 3D encoder by incorporating rich 2D object representations without requiring extra 2D inputs. To this end, we leverage 2D clues, synthetically generated from 3D point clouds, and empirically show their aptitude to boost the quality of the learned visual representations. We validate our approach through comprehensive experiments on Nr3D, Sr3D, and ScanRefer datasets and show consistent performance gains compared to existing methods. Our proposed module, dubbed as Look Around and Refer (LAR), significantly outperforms the state-of-the-art 3D visual grounding techniques on three benchmarks, i.e., Nr3D, Sr3D, and ScanRefer. The code is available at https://eslambakr.github.io/LAR.github.io/.

연구 동기 및 목표

  • 학습 또는 추론 중 실제 2D 이미지에 의존하는 3D 시각적 지정 모델의 한계를 해결하기 위해, 이를 통해 실세계 적용을 제한하는 요소를 제거하고자 한다.
  • 3D 포인트 클라우드에서 유도된 합성 2D 표현이 3D 표현 학습을 효과적으로 향상시킬 수 있는지 탐구하고자 한다.
  • 추가적인 2D 입력 없이도 2D 의미 정보를 활용해 3D 시각적 스트림을 통합하는 방법을 개발하여 더 넓은 응용 시나리오를 가능하게 하고자 한다.
  • 실제 2D 입력 없이도 3D 포인트 클라우드와 합성 2D 신호만을 사용하여 3D 시각적 지정 벤치마크에서 최신 기술 수준의 성능을 달성하고자 한다.

제안 방법

  • 2D 합성 이미지 생성기(SIG) 모듈은 장면 내 각 객체 주변에 배치된 가상 카메라를 사용하여 3D 포인트 클라우드를 다중 시점 2D 이미지로 투영한다.
  • SIG 모듈은 2D 격자 투영 중 발생하는 포인트 갈등을 해결하기 위해 높이 기반 우선순위 메커니즘을 사용하여 시각적 정밀도를 향상시킨다.
  • 다중 모odal 트랜스포머 기반 아키텍처인 LAR는 3D 포인트 클라우드 특징과 합성 2D 이미지 특징을 융합하여 공동의 시각-언어 표현 학습을 수행한다.
  • 이 방법은 풍부한 2D 의미 지식을 3D 스트림으로 전달하기 위해 지식 distillation을 활용하여 3D 표현 품질을 향상시킨다.
  • 학습 중 카메라를 무작위로 제거하여 카메라 고장 상황을 시뮬레이션함으로써 카메라 변화에 대한 내성을 향상시킨다.
  • 모델은 객체 제안을 기반으로 학습 및 평가되며, 탐지 기반 제안과의 호환성도 확장하였다.

실험 결과

연구 질문

  • RQ13D 포인트 클라우드에서 유도된 합성 2D 이미지가 실제 2D 입력 없이도 3D 시각적 지정 성능 향상에 효과적으로 기여할 수 있는가?
  • RQ22D 합성 의미 정보의 통합은 카메라 장애나 시점 변화 상황에서 3D 표현의 내성에 어떤 영향을 미치는가?
  • RQ3실제 2D 이미지를 사용하는 모델과 비교했을 때, 합성 2D 지시만을 사용하는 3D 전용 모델이 얼마나 뛰어난 성능을 낼 수 있는가?
  • RQ4제안된 방법은 다양한 수준의 객체 모호성과 방해 요소 밀도를 가진 다른 3D 시각적 지정 벤치마크에 어떻게 일반화되는가?

주요 결과

  • LAR는 Sr3D 벤치마크에서 평균 IoU 59.35%를 기록하여 새로운 최신 기술 수준 성능을 달성하였다.
  • ScanRefer 벤치마크에서 LAR는 평균 IoU 54.6%를 달성하여, 기존 3D 포인트 클라우드만을 사용하는 방법보다 2.3% 향상된 성능을 보였다.
  • Nr3D에서 LAR는 가장 가까운 3D 전용 방법보다 정확도를 5.0% 향상시켰으며, SAT보다도 1.6% 높은 성능을 기록했다. 이는 실제 2D 이미지를 사용하지 않았음에도 불구하고 성과를 냈다.
  • LAR는 지표가 정확한 2D 이미지와 클래스 레이블을 사용하는 SAT-GT를 11.7% 초월하여 성능을 냈으며(62% 대비 50.3%), 합성 2D 지식의 효과성을 입증하였다.
  • 제로샷 카메라 장애 상황에서도 LAR는 강력한 성능을 유지하였으며, 한 대의 카메라가 고장나도 정확도가 40.15%로 떨어질 뿐이었고, 이는 카메라 변화에 대한 내성성을 보여주었다.
  • 정성적 분석을 통해 방법이 모호하거나 시점에 의존적인 기술적 설명에 잘 일반화됨을 확인하였지만, 일부 실패 케이스는 투영 갈등이나 물체 가림으로 인해 발생하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.