Skip to main content
QUICK REVIEW

[논문 리뷰] Image2Point: 3D Point-Cloud Understanding with Pretrained 2D ConvNets.

Chenfeng Xu, Shijia Yang|arXiv (Cornell University)|2021. 06. 08.
Advanced Neural Network Applications참고 문헌 75인용 수 13
한 줄 요약

이 논문은 2D 컨볼루션 네트워크의 사전 훈련된 가중치를 3D 포인트 클라우드 이해 작업으로 전이하기 위해 2D 필터를 3D로 팽창시키고 입력, 출력 및 정규화 계층을 미세조정하는 방법인 Image2Point를 제안한다. 이 방법은 아키텍처 수정 없이도 3D 분류 및 분할 작업에서 경쟁력 있는 성능을 달성하며, 많은 작업 전용 포인트 클라우드 모델을 능가한다.

ABSTRACT

3D point-clouds and 2D images are different visual representations of the physical world. While human vision can understand both representations, computer vision models designed for 2D image and 3D point-cloud understanding are quite different. Our paper investigates the potential for transferability between these two representations by empirically investigating whether this approach works, what factors affect the transfer performance, and how to make it work even better. We discovered that we can indeed use the same neural net model architectures to understand both images and point-clouds. Moreover, we can transfer pretrained weights from image models to point-cloud models with minimal effort. Specifically, based on a 2D ConvNet pretrained on an image dataset, we can transfer the image model to a point-cloud model by extit{inflating} 2D convolutional filters to 3D then finetuning its input, output, and optionally normalization layers. The transferred model can achieve competitive performance on 3D point-cloud classification, indoor and driving scene segmentation, even beating a wide range of point-cloud models that adopt task-specific architectures and use a variety of tricks.

연구 동기 및 목표

  • 사전 훈련된 2D 컨볼루션 네트워크가 3D 포인트 클라우드 이해 작업으로 효과적으로 전이될 수 있는지 조사하기 위해.
  • 2D 이미지와 3D 포인인트 클라우드 간의 전이 성능에 영향을 미치는 핵심 요인을 규명하기 위해.
  • 2D 모델을 3D 포인트 클라우드 작업에 적응시키기 위한 최소한의 노력이 되는 방법을 개발하기 위해.
  • 이러한 전이가 전용 3D 포인트 클라우드 모델의 성능을 따라하거나 능가할 수 있는지 평가하기 위해.

제안 방법

  • 사전 훈련된 2D 컨볼루션 네트워크의 2D 컨볼루션 필터를 깊이 방향으로 가중치를 복제하여 3D 필터로 팽창시키기.
  • 포인트 클라우드 데이터 분포에 맞추어 3D 모델의 입력 및 출력 계층을 미세조정하기.
  • 옵션으로 배치 정규화 계층을 미세조정하여 새로운 입력 모odal리티에 적응시키기.
  • 2D 이미지와 3D 포인트 클라우드 모두에 동일한 모델 아키텍처를 사용하여 직접 전이를 가능하게 하기.
  • 필터 팽창을 통해 초기화한 후, 3D 모델을 포인트 클라우드 데이터셋에서 엔드 투 엔드로 훈련하기.
  • 일반적인 데이터 증강 및 최적화 기법을 적용하여 3D 작업에서의 일반화 성능 향상시키기.

실험 결과

연구 질문

  • RQ1사전 훈련된 2D 컨볼루션 네트워크가 3D 포인트 클라우드 이해 작업으로 효과적으로 전이될 수 있는가?
  • RQ2이러한 다중 모odal 전이의 성능에 가장 크게 영향을 미치는 요인은 무엇인가?
  • RQ3최소한의 아키텍처 변경으로도 성능을 경쟁력 있게 끌어올릴 수 있도록 전이 과정을 최적화할 수 있는가?
  • RQ4이러한 전이된 모델이 표준 벤치마크에서 기존의 3D 전용 모델을 능가하는가?

주요 결과

  • Image2Point 방법은 사전 훈련된 2D 모델의 최소한의 적응만으로도 3D 포인트 클라우드 분류 작업에서 경쟁력 있는 성능을 달성한다.
  • 필터 팽창과 입력 및 출력 계층의 미세조정을 조합함으로써 2D에서 3D 표현으로의 효과적인 전이가 가능하다.
  • 이러한 전이된 모델는 복잡한 아키텍처와 작업 전용 설계 기법을 사용한 다수의 3D 전용 모델을 뛰어넘는 성능을 보인다.
  • 이 방법은 실내 및 주행 환경 분할을 포함한 다양한 3D 이해 작업으로 잘 일반화된다.
  • 정규화 계층의 미세조정이 성능 향상에 기여함으로써, 이들이 다중 모달 전이에서 중요한 역할을 한다는 점을 시사한다.
  • 2D와 3D 간에 공통된 모델 아키텍처를 사용할 수 있음을 보여주며, 이는 전용 3D 설계가 반드시 필요하다는 전제를 도전한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.