Skip to main content
QUICK REVIEW

[논문 리뷰] Towards 3D Scene Understanding by Referring Synthetic Models

Runnan Chen, Xinge Zhu|arXiv (Cornell University)|2022. 03. 20.
3D Shape Modeling and Analysis인용 수 4
한 줄 요약

이 논문은 실세계 스캔에 대한 실제 장면의 애너테이션 없이도 합성 3D 모델에서 실세계 스캔으로 지식을 전이함으로써 3D 장면 이해를 가능하게 하는 참조 전이 학습(Referring Transfer Learning, RTL)을 제안한다. 모델-장면 및 합성-실세계 도메인 갭을 메우기 위해 물리적 데이터 정렬과 볼록다각형 정규화 특징 정렬 기법을 도입하여, ModelNet의 합성 모델만을 사용해 ScanNet에서 46.08%, S3DIS에서 55.49%의 mAP를 달성한다.

ABSTRACT

Promising performance has been achieved for visual perception on the point cloud. However, the current methods typically rely on labour-extensive annotations on the scene scans. In this paper, we explore how synthetic models alleviate the real scene annotation burden, i.e., taking the labelled 3D synthetic models as reference for supervision, the neural network aims to recognize specific categories of objects on a real scene scan (without scene annotation for supervision). The problem studies how to transfer knowledge from synthetic 3D models to real 3D scenes and is named Referring Transfer Learning (RTL). The main challenge is solving the model-to-scene (from a single model to the scene) and synthetic-to-real (from synthetic model to real scene's object) gap between the synthetic model and the real scene. To this end, we propose a simple yet effective framework to perform two alignment operations. First, physical data alignment aims to make the synthetic models cover the diversity of the scene's objects with data processing techniques. Then a novel extbf{convex-hull regularized feature alignment} introduces learnable prototypes to project the point features of both synthetic models and real scenes to a unified feature space, which alleviates the domain gap. These operations ease the model-to-scene and synthetic-to-real difficulty for a network to recognize the target objects on a real unseen scene. Experiments show that our method achieves the average mAP of 46.08\% and 55.49\% on the ScanNet and S3DIS datasets by learning the synthetic models from the ModelNet dataset. Code will be publicly available.

연구 동기 및 목표

  • 실세계 장면 애너테이션 대신 합성 3D 모델을 활용하여 3D 장면 이해의 애너테이션 부담을 줄이기 위해.
  • 단일 모델에서 학습한 네트워크가 복잡하고 혼잡한 장면으로 일반화되는 모델-장면 일반화 갭을 해결하기 위해.
  • 합성 모델와 실세계 스캔 간 기하학적 및 분포적 차이로 인한 합성-실세계 도메인 갭을 완화하기 위해.
  • 합성 모델에서의 지식 전이를 통해 실세계 장면에서 볼 수 없는 객체 카테고리에 대해 제로샷 인식을 가능하게 하기 위해.
  • 하류 3D 인식 작업을 위한 효율적 지식 전이를 지원하는 단순하면서도 효과적인 프레임워크 개발하기 위해.

제안 방법

  • 물리적 데이터 정렬은 회전, 스케일링, 자르기, 그리고 장면 점들과의 믹스업을 포함한 데이터 증강 기법을 적용하여 합성 모델이 실세계 객체 변형을 더 잘 대표하도록 한다.
  • 새로운 볼록다각형 정규화 특징 정렬 모듈은 학습 가능한 프로토타입을 사용해 점 특징을 통합된 특징 공간으로 투영함으로써 도메인 이격을 줄인다.
  • 학습 가능한 프로토타입은 기초 구조 요소로 작용하여 컴act하고 닫힌 특징 공간을 정의하며, 도메인 간 특징 분포가 제약을 받고 비교 가능하도록 보장한다.
  • 대조 학습은 합성 모델을 양성 쌍으로, 다른 합성 모델을 음성 샘플로 사용하여 특징 일반화를 향상시킨다.
  • 이 프레임워크는 온보드 Minkowski U-Net 백본과 온도 조절 주의 메커니즘을 사용하여 특징 정렬을 정밀하게 조정하고 강건성을 향상시킨다.
  • 이 방법은 사전 학습 태스크로 설계되어 하류 3D 세그멘테이션 작업에서 성능 향상을 이끌어낸다.

실험 결과

연구 질문

  • RQ1실제로 볼 수 없는 3D 장면에서 실세계 장면 애너테이션이 전혀 없이 레이블이 붙은 합성 3D 모델만을 사용해 특정 객체 카테고리를 인식할 수 있는가?
  • RQ2고립된 객체에서 학습한 모델이 복잡하고 혼잡한 장면으로 일반화되는 모델-장면 갭은 어떻게 효과적으로 완화할 수 있는가?
  • RQ3합성 및 실세계 도메인 간 특징 정렬이 3D 세분화에서 합성-실세계 도메인 이격을 어느 정도 줄일 수 있는가?
  • RQ4어떤 데이터 증강 전략이 합성 모델에서 실세계 객체 변형을 가장 잘 시뮬레이션하여 일반화를 향상시킬 수 있는가?
  • RQ5제안된 방법은 합성 훈련 세트에 포함되지 않은 새로운 객체 카테고리로도 일반화 가능한가?

주요 결과

  • 제안된 RTL 프레임워크는 ModelNet의 합성 모델만을 사용하여 실세계 장면 애너테이션이 전혀 없이 ScanNet에서 46.08%의 mAP, S3DIS에서 55.49%의 mAP를 달성한다.
  • 물리적 데이터 정렬은 기준선 대비 mAP를 31.26% 향상시키며, 무작위 스케일링과 회전이 성능에 핵심적인 역할을 한다.
  • 데이터 증강을 생략한 경우(noDA) mAP는 23.44%로 감소하여 현실적인 데이터 증강이 도메인 일반화에 매우 중요함을 시사한다.
  • 장면 점들을 대조 학습의 음성 샘플로 사용할 경우 성능은 23.04% mAP로 떨어지며, 이러한 아티팩트가 일반화를 방해함을 보여준다.
  • 볼록다각형 정규화 특징 정렬 모듈을 물리적 데이터 정렬 기준선에 추가하면 mAP가 약 4% 향상된다.
  • 최적의 프로토타입 수는 128이며, 온도 하이퍼파라미터 λ를 0.5로 설정할 경우 최고의 성능를 기록한다. 아블레이션 분석 결과 이 하이퍼파라미터에 민감함을 확인할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.