Skip to main content
QUICK REVIEW

[논문 리뷰] Part-level Car Parsing and Reconstruction from Single Street View

Qichuan Geng, Zhang, Hong|arXiv (Cornell University)|2018. 11. 27.
3D Shape Modeling and Analysis참고 문헌 45인용 수 5
한 줄 요약

이 논문은 단일 스트리트 뷰에서 부분 수준의 파싱을 이용한 3D 자동차 자세 및 형상 추정을 위한 새로운 이단계 프레임워크를 제안한다. 음성 도메인 적응을 통해 합성 이미지에서 실사 이미지로 부분 레이블을 전이하고, 부분 특징과 3D 손실을 갖춘 3D 인식 네트워크를 사용한다. 이는 최신 기술 수준을 초월하는 성능을 달성하여, A3DP-Abs 지표에서 3D-RCNN과 DeepMANTA보다 각각 12.57%, 8.91% 높은 성능을 기록한다.

ABSTRACT

Part information has been shown to be resistant to occlusions and viewpoint changes, which is beneficial for various vision-related tasks. However, we found very limited work in car pose estimation and reconstruction from street views leveraging the part information. There are two major contributions in this paper. Firstly, we make the first attempt to build a framework to simultaneously estimate shape, translation, orientation, and semantic parts of cars in 3D space from a single street view. As it is labor-intensive to annotate semantic parts on real street views, we propose a specific approach to implicitly transfer part features from synthesized images to real street views. For pose and shape estimation, we propose a novel network structure that utilizes both part features and 3D losses. Secondly, we are the first to construct a high-quality dataset that contains 348 different car models with physical dimensions and part-level annotations based on global and local deformations. Given these models, we further generate 60K synthesized images with randomization of orientation, illumination, occlusion, and texture. Our results demonstrate that our part segmentation performance is significantly improved after applying our implicit transfer approach. Our network for pose and shape estimation achieves the state-of-the-art performance on the ApolloCar3D dataset and outperforms 3D-RCNN and DeepMANTA by 12.57 and 8.91 percentage points in terms of mean A3DP-Abs.

연구 동기 및 목표

  • 부분 수준의 의미 정보를 활용하여 가림 및 시점 변화 상황에서도 견고한 3D 자동차 자세 및 형상 추정 문제를 해결하기 위해.
  • 수동 레이블링 없이 합성 이미지에서 실사 스트리트 뷰 이미지로 부분 수준의 레이블을 전이하는 방법을 개발하기 위해.
  • 물리적 치수와 변형 모델링을 갖춘 고품질의 부분 레이블이 부여된 3D 자동차 데이터셋을 구축하기 위해.
  • 부분 수준의 표현과 3D 감독 손실을 통합하여 3D 자동차 추정 성능을 향상시키기 위해.

제안 방법

  • 이중 단계 프레임워크를 제안: 첫 번째 단계는 합성에서 실사 이미지로의 음성 도메인 적응를 통한 부분 수준의 파싱; 두 번째 단계는 부분 특징과 3D 손실을 활용한 3D 자세 및 형상 추정.
  • 3D 감독을 통해 부분 수준의 의미 특징을 융합하는 새로운 네트워크 아키텍처를 도입하여 3D 형상 및 자세 추정 성능을 향상시킨다.
  • 348개의 실제 자동차 모델에서 유도된 랜덤 조명, 가림, 텍스처, 시점 조건을 갖춘 6만 장의 이미지를 합성하기 위한 데이터 생성 파이프라인을 제안한다.
  • 예측된 3D 형상을 보다 기하학적으로 일관되게 만들기 위해 3D 손실 함수를 도입한다.
  • 사이클-일관성 있는 생성적 적대적 네트워크를 통해 음성 특징 전이를 적용하여 합성 및 실사 이미지 간의 부분 특징을 정렬한다.
  • 전역 및 국소 변형 기반의 부분 수준 레이블이 부여된 348대의 자동차 모델, 물리적 치수를 포함한 새로운 데이터셋을 활용한다.

실험 결과

연구 질문

  • RQ1가림 및 시점 변화 상황에서 단일 스트리트 뷰에서 부분 수준의 의미 파싱이 3D 자동차 자세 및 형상 추정 성능을 향상시키는가?
  • RQ2합성에서 실사 스트리트 뷰 이미지로의 부분 레이블 전이에 있어 음성 도메인 적응 기법의 효과는 어떠한가?
  • RQ3부분 수준의 특징과 3D 감독 손실이 인스턴스 수준의 특징만을 사용하는 것에 비해 3D 자동차 복원 정확도를 얼마나 향상시키는가?
  • RQ4통합된 프레임워크가 단일 이미지에서 3D 형상, 자세, 부분 수준의 의미를 동시에 추정할 수 있는가?
  • RQ53D-RCNN 및 DeepMANTA와 같은 최신 기술 대비 제안된 방법의 3D 검출 및 자세 정확도 측면에서의 성능 비교는 어떠한가?

주요 결과

  • 제안된 방법은 ApolloCar3D 테스트 세트에서 평균 A3DP-Abs 점수 32.87%를 기록하여, 3D-RCNN(16.44%) 및 DeepMANTA(20.10%)보다 각각 12.57%, 8.91% 높은 성능을 달성한다.
  • 제거 실험을 통해 부분 수준의 표현과 3D 손실이 함께 작용할 경우 성능 향상이 확인되었으며, A3DP-Abs 점수는 기준 모델의 23.07%에서 양측 구성 요소를 모두 포함한 32.87%로 상승하였다.
  • 네트워크는 AOS 77.89%와 OS 97.88%를 달성하여, 동일한 검출 AP 조건에서 3D-RCNN 대비 각각 4.19%, 5.27% 향상된 성능을 보였다.
  • 음성 도메인 적응를 통해 부분 수준의 파싱 성능가 크게 향상되었으며, 실사 이미지에 합성 레이블을 효과적으로 활용할 수 있게 되었다.
  • 프레임워크는 70개의 의미적 부분을 갖춘 포인트 클라우드 또는 삼각형 메쉬 형태로 3D 자동차 형상을 성공적으로 복원하여 세밀한 분석을 가능하게 하였다.
  • 348대의 자동차 모델, 부분 수준의 레이블, 물리적 치수를 포함한 제안된 데이터셋은 향후 부분 기반 3D 자동차 이해 연구를 위한 기초 자원이 된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.