Skip to main content
QUICK REVIEW

[논문 리뷰] ApolloCar3D: A Large 3D Car Instance Understanding Benchmark for Autonomous Driving

Xibin Song, Peng Wang|arXiv (Cornell University)|2018. 11. 29.
3D Shape Modeling and Analysis참고 문헌 58인용 수 13
한 줄 요약

ApolloCar3D는 자율주행을 위한 가장 큰 공개 가능한 3D 자동차 인스턴스 이해 기준을 제공하며, 산업 수준의 3D CAD 모델과 66개의 의미적 키포인트를 갖춘 5,277장의 이미지와 60,000개 이상의 자동차 인스턴스를 포함한다. 이 데이터셋은 2D-3D 키포인트 대응과 상호 인스턴스 관계를 활용하는 맥락 인식 어노테이션 파이프라인 및 기준 모델을 통해 최신 기술 수준의 3D 자세 및 형상 추정을 가능하게 하며, 키포인트 사용 시 성능 향상이 두드러지게 나타나지만, 모델 성능과 인간 성능 사이에 약 10%의 격차가 존재한다.

ABSTRACT

Autonomous driving has attracted remarkable attention from both industry and academia. An important task is to estimate 3D properties(e.g.translation, rotation and shape) of a moving or parked vehicle on the road. This task, while critical, is still under-researched in the computer vision community - partially owing to the lack of large scale and fully-annotated 3D car database suitable for autonomous driving research. In this paper, we contribute the first large-scale database suitable for 3D car instance understanding - ApolloCar3D. The dataset contains 5,277 driving images and over 60K car instances, where each car is fitted with an industry-grade 3D CAD model with absolute model size and semantically labelled keypoints. This dataset is above 20 times larger than PASCAL3D+ and KITTI, the current state-of-the-art. To enable efficient labelling in 3D, we build a pipeline by considering 2D-3D keypoint correspondences for a single instance and 3D relationship among multiple instances. Equipped with such dataset, we build various baseline algorithms with the state-of-the-art deep convolutional neural networks. Specifically, we first segment each car with a pre-trained Mask R-CNN, and then regress towards its 3D pose and shape based on a deformable 3D car model with or without using semantic keypoints. We show that using keypoints significantly improves fitting performance. Finally, we develop a new 3D metric jointly considering 3D pose and 3D shape, allowing for comprehensive evaluation and ablation study. By comparing with human performance we suggest several future directions for further improvements.

연구 동기 및 목표

  • 자율주행 연구에 적합한 대규모, 완전히 어노테이션 처리된 3D 자동차 데이터셋의 부족을 해결하기 위해.
  • 차량의 자세, 형상 및 의미적 키포인트 위치를 포함한 정확한 3D 인스턴스 수준 이해를 가능하게 하기 위해.
  • 2D-3D 키포인트 대응과 다중 차량 간의 3D 관계를 활용하는 맥락 인식 어노테이션 파이프라인을 개발하여 대규모 데이터셋의 효율적이고 정확한 레이블링을 가능하게 하기 위해.
  • 자세와 형상의 복합적 정확도를 반영하는 포괄적인 메트릭을 포함한 3D 자동차 인스턴스 이해 평가 기준을 수립하기 위해.
  • 현재 딥 러닝 모델과 인간 어노테이터 간의 성능 격차를 규명하여 향후 연구 방향을 안내하기 위해.

제안 방법

  • 데이터셋은 아폴로스케이프 데이터셋에서 유래되었으며, 스테레오 영상, 카메라 자세, 의미적 인스턴스 마스크, 픽셀 단위의 깊이 정보 및 이동 영상이 포함되어 있다.
  • 각 자동차 인스턴스는 절대 크기와 함께 의미적으로 레이블링된 66개의 키포인트를 포함한 고정밀 산업 수준의 3D CAD 모델로 피팅된다.
  • 맥락 인식 3D 어노테이션 파이프라인은 2D-3D 키포인트 대응과 다수의 차량 간 3D 관계를 활용하여 레이블링의 효율성과 정확도를 향상시킨다.
  • 기준 모델은 마스크 R-CNN을 사용해 인스턴스 세그멘테이션을 수행한 후, 변형 가능한 3D 자동차 모델을 활용해 3D 자세 및 형상로 회귀한다.
  • 성능 평가에 새로운 3D 메트릭이 도입되었으며, 이는 3D 자세와 형상 정확도를 동시에 고려한다.
  • 인간 성능은 100장의 이미지로 구성된 검증 세트를 통해 평가되었으며, 인간 레이블 결과가 알고리즘 비교의 기준으로 사용되었다.

실험 결과

연구 질문

  • RQ166개의 의미적 키포인트가 포함된 경우, 직접적인 3D 회귀 대비 3D 자동차 인스턴스 피팅 성능에 어떤 영향을 미치는가?
  • RQ2최신 딥 러닝 모델과 인간 어노테이터 간의 3D 자동차 인스턴스 이해 성능 격차는 얼마인가?
  • RQ3거리와 가림 상태가 실생활 주행 환경에서의 3D 자세 및 형상 추정 정확도에 어떤 영향을 미치는가?
  • RQ4맥락 인식 3D 어노테이션 파이프라인이 대규모 3D 데이터셋의 레이블링 효율성과 일관성에 크게 기여하는가?
  • RQ5현재 3D 추정 모델의 주요 실패 원인은 무엇인지, 특히 가림 상태나 비정상적인 차량 외관의 경우에 어떻게 나타나는가?

주요 결과

  • ApolloCar3D 데이터셋은 5,277장의 이미지와 60,000개 이상의 자동차 인스턴스를 포함하여, PASCAL3D+와 KITTI보다 20배 이상 크다.
  • 3D 피팅 파이프라인에 66개의 의미적 키포인트를 사용할 경우, 직접적인 3D 회귀 대비 성능 향상이 뚜렷하게 나타나며, 이는 더 강력한 기하학적 제약 조건 덕분이다.
  • 검증 세트에서 인간 성능은 최고 성능 알고리즘 대비 약 10%의 정확도 격차를 보이며, 향후 개선 여지가 있음을 시사한다.
  • CPM 기반 검출기의 2D 키포인트 검출률은 75.41%이며 평균 픽셀 오차는 4.39 px이다. 반면 인간 레이블 키포인트는 92.40%의 검출률과 2.67 px의 평균 오차를 기록한다.
  • 거리가 길어지고 가림 상태가 증가할수록 성능이 저하되지만, 자주 멀리 떨어져 있고 작은 비율의 차량(비가림 상태)에서 평균 정확도가 가장 낮게 나타나며, 이는 스케일과 해상도 제약 때문인 것으로 분석된다.
  • 연구 결과 인간의 잘못된 레이블링은 66개 키포인트의 의미적 의미를 기억하기 어려움으로 인해 주로 발생하며, 이는 보완 및 재검토 과정을 통해 인간 기준의 정확도를 향상시킬 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.