Skip to main content
QUICK REVIEW

[논문 리뷰] PointIT: A Fast Tracking Framework Based on 3D Instance Segmentation

Yuan Wang, Yang Yu|arXiv (Cornell University)|2019. 02. 18.
Remote Sensing and LiDAR Applications참고 문헌 21인용 수 7
한 줄 요약

PointIT는 구형 LiDAR 투영도를 이용한 3D 인스턴스 세그멘테이션을 통해 빠르고 경량화된 3D 객체 추적 프레임워크를 제안한다. Mask R-CNN 기반의 인스턴스 세그멘테이션 헤드에서 ResNet 대신 MobileNet을 사용하고, SORT를 3D 중심 기반 비용 행렬 계산으로 확장함으로써 KITTI에서 15 fps 추적 성능과 0.617 AP를 달성하며, 가림과 객체 간 상호작용에 대한 강인성을 향상시킨다.

ABSTRACT

Recently most popular tracking frameworks focus on 2D image sequences. They seldom track the 3D object in point clouds. In this paper, we propose PointIT, a fast, simple tracking method based on 3D on-road instance segmentation. Firstly, we transform 3D LiDAR data into the spherical image with the size of 64 x 512 x 4 and feed it into instance segment model to get the predicted instance mask for each class. Then we use MobileNet as our primary encoder instead of the original ResNet to reduce the computational complexity. Finally, we extend the Sort algorithm with this instance framework to realize tracking in the 3D LiDAR point cloud data. The model is trained on the spherical images dataset with the corresponding instance label masks which are provided by KITTI 3D Object Track dataset. According to the experiment results, our network can achieve on Average Precision (AP) of 0.617 and the performance of multi-tracking task has also been improved.

연구 동기 및 목표

  • 2D 추적 프레임워크의 3D 인식 한계를 해결하기 위해 3D 공간 정보를 통합하여 더 강인한 객체 추적을 달성한다.
  • 실시간 배포를 위한 자율주행 차량에 적합한 고정확도를 유지하면서 3D 인스턴스 세그멘테이션의 계산 비용을 감소시킨다.
  • 정확한 3D 인스턴스 마스크를 활용하여 가림과 객체 간 상호작용과 같은 도전적인 상황에서의 추적 성능을 향상시킨다.
  • 구형 투영, 경량 세그멘테이션, 확장된 SORT를 결합한 확장 가능한 종단 간 파이프라인을 개발한다.
  • 3D 인스턴스 수준 정보가 2D 바운딩 박스 기반 방법에 비해 추적 정확도를 크게 향상시킨다는 것을 입증한다.

제안 방법

  • 3D LiDAR 포인트 클라우드를 64×512×4 크기의 구형 이미지로 투영하여 3D 데이터를 효율적인 딥러닝 처리에 적합한 2D 형식으로 변환한다.
  • 계산 복잡도와 추론 시간을 줄이기 위해 인스턴스 세그멘테이션 헤드에서 ResNet 대신 경량 MobileNet 기반 인코더를 사용한다.
  • KITTI 3D 객체 추적 데이터셋에서 유도된 인스턴스 수준 레이블이 있는 새로운 구형 이미지 데이터셋을 기반으로 Mask R-CNN 스타일의 인스턴스 세그멘테이션 모델을 훈련시킨다.
  • 데이터 연동에 IoU에만 의존하지 않고 3D 중심 좌표와 정규화된 거리 측정 기준을 도입하여 SORT 추적 알고리즘을 확장한다.
  • 추적 정확도 향상을 위해 3D 공간 특징(중심점 거리)과 인스턴스 마스크 임베딩을 사용하여 비용 행렬을 구성한다.
  • 전체 파이프라인을 종단 간 처리하여 KITTI 데이터셋에서 15 fps로 실시간 3D 다중 객체 추적을 가능하게 한다.

실험 결과

연구 질문

  • RQ12D 바운딩 박스 기반 추적에 비해 구형 LiDAR 투영도에서의 3D 인스턴스 세그멘테이션은 추적 강인성을 향상시키는가?
  • RQ2ResNet을 MobileNet으로 교체하면 3D 포인트 클라우드 추적에서 인스턴스 세그멘테이션 정확도와 추론 속도에 어떤 영향을 미치는가?
  • RQ3SORT 알고리즘에 3D 공간 중심 정보를 통합할 경우 ID 스위치와 추적 오류는 얼마나 감소하는가?
  • RQ4경량 3D 인스턴스 세그멘테이션 프레임워크는 실시간 성능을 유지하면서도 높은 정확도를 달성할 수 있는가?
  • RQ5원시 3D 처리에 비해 구형 투영 방법은 가림과 포인트 클라우드 노이즈를 어떻게 다루는가?

주요 결과

  • PointIT는 KITTI 3D 인스턴스 세그멘테이션 벤치마크에서 평균 정밀도(AP) 0.617을 달성하여 강력한 세그멘테이션 성능를 입증한다.
  • 모델는 15 fps로 실행되어 자율주행 시스템에서 실시간 추적 가능성을 보여준다.
  • ResNet 대신 MobileNet을 사용함으로써 추론 시간을 0.091초에서 0.061초로 단축하면서도 높은 AP를 유지하여 효율성-정확도 균형이 효과적으로 달성됨을 보여준다.
  • 확장된 SORT 알고리즘은 ID 스위치(ID_sw)와 오답 음성(FN)을 감소시켜, 특히 가림이 빈번한 상황에서 추적 안정성이 향상됨을 나타낸다.
  • 연결 행렬에 3D 중심 기반 거리 정보를 통합함으로써 표준 IoU 기반 SORT에 비해 추적 성능이 크게 향상되었으며, 특히 객체 간 상호작용과 가림 상황에서 두드러진다.
  • 표준 2D 이미지와 구형 투영도 사이의 도메인 차이에도 불구하고 MobileNet은 0.617 AP를 달성하여, 모델이 투영된 구형 데이터에 잘 일반화됨을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.