[논문 리뷰] PointTrack++ for Effective Online Multi-Object Tracking and Segmentation
PointTrack++는 의미 분할 헤드, 복사-붙여넣기 데이터 증강, 다단계 훈련을 통해 개선된 온라인 다중 객체 추적 및 인스턴스 세분화(MOTS) 프레임워크를 제안한다. 이는 인스턴스 세분화 품질과 임bedding의 구분 가능성 향상에 기여하며, KITTI MOTS 랭킹과 5번째 BMTT MOTS 챌린지에서 최신 기술 수준 성능을 달성한다. 차량에 대해 각각 86.81%의 sMOTSA와 95.95%의 MOTSA를 기록하였고, 보행자에 대해서는 65.51%의 sMOTSA와 81.54%의 MOTSA를 기록하였다.
Multiple-object tracking and segmentation (MOTS) is a novel computer vision task that aims to jointly perform multiple object tracking (MOT) and instance segmentation. In this work, we present PointTrack++, an effective on-line framework for MOTS, which remarkably extends our recently proposed PointTrack framework. To begin with, PointTrack adopts an efficient one-stage framework for instance segmentation, and learns instance embeddings by converting compact image representations to un-ordered 2D point cloud. Compared with PointTrack, our proposed PointTrack++ offers three major improvements. Firstly, in the instance segmentation stage, we adopt a semantic segmentation decoder trained with focal loss to improve the instance selection quality. Secondly, to further boost the segmentation performance, we propose a data augmentation strategy by copy-and-paste instances into training images. Finally, we introduce a better training strategy in the instance association stage to improve the distinguishability of learned instance embeddings. The resulting framework achieves the state-of-the-art performance on the 5th BMTT MOTChallenge.
연구 동기 및 목표
- 경계 상자가 중복도가 높은 혼잡한 환경에서 구분 가능한 인스턴스 임베딩을 학습하는 데 도전하는 것.
- 시드 맵 예측을 의미 분할 헤드로 대체하여 MOTS에서 인스턴스 세분화 품질을 향상시키는 것.
- 혼잡한 환경을 위한 복사-붙여넣기 데이터 증강 전략을 사용하여 훈련의 일반화 능력과 세분화의 강인성을 향상시키는 것.
- 전경과 배경 임베딩 학습을 분리하는 다단계 훈련 전략을 통해 임베딩의 구분 가능성 향상시키는 것.
- 온라인 및 종단 간(end-to-end) 프레임워크에서 KITTI MOTS 및 BMTT MOTS 챌린지 벤치마크에서 최신 기술 수준의 성능 달성하는 것.
제안 방법
- 포인트트랙의 시드 맵 브랜치를 포인트워드 손실로 훈련된 의미 분할 디코더로 대체하여 인스턴스 선택 품질 향상시키는 것.
- 유사한 밝기의 인스턴스를 훈련 이미지에 붙여넣는 복사-붙여넣기 데이터 증강 전략을 도입하여 혼잡한 환경를 시뮬레이션하는 것.
- 임베딩 네트워크에 대해 다단계 훈련 전략을 구현하며, 첫 번째 단계는 전경 임베딩에 집중하고 두 번째 단계는 위치 및 환경 임베딩에 집중하는 것.
- 원시 이미지 픽셀을 순서 없는 2차원 점으로 처리하는 포인트 클라우드 기반의 임베딩 네트워크를 사용하며, MLP를 통해 위치, 색상, 카테고리 특징을 통합하여 맥락 인식 인스턴스 임베딩을 학습하는 것.
- 세분화 및 임베딩 단계를 분리하여 훈련 중에 이미지 수준 및 비디오 수준의 애너테이션을 자유롭게 활용할 수 있도록 하는 것.
- 입력 이미지를 원래 크기의 두 배로 업샘플링하여 특징 해상도와 세분화 정확도 향상시키는 것.
실험 결과
연구 질문
- RQ1시드 맵 예측을 의미 분할 헤드로 대체하면 MOTS에서 인스턴스 선택 및 세분화 품질 향상이 가능한가?
- RQ2복사-붙여넣기 데이터 증강 전략은 혼잡한 환경에서 인스턴스 세분화의 모델 일반화 능력 향상에 얼마나 효과적인가?
- RQ3인스턴스 임베딩에 대한 다단계 훈련 전략은 더 나은 구분 가능성과 추적 성능을 이끌어내는가?
- RQ4제안된 프포지얼(Proposal-free), 포인트 클라우드 기반의 임베딩 네트워크는 ROI 기반 방법에 비해 MOTS에서 뛰어난 추적 성능를 달성할 수 있는가?
- RQ5제안된 개선 사항은 KITTI MOTS 및 BMTT MOTS와 같은 도전적인 벤치마크에서 성능 향상에 얼마나 기여하는가?
주요 결과
- PointTrack++는 KITTI MOTS 테스트 세트에서 차량에 대해 86.81%의 sMOTSA와 95.95%의 MOTSA를 기록하였으며, PointTrack 대비 4.3% 향상되었다.
- 보행자에 대해서는 PointTrack++가 KITTI 테스트 세트에서 65.51%의 sMOTSA와 81.54%의 MOTSA를 기록하였으며, PointTrack 대비 6.6% 향상되었다.
- 절단 분석 결과, 의미 분할 헤드, 복사-붙여넣기 증강, 다단계 훈련의 조합이 가장 높은 성능 향상을 이끌어냈다.
- 의미 분할 헤드만으로도 보행자 sMOTSA가 2.15% 향상되어 가짜 양성 및 가짜 음성 감소 효과를 입증하였다.
- 복사-붙여넣기 증강 전략은 보행자에 대해 sMOTSA 0.52% 향상 기여하여 혼잡한 상황에서의 강인성 향상됨을 시사하였다.
- 다단계 훈련 전략은 단일 단계 훈련 대비 MOTSA를 0.86% 향상시켜 임베딩의 구분 가능성 향상됨을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.