Skip to main content
QUICK REVIEW

[논문 리뷰] InstanceMotSeg: Real-time Instance Motion Segmentation for Autonomous Driving

Eslam Mohamed, Mahmoud Ewaisha|arXiv (Cornell University)|2020. 08. 16.
Advanced Neural Network Applications참고 문헌 23인용 수 12
한 줄 요약

이 논문은 공유 프로토타입과 작업별 계수를 사용하여 운동과 의미적 인스턴스 마스크를 동시에 예측하는 실시간 인스턴스 운동 세분화 프레임워크인 InstanceMotSeg를 소개한다. YOLACT을 확장하여, 새로운 KITTI 기반 데이터셋을 사용해 운동 인식 인스턴스 세분화를 위해 개선된 10%의 mAP를 기록하며, Titan Xp에서 39 fps를 달성한다.

ABSTRACT

Moving object segmentation is a crucial task for autonomous vehicles as it can be used to segment objects in a class agnostic manner based on its motion cues. It will enable the detection of objects unseen during training (e.g., moose or a construction truck) generically based on their motion. Although pixel-wise motion segmentation has been studied in the literature, it is not dealt with at instance level, which would help separate connected segments of moving objects leading to better trajectory planning. In this paper, we proposed a motion-based instance segmentation task and created a new annotated dataset based on KITTI, which will be released publicly. We make use of the YOLACT model to solve the instance motion segmentation network by feeding inflow and image as input and instance motion masks as output. We extend it to a multi-task model that learns semantic and motion instance segmentation in a computationally efficient manner. Our model is based on sharing a prototype generation network between the two tasks and learning separate prototype coefficients per task. To obtain real-time performance, we study different efficient encoders and obtain 39 fps on a Titan Xp GPU using MobileNetV2 with an improvement of 10% mAP relative to the baseline. A video demonstration of our work is available in this https URL.

연구 동기 및 목표

  • 자율주행 환경에서 연결된 이동 물체가 분리되지 않는 인스턴스 수준의 운동 세분화 부족 문제를 해결하기 위해.
  • 모스, 공사 차량 등 기존에 본 적 없는 이동 물체를 운동 신호에만 기반해 탐지할 수 있도록 하기 위해.
  • 자율 시스템에 배포하기 위해 실시간 추론을 달성하는 계산 효율적인 모델 개발을 위해.
  • 기준 KITTI 데이터셋을 기반으로 한 새로운 인스턴스 수준의 운동 마스크가 추가된 데이터셋을 제작하고 공개하기 위해.

제안 방법

  • 공유 프로토타입 네트워크를 사용하여 YOLACT 아키텍처를 확장하여 인스턴스 운동 마스크와 의미적 마스크를 동시에 예측한다.
  • 작업별 특화 프로토타입 계수를 사용하여 운동과 의미적 세분화 헤드를 분리하면서도 특징 추출을 공유한다.
  • 입력 이미지와 옵티컬 플로우(inflow)를 네트워크에 입력하여 인스턴스 수준의 세분화를 위해 운동 신호를 활용한다.
  • Titan Xp에서 39 fps의 실시간 추론을 달성하기 위해 효율적인 인코더로 MobileNetV2를 사용한다.
  • 운동 및 의미적 마스크 예측을 결합한 다중 작업 손실을 사용해 모델을 엔드 투 엔드로 훈련한다.
  • 새로운 인스턴스 수준의 운동 마스크가 추가된 KITTI 기반 데이터셋을 제작하여 새로운 작업을 지원한다.

실험 결과

연구 질문

  • RQ1자율주행 시나리오에서 연결된 이동 물체를 분리하기 위해 운동 기반 인스턴스 세분화를 효과적으로 정식화하고 훈련시킬 수 있는가?
  • RQ2운동과 의미적 인스턴스 세분화를 최소한의 계산 오버헤드로 함께 학습할 수 있는가?
  • RQ3어떤 효율적인 백본 아키텍처가 정확도를 저하시키지 않고 실시간 성능를 달성할 수 있는가?
  • RQ4공유 프로토타입을 활용한 제안된 다중 작업 학습이 기준 모델 대비 일반화 능력과 mAP 향상에 어떻게 기여하는가?

주요 결과

  • 제안된 InstanceMotSeg 모델은 MobileNetV2를 사용하여 Titan Xp GPU에서 39 fps의 추론 속도를 기록하여 실시간 성능를 달성한다.
  • 제안된 새로운 인스턴스 운동 세분화 벤치마크에서 기준 YOLACT 모델 대비 mAP가 10% 향상된다.
  • 작업별 특화 계수를 사용한 공유 프로토타입은 정확도 저하 없이 효율적인 다중 작업 학습을 가능하게 한다.
  • 인스턴스 수준의 운동 마스크가 추가된 새로운 KITTI 기반 데이터셋이 향후 운동 인식 인스턴스 세분화 연구를 지원하기 위해 공개된다.
  • 모델은 클래스에 관계없이 이동 물체를 성공적으로 세분화하여, 운동 신호만으로도 이전에 본 적 없는 물체 클래스를 탐지할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.