Skip to main content
QUICK REVIEW

[논문 리뷰] Scene Understanding for Autonomous Driving

Òscar Lorente, Ian Riera|arXiv (Cornell University)|2021. 05. 11.
Advanced Neural Network Applications참고 문헌 17인용 수 7
한 줄 요약

이 논문은 자율주행 환경 이해를 위한 KITTI-MOTS 및 MOTSChallenge 데이터셋에서 Detectron2를 사용해 RetinaNet, Faster R-CNN, Mask R-CNN의 성능을 평가한다. 도메인 특화 데이터에 대한 토닝 및 하이퍼파ram터 최적화는 인스턴스 세그멘테이션 정확도를 크게 향상시키며, 토닝 후 Mask R-CNN는 평균 마스크 mAP 60.54%를 달성한다. 이는 모델 성능이 데이터셋 구성과 설정에 매우 민감함을 보여준다.

ABSTRACT

To detect and segment objects in images based on their content is one of the most active topics in the field of computer vision. Nowadays, this problem can be addressed using Deep Learning architectures such as Faster R-CNN or YOLO, among others. In this paper, we study the behaviour of different configurations of RetinaNet, Faster R-CNN and Mask R-CNN presented in Detectron2. First, we evaluate qualitatively and quantitatively (AP) the performance of the pre-trained models on KITTI-MOTS and MOTSChallenge datasets. We observe a significant improvement in performance after fine-tuning these models on the datasets of interest and optimizing hyperparameters. Finally, we run inference in unusual situations using out of context datasets, and present interesting results that help us understanding better the networks.

연구 동기 및 목표

  • 최신 인스턴스 세그멘테이션 모델인 RetinaNet, Faster R-CNN, Mask R-CNN의 자율주행 데이터셋에서의 성능 평가.
  • KITTI-MOTS 및 MOTSChallenge에 대한 토닝이 사전 훈련된 모델 대비 검출 및 세그멘테이션 정확도 향상에 미치는 영향 분석.
  • 학습률 스케줄러, 동결 스테이지, IoU 임계값, NMS 등 하이퍼파ram터 최적화가 모델 성능에 끼치는 영향 탐구.
  • 비정상적 또는 맥락 외 시나리오에서의 모델 행동을 탐색하여 네트워크가 실제로 학습하는 특징를 이해하는 것.

제안 방법

  • Detectron2를 사용해 KITTI-MOTS 및 MOTSChallenge 데이터셋에서 RetinaNet, Faster R-CNN, Mask R-CNN를 훈련 및 평가한다.
  • 도메인 특화 데이터셋에 대해 사전 훈련된 모델을 토닝함으로써 자율주행 환경에서의 성능 향상을 도모한다.
  • 핵심 하이퍼파ram터 최적화: One-Cycle 학습률 스케줄러 사용, ResNet 백본의 동결 스테이지 수 조정, 배경/전경 IoU 임계값 조정, NMS 임계값 테스트.
  • 맥락 외 데이터셋에 대한 정성적 추론을 수행해 모델의 강건성 및 희귀 또는 미사용 시나리오에서의 일반화 능력을 분석한다.
  • 교차 검증 분할에서 평균 평균 정밀도(mAP)를 사용해 성능를 정량화하며, 각 모델 및 설정 별 결과를 보고한다.
  • 모델 행동에 대한 영향을 평가하기 위해 COCO, Cityscapes, KITTI-MOTS, MOTSChallenge를 훈련 데이터 소스로 사용한다.

실험 결과

연구 질문

  • RQ1KITTI-MOTS 및 MOTSChallenge에 대한 토닝이 사전 훈련된 RetinaNet, Faster R-CNN, Mask R-CNN의 인스턴스 세그멘테이션 성능에 어떤 영향을 미치는가?
  • RQ2자율주행 데이터셋에서 Mask R-CNN에 최적의 하이퍼파ram터 설정(학습률 스케줄러, 동결 스테이지, IoU 임계값, NMS)은 무엇인가?
  • RQ3다양한 훈련 데이터 구성(예: COCO + KITTI-MOTS 대비 COCO + Cityscapes + MOTSChallenge)이 검출 정확도 및 일반화에 어떤 영향을 미치는가?
  • RQ4맥락 외 데이터셋에서 모델을 테스트함으로써 어떤 통찰을 얻을 수 있으며, 이는 네트워크의 진정된 인덕티브 바이어스를 어떻게 드러내는가?

주요 결과

  • KITTI-MOTS 및 MOTSChallenge 데이터셋에 대한 토닝은 모델 성능을 크게 향상시켰으며, 하이퍼파라미터 최적화 후 Mask R-CNN는 평균 마스크 mAP 60.54%를 달성했다.
  • One-Cycle 학습률 스케줄러는 훈련 반복 수를 60% 감소시키면서도 성능을 유지하거나 향상시켜, 훈련에 있어 최적의 선택으로 나타났다.
  • ResNet 백본의 두 스테이지를 동결할 경우 mAP가 가장 높은 46.80%를 기록했으며, 더 많은 스테이지를 동결할수록 성능이 악화되어 인덕티브 바이어스와 토닝 능력 사이의 트레이드오���이 존재함을 시사한다.
  • 기본 설정인 배경 IoU 임계값 0.3, 전경 IoU 임계값 0.7을 사용할 경우 mAP가 가장 높은 60.54%를 기록했으며, 기본값에서 벗어나면 성능이 저하되었다.
  • NMS 임계값을 0.7로 설정했을 때 mAP가 가장 높은 46.80%를 기록했으며, 0.9로 높일 경우 약간 향상된 47.34%를 기록해, 더 높은 겹침 임계값이 중복 검출을 통합하는 데 도움이 된다는 점을 시사한다.
  • 놀랍게도 MOTSChallenge 데이터셋(오직 보행자 애너테이션만 포함)을 포함시켰더니 복잡한 환경에서 차량 검출 성능이 향상되었으며, 이는 클래스에 종속되지 않거나 제한된 감독 데이터가 모델 일반화에 기여할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.