Skip to main content
QUICK REVIEW

[논문 리뷰] Road Damage Detection And Classification In Smartphone Captured Images Using Mask R-CNN

Janpreet Singh, Shashank Shekhar|arXiv (Cornell University)|2018. 11. 11.
Infrastructure Maintenance and Monitoring인용 수 15
한 줄 요약

이 논문은 스마트폰으로 촬영한 이미지에서 종단간 전처리로 도로 손상 감지 및 분류를 위해 Mask R-CNN을 사용하는 것을 제안한다. 개체 세분화와 객체 검출을 활용하여 실제 환경 조건에서도 높은 정확도를 달성한다. NVIDIA GeForce RTX 1080Ti에서 평균 F1 스코어는 50% IoU 기준 0.528이며, 이미지당 평균 추론 시간은 0.105초이다.

ABSTRACT

This paper summarizes the design, experiments and results of our solution to the Road Damage Detection and Classification Challenge held as part of the 2018 IEEE International Conference On Big Data Cup. Automatic detection and classification of damage in roads is an essential problem for multiple applications like maintenance and autonomous driving. We demonstrate that convolutional neural net based instance detection and classfication approaches can be used to solve this problem. In particular we show that Mask-RCNN, one of the state-of-the-art algorithms for object detection, localization and instance segmentation of natural images, can be used to perform this task in a fast manner with effective results. We achieve a mean F1 score of 0.528 at an IoU of 50% on the task of detection and classification of different types of damages in real-world road images acquired using a smartphone camera and our average inference time for each image is 0.105 seconds on an NVIDIA GeForce 1080Ti graphic card. The code and saved models for our approach can be found here : https://github.com/sshkhr/BigDataCup18 Submission

연구 동기 및 목표

  • 실제 스마트폰으로 촬영한 이미지에서 다양한 종류의 도로 손상을 감지하고 분류하는 데 도전 과제를 해결한다.
  • 도로 이미지에서 빛의 세기, 날씨 변화, 손상 유형 간 중첩 등 다양한 요인으로 인해 발생하는 어려움을 극복한다.
  • 저자원, 실제 환경 데이터셋에서 인스턴스 수준의 감지 및 분류에 대해 Mask R-CNN의 효과성을 입증한다.
  • 소비자용 GPU에 적합한 높은 추론 속도를 달성한다.
  • IEEE BigData 2018 커플 챌린지에서 제공한 기준화된 메트릭을 사용해 벤치마크 데이터셋에서 모델을 평가한다.

제안 방법

  • MS-COCO 데이터셋에서 미리 훈련된 Mask R-CNN 모델을 도로 손상 감지에 대해 Fine-tune 하며, ResNet-101-FPN 백본을 사용한다.
  • 제한된 데이터셋 크기로 인해 훈련 데이터의 다양성을 높이기 위해 수평 뒤집기 방식의 데이터 증강을 적용한다.
  • ImageNet 가중치로 사전 훈련된 가중치로 모델을 초기화하여 수렴성과 성능을 향상시킨다.
  • 두 단계 학습률 스케줄링을 통해 훈련을 최적화한다: 초기 학습률을 0.001로 설정하고, 매 2 에포크마다 10배 감소시킨다.
  • 동일한 클래스에 대한 중복 검출을 제거하기 위해 IoU 임계값 0.85를 사용한 비최대 억제(NMS)를 적용한다.
  • 50% IoU에서 평균 F1 스코어를 사용해 종단간 성능을 평가하며, 매칭 조건은 클래스 일치성과 IoU > 0.5를 기준으로 한다.

실험 결과

연구 질문

  • RQ1Mask R-CNN는 다양한 조명 조건과 시점에서 촬영된 스마트폰 이미지에서 다양한 종류의 도로 손상을 효과적으로 감지하고 분류할 수 있는가?
  • RQ2데이터 증강과 전이 학습은 작은 실세계 도로 손상 데이터셋에서 성능을 어떻게 향상시키는가?
  • RQ3소비자용 GPU에서 Mask R-CNN의 추론 속도는 실시간 배포에 적합한가?
  • RQ4DeepLabV3나 U-Net을 사용해 도로를 사전에 세분화하면 이 데이터셋에서 감지 성능이 향상되는가?
  • RQ5모델은 중첩되거나 가까이 붙어 있는 손상 인스턴스에서 어떻게 성능을 내는가?

주요 결과

  • 제안된 Mask R-CNN 모델은 테스트 세트에서 50% IoU 기준 평균 F1 스코어 0.528을 기록하여 강력한 감지 및 분류 성능을 입증했다.
  • NVIDIA GeForce RTX 1080Ti에서 이미지당 평균 추론 시간은 0.105초였으며, 실시간 응용에 적합함을 시사한다.
  • RTX 1080Ti에서 1,813장의 테스트 이미지에 대해 총 추론 시간은 3분 11초였고, GTX 1050Ti에서는 8분 38초였다.
  • CamVid에서의 도로 세분화를 위한 DeepLabV3 또는 U-Net을 사용한 두 단계 접근 방식은 타겟 데이터셋과의 분야 이탈이 심해 성능 향상에 기여하지 못했다.
  • 매 2 에포크마다 학습률을 10배 감소시키는 학습률 안내(annealing) 전략이 테스트된 설정 중에서 가장 우수한 성능을 보였다.
  • IoU 임계값 0.85를 사용한 후처리가 중복 검출을 효과적으로 줄였으며, 전체 정확도는 저하되지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.